數位聲音的地基:取樣率、位元深度與聲道

CD 音訊的標準為什麼是 44.1kHz / 16-bit?96kHz / 24-bit 的「高解析音訊」到底是真有用還是噱頭?

CD 音訊的標準是 44.1kHz 取樣率、16-bit 位元深度、雙聲道立體聲。為什麼是這些數字,不是別的?「高解析度音訊」宣傳的 96kHz / 24-bit 到底有沒有意義?為什麼語音錄音存 48kHz 完全沒必要?答案藏在數位音訊的三個基礎參數裡——它們共同決定了數位聲音的天花板和代價。

從類比到數位:取樣與量化的兩步

取樣的兩個維度:取樣率決定時間精度,位元深度決定振幅精度

電腦無法直接儲存連續的聲波。把聲音從類比訊號變為數位訊號需要兩步:

  1. 取樣(Sampling):以固定的時間間隔測量聲波的幅度,把連續的時間軸變為離散的樣本序列;
  2. 量化(Quantization):用有限精度的數字表示每個樣本的幅度值。

取樣率和位元深度分別對應這兩步的精度。

取樣率:每秒鐘測量多少次

取樣率(Sampling Rate) 指每秒鐘採集多少聲音樣本,單位是 Hz 或 kHz。

奈奎斯特-香農取樣定理

數位音訊最底層的物理定律:為了無損地恢復一個連續訊號,取樣率必須至少是該訊號最高頻率的兩倍。

人耳理論上能聽到的頻率範圍是 20 Hz - 20 kHz(隨年齡和聽力狀況遞減),因此要完整記錄人耳能聽到的全部聲音,取樣率至少應為 20 kHz × 2 = 40 kHz。這解釋了為什麼 CD 取樣率被定為 44.1 kHz——比 40 kHz 多留了一點餘量,並且與當時視頻設備的時鐘頻率兼容。

常見取樣率速查:

取樣率可記錄的頻率上限典型用途
8 kHz約 4 kHz電話語音
16 kHz約 8 kHz寬頻語音(VoIP、語音辨識)
22.05 kHz約 11 kHz低位元率 AM 廣播級音訊
44.1 kHz約 22 kHzCD 音訊、音樂分發
48 kHz約 24 kHz電影、視頻製作配樂(行業標準)
96 kHz約 48 kHz高解析度音訊、專業錄音
192 kHz約 96 kHz極高解析度錄音(超聲波錄音)

超過 44.1 kHz 有意義嗎

就人類聽覺回放而言,44.1 kHz 已經能覆蓋全部聽覺範圍。48 kHz 額外多出的頻寬主要是為了方便視頻製作(與 24/48fps 幀率對齊)和在 DSP 處理(濾波器設計)中留出餘量。96 kHz 和 192 kHz 對回放來說人耳聽不出與 44.1 kHz 的差異——但對於錄音和製作環節有意義:更高的取樣率在後期編輯時提供了更大的時間精度,且降取樣到 44.1/48 kHz 時的抗混疊濾波器設計更容易。

一個經常被忽略的現實:大多數消費者根本區分不出 44.1 kHz 與 96 kHz。盲聽實驗中,聽眾對兩者正確辨別率接近隨機猜測。

位元深度:每次測量用多少格

位元深度(Bit Depth) 決定每個樣本的幅度精度——用多少位元來表示一個取樣點的电平值。

位元深度直接決定了動態範圍——一個數位音訊系統能記錄的最安靜與最響亮聲音之間的差值。動態範圍的理論近似值:

動態範圍 (dB) ≈ 位元深度 × 6.02 + 1.76

常見位元深度速查:

位元深度動態範圍訊噪比使用場景
8-bit約 48 dB類似磁帶老式遊戲機、低品質語音
16-bit約 96 dB優秀CD 音訊、標準分發
24-bit約 144 dB極佳錄音、製作、存檔
32-bit float約 1528 dB (理論上)無敵以受控浮點數編碼,後期安全餘量極大

16-bit 能覆蓋 96 dB 的動態範圍,而典型音樂節目的動態範圍在 40-60 dB,所以 16-bit 對回放來說是足夠的。但錄音必須用 24-bit,原因在於餘量(Headroom):24-bit 的 144 dB 動態範圍意味著不需要在錄音時把增益調得太精確——不用擔心訊號太小被量化噪聲淹沒,也不怕意外峰值削波。這是專業錄音行業的一條鐵律。

32-bit float 進一步把餘量推到極致:記錄的不是量化的整數值,而是浮點數,因此只要不削波就沒有噪聲問題,在後期可以隨意調整增益。越來越多的錄音機支援 32-bit float 錄製,讓現場調增益幾乎變成多餘的步驟。

聲道布局:聲音從哪裡來

聲道(Channel) 描述錄音或回放時聲音的空間分布,聲道數越多,對聽音環境的沉浸感要求越高。

布局聲道數典型場景
單聲道(Mono)1語音錄音、播客、電話
立體聲(Stereo)2音樂、電視、一般視頻
5.1 環繞聲6家庭劇院、電影
7.1 環繞聲8高端影音
7.1.4 / 杜比全景聲12+沉浸式音訊

立體聲到環繞聲的聲道數遞增意味著檔案體積線性增長——一部 5.1 電影的音軌資料量是立體聲的 3 倍(但編碼後的差異通常由於壓縮而縮小)。

三者的組合:檔案大小公式

數位音訊的未壓縮資料量可以精確計算:

每秒資料量 (KB/s) = 取樣率 (kHz) × 位元深度 (位元) × 聲道數 ÷ 8

一些參考值:

格式配置每分鐘資料量
44.1 kHz / 16-bit / 立體聲 (CD)約 10.6 MB
48 kHz / 24-bit / 立體聲約 17.3 MB
48 kHz / 24-bit / 5.1 聲道約 51.8 MB
96 kHz / 24-bit / 立體聲約 34.6 MB

上面是未壓縮的資料量。實際儲存時 FLAC 或 ALAC 等無損格式可以把體積壓縮到 50-70%,有損格式(MP3、AAC、Opus)則可以壓到 5-20% 甚至更低,代價是不可逆的資訊損失(詳見本系列《有損與無損》)。

取樣率轉換與位元深度調整

取樣率轉換(SRC)

把音訊從一種取樣率變到另一種(如 96→44.1 kHz),在數位域透過內插完成。SRC 的品質取決於算法——好的 SRC 算法在降取樣前會做抗混疊濾波、在使用合理內插階數,引入的失真極小;粗糙的 SRC 算法則可能留下高頻噪聲或模糊。專業音訊軟體通常使用高品質的 SRC 算法(如 SoX、r8brain),消費級硬體中的 SRC 晶片有時品質一般。

位元深度調整

  • 升位元深度(16-bit → 24-bit):無損但無增益——增加的位元只是用零填充,不會憑空增加動態範圍。相當於把一張小照片放到大相框裡,相框變大了但照片本身沒變。
  • 降位元深度(24-bit → 16-bit):有損失——24-bit 記錄的細微噪聲可能被截斷為靜音,最末端的 8 個位元被捨棄。專業流程在降位元深度時會施加抖晃(Dither):在丟棄低位之前加入微量的噪聲,讓量化誤差轉化為隨機的背景噪聲而非可聞的失真。

常見誤區

  1. 「取樣率越高音質越好」:在回放環節,44.1 kHz 已覆蓋全聽覺範圍。更高取樣率對人耳聽感的改善幾乎不可測。
  2. 「16-bit 就夠,錄音也用 16-bit」:16-bit 回放夠用,但錄音不夠——餘量太少,無法容忍增益偏差。錄音標準是 24-bit。
  3. 「24-bit 轉 16-bit 就是直接丟棄 8-bit 資料」:專業人士使用 Dither 來讓這個過程更無害化。不加 Dither 的直接截斷會產生可聞的量化失真。
  4. 「48 kHz 的音訊比 44.1 kHz 的更清晰」:清晰度主要來自頻響和動態,而不是微小的取樣率差異。48 kHz 對視頻製作的便利大於對聽感的提升。
  5. 「單聲道就是一半立體聲」:單聲道不僅僅是「半個立體聲」。混音時將立體聲素材強制合併為單聲道會引起相位抵消——這在創建單聲道版本時是一個需要審慎的操作。

實用建議

  • 錄音用 48 kHz / 24-bit:兼顧品質與兼容性的黃金標準。與視頻製作對齊、後期餘量充足。
  • 分發用 44.1 kHz / 16-bit:CD 標準,所有平台無差別接受。
  • 語音獨白內容:16 kHz 或 22.05 kHz 已足夠,不必用 48 kHz 浪費儲存和頻寬。
  • 製作 5.1 音訊:保持與視頻相同的取樣率(通常 48 kHz),所有聲道參數統一。
  • 音樂存檔用 48 kHz / 24-bit 或更高:保留未來重新製作的空間,分發時再降取樣為 CD 規格。
  • 不要盲目追高取樣率:96/192 kHz 的高解析度音訊在消費者回放環境中的收益微乎其微,生產環境中 48 kHz 已能滿足絕大多數需求。

相關閱讀

本站的音訊轉換工具會顯示來源檔案的取樣率、位元深度和聲道數——讀完本文,你應該能看懂這些參數的含義,也知道如何為不同場景選擇合適的配置了。

相關工具