聲學建模(Acoustic Modeling)是什麼?

在語音識別、語音合成等任務中,建立音訊特徵與語言單位(音素、詞彙)對應關係的機器學習模型。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Acoustic Modeling
主題標籤
聲學建模、深度學習、訊號處理
考點定位
非 iPAS 核心術語
最後更新
2026/06/23
聲學建模(Acoustic Modeling)是什麼? 聲學建模深度學習
術語快查

搜尋意圖: 如果你在找「聲學建模 是什麼」或「聲學建模 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 在語音識別、語音合成等任務中,建立音訊特徵與語言單位(音素、詞彙)對應關係的機器學習模型。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

在語音識別、語音合成等任務中,建立音訊特徵與語言單位(音素、詞彙)對應關係的機器學習模型。

聲學建模(Acoustic Modeling)是語音訊號處理中最重要的核心環節,橋接音訊訊號(物理層)與語言元素(符號層)。隨著深度學習興起,聲學建模經歷了從統計模型到神經網路的根本性轉變。

聲學建模的基本任務

給定音訊訊號 x(通常表示為時頻特徵序列 x₁, x₂, ..., xₜ),聲學模型學習條件概率分布 P(y|x),其中 y 是對應的語言標籤序列(音素序列、詞彙序列、字元序列等)。

輸入特徵:從波形到特徵向量

原始音訊波形直接輸入神經網路效率低且難以訓練。通常先將波形轉換為固定維度的聲學特徵:

  1. 梅爾頻譜倒譜係數(MFCC)

    • 過程:波形 → FFT → 梅爾濾波 → 對數能量 → DCT(離散余弦變換)→ MFCC(通常 13-39 維)
    • 優點:維度低、計算快速、對人耳感知的建模良好、傳統方法之標準。
    • 缺點:DCT 可能丟失時頻細節,近年有所淘汰。
  2. 梅爾頻譜(Mel-Spectrogram)

    • 過程:波形 → FFT → 梅爾濾波 → 對數能量 → Mel-Spectrogram(通常 64-128 維)
    • 優點:保留更多時頻細節,適合神經網路自動特徵提取。
    • 缺點:維度稍高,但對現代 GPU 不成問題。
    • 近年已成為深度學習聲學建模的標準輸入。
  3. 其他特徵

    • 線性頻譜(Linear Spectrogram):未經梅爾轉換的原始頻譜。
    • 倒譜特徵(Cepstral Features):更進一步的變換,強調諧波成分。
    • 預訓練表示(Wav2Vec2、HuBERT):深度神經網路在無標注語音上預訓練得到的隱層表示,融合了聲學與語言資訊。

傳統聲學模型:GMM-HMM

在深度學習興起前(~2011 年),GMM-HMM 是語音辨識的業界標準:

  • HMM(隱馬可夫模型)建模語言序列結構(狀態遷移機率)。
  • GMM(高斯混合模型)為每個 HMM 狀態建模聲學特徵分布。
  • 訓練:期望最大化(EM)演算法迭代優化。
  • 優點:理論基礎紮實,可解釋性強。
  • 缺點:特徵提取與模型學習分離,無法端到端優化;對長程相依性建模能力有限。

深度神經網路聲學模型的革新

從 2011 年開始,研究人員發現用深度神經網路替換 GMM 以建模 HMM 狀態輸出分布(稱為混合 DNN-HMM),大幅提升辨識精度。隨後演進為:

  1. 卷積神經網路(CNN)

    • 利用卷積層捕捉局部時頻模式(如頻率帶的相關性)。
    • VGGNet、ResNet 等架構的聲學版本。
    • 優勢:參數少、訓練快速、對時頻變化的不變性好。
  2. 循環神經網路(RNN, LSTM, GRU)

    • 透過遞迴單元捕捉長程時序相依性。
    • 雙向 LSTM(BiLSTM)可同時利用前向與後向文脈。
    • 優勢:對序列建模能力強,能捕捉音素的音韻上下文效應。
  3. Transformer 與自注意力

    • 自注意力機制讓模型同時關注序列中所有位置,無需遞迴。
    • 並列計算效率高,易於擴展到大型模型。
    • 缺點:注意力矩陣記憶體成本隨序列長度平方增長,長音訊需要特殊設計(相對位置編碼、局部注意力)。
  4. Conformer 與混合架構

    • 結合卷積的局部模式提取與 Transformer 的全局建模。
    • 在多語言語音辨識基準上達通常效果,成為 2021 年後的新標準。

從監督到自監督的轉變

現代聲學建模的新趨勢是自監督學習(Self-Supervised Learning):

  • Wav2Vec2.0(Meta/Facebook):在未標注語音上進行對比學習,聚類學習音素級別的表示。
  • HuBERT(Meta):疊代式聚類與語言建模相結合,得到人類可理解的音素級表示。
  • 優勢:減少標注需求,模型在少樣本或跨語言情景下表現優異。

輸出層設計與訓練目標

聲學模型的輸出層取決於問題定義:

  1. 狀態級輸出(HMM 狀態):輸出 HMM 各狀態的機率分布,需配合 HMM 解碼。
  2. 音素級輸出:直接分類音素,後續需語言模型消歧詞彙。
  3. 序列級輸出(CTC, Attention):直接輸出文字或音素序列,無需外部 HMM。

訓練目標函數包括:

  • 交叉熵損失(分類)
  • CTC 損失(不需對齊)
  • 注意力損失(需對齊標籤)

多麥克風與鯨魚音訊處理

實際應用中音訊往往來自多個麥克風或含有背景雜音:

  • 多麥克風陣列(Microphone Array):利用空間相位資訊進行波束成形(beamforming)強化目標聲音。
  • 聲學特徵增強:雜音抑制、迴聲消除作為前置處理。
  • 聲學建模的魯健性:訓練時混入合成雜音(資料增強),或用多個雜音環境訓練。

評估與部署

  • 評估指標:字錯誤率(CER)或詞錯誤率(WER)。
  • 模型壓縮:知識蒸馏(KD)、量化以支援邊緣設備。
  • 持續學習與適應:應對資料漂移,線上微調或適應層。

常見問題

為什麼需要將原始波形轉換成梅爾頻譜,而不直接用波形訓練?

原始波形有幾個問題:一、樣本率高(44.1k-48kHz)導致序列極長,計算與記憶體成本高;二、相鄰樣本高度相關,神經網路難以有效學習獨立特徵;三、人耳對音訊的感知是非線性的(梅爾刻度近似人耳頻率感知),直接在頻域處理更符合認知。梅爾頻譜將波形轉換為 64-128 維的時頻表示,維度大幅縮小,時間跨度也加大(通常 10ms 一幀),神經網路訓練效率大幅提升。現代方法也有直接在波形上操作的(原始波形輸入模型),但通常在前幾層加卷積進行局部下採樣。

聲學建模中的 HMM 為什麼還有用,既然有深度神經網路?

HMM 在傳統混合 DNN-HMM 系統中仍有價值,因為它顯式建模語言的序列結構(例如音素的強制對齐、跨越多幀的狀態遷移)。純深度神經網路(如端到端的 CTC)可直接預測序列,但訓練資料或對齐標籤充足時,DNN-HMM 混合系統通常更穩健。此外 HMM 的解碼過程(維特比演算法)數學清晰、可解釋性強,對某些應用(如強制對齐、實時漸進輸出)更有利。現在是 DNN-HMM 與端到端模型並存的時代,選擇取決於應用場景與資料條件。

Conformer 相比 Transformer 為什麼在語音上效果更好?

語音訊號具有強烈的局部結構(相鄰時間幀的聲學特徵高度相關),同時也有全局韻律與語言依賴(遠距離音素的共現關係)。Conformer 的設計正針對此:卷積模塊捕捉局部時頻模式(低計算成本),Transformer 模塊捕捉全局相依性(允許任意時間點對之間的注意力)。這種混合在語音辨識基準上的表現超越純 Transformer 或純卷積模型,同時計算成本更低。簡單說,Transformer 對語音「看得太寬」(全局),Conformer 則「既看局部也看全局」,更符合語音的物理性質。