聲學建模 是什麼?

Acoustic Modeling:聲學建模 的完整解釋

在語音識別、語音合成等任務中,建立音訊特徵與語言單位(音素、詞彙)對應關係的機器學習模型。

聲學建模(Acoustic Modeling)是語音訊號處理中最重要的核心環節,橋接音訊訊號(物理層)與語言元素(符號層)。隨著深度學習興起,聲學建模經歷了從統計模型到神經網路的根本性轉變。

聲學建模的基本任務

給定音訊訊號 x(通常表示為時頻特徵序列 x₁, x₂, ..., xₜ),聲學模型學習條件概率分布 P(y|x),其中 y 是對應的語言標籤序列(音素序列、詞彙序列、字元序列等)。

輸入特徵:從波形到特徵向量

原始音訊波形直接輸入神經網路效率低且難以訓練。通常先將波形轉換為固定維度的聲學特徵:

  1. 梅爾頻譜倒譜係數(MFCC)

    • 過程:波形 → FFT → 梅爾濾波 → 對數能量 → DCT(離散余弦變換)→ MFCC(通常 13-39 維)
    • 優點:維度低、計算快速、對人耳感知的建模良好、傳統方法之標準。
    • 缺點:DCT 可能丟失時頻細節,近年有所淘汰。
  2. 梅爾頻譜(Mel-Spectrogram)

    • 過程:波形 → FFT → 梅爾濾波 → 對數能量 → Mel-Spectrogram(通常 64-128 維)
    • 優點:保留更多時頻細節,適合神經網路自動特徵提取。
    • 缺點:維度稍高,但對現代 GPU 不成問題。
    • 近年已成為深度學習聲學建模的標準輸入。
  3. 其他特徵

    • 線性頻譜(Linear Spectrogram):未經梅爾轉換的原始頻譜。
    • 倒譜特徵(Cepstral Features):更進一步的變換,強調諧波成分。
    • 預訓練表示(Wav2Vec2、HuBERT):深度神經網路在無標注語音上預訓練得到的隱層表示,融合了聲學與語言資訊。

傳統聲學模型:GMM-HMM

在深度學習興起前(~2011 年),GMM-HMM 是語音辨識的業界標準:

  • HMM(隱馬可夫模型)建模語言序列結構(狀態遷移機率)。
  • GMM(高斯混合模型)為每個 HMM 狀態建模聲學特徵分布。
  • 訓練:期望最大化(EM)演算法迭代優化。
  • 優點:理論基礎紮實,可解釋性強。
  • 缺點:特徵提取與模型學習分離,無法端到端優化;對長程相依性建模能力有限。

深度神經網路聲學模型的革新

從 2011 年開始,研究人員發現用深度神經網路替換 GMM 以建模 HMM 狀態輸出分布(稱為混合 DNN-HMM),大幅提升辨識精度。隨後演進為:

  1. 卷積神經網路(CNN)

    • 利用卷積層捕捉局部時頻模式(如頻率帶的相關性)。
    • VGGNet、ResNet 等架構的聲學版本。
    • 優勢:參數少、訓練快速、對時頻變化的不變性好。
  2. 循環神經網路(RNN, LSTM, GRU)

    • 透過遞迴單元捕捉長程時序相依性。
    • 雙向 LSTM(BiLSTM)可同時利用前向與後向文脈。
    • 優勢:對序列建模能力強,能捕捉音素的音韻上下文效應。
  3. Transformer 與自注意力

    • 自注意力機制讓模型同時關注序列中所有位置,無需遞迴。
    • 並列計算效率高,易於擴展到大型模型。
    • 缺點:注意力矩陣記憶體成本隨序列長度平方增長,長音訊需要特殊設計(相對位置編碼、局部注意力)。
  4. Conformer 與混合架構

    • 結合卷積的局部模式提取與 Transformer 的全局建模。
    • 在多語言語音辨識基準上達通常效果,成為 2021 年後的新標準。

從監督到自監督的轉變

現代聲學建模的新趨勢是自監督學習(Self-Supervised Learning):

  • Wav2Vec2.0(Meta/Facebook):在未標注語音上進行對比學習,聚類學習音素級別的表示。
  • HuBERT(Meta):疊代式聚類與語言建模相結合,得到人類可理解的音素級表示。
  • 優勢:減少標注需求,模型在少樣本或跨語言情景下表現優異。

輸出層設計與訓練目標

聲學模型的輸出層取決於問題定義:

  1. 狀態級輸出(HMM 狀態):輸出 HMM 各狀態的機率分布,需配合 HMM 解碼。
  2. 音素級輸出:直接分類音素,後續需語言模型消歧詞彙。
  3. 序列級輸出(CTC, Attention):直接輸出文字或音素序列,無需外部 HMM。

訓練目標函數包括:

  • 交叉熵損失(分類)
  • CTC 損失(不需對齊)
  • 注意力損失(需對齊標籤)

多麥克風與鯨魚音訊處理

實際應用中音訊往往來自多個麥克風或含有背景雜音:

  • 多麥克風陣列(Microphone Array):利用空間相位資訊進行波束成形(beamforming)強化目標聲音。
  • 聲學特徵增強:雜音抑制、迴聲消除作為前置處理。
  • 聲學建模的魯健性:訓練時混入合成雜音(資料增強),或用多個雜音環境訓練。

評估與部署

  • 評估指標:字錯誤率(CER)或詞錯誤率(WER)。
  • 模型壓縮:知識蒸馏(KD)、量化以支援邊緣設備。
  • 持續學習與適應:應對資料漂移,線上微調或適應層。

常見問題