音訊特徵提取 是什麼?
Audio Feature Extraction:音訊特徵提取 的完整解釋
從原始音訊訊號中自動計算或學習具有代表性的低維特徵向量,用於後續機器學習任務。
音訊特徵提取(Audio Feature Extraction)是連接原始物理訊號與機器學習演算法之間的橋樑。好的特徵應該低維、高效、能保留任務相關訊息同時去除無關變異。
音訊訊號的基本性質
- 採樣率(Sample Rate):每秒採樣次數,通常 16-48 kHz 語音、44.1-192 kHz 音樂。
- 樣本位深(Bit Depth):每個樣本的位元數,通常 16 或 24 bit。
- 通道數:單聲道、立體聲、多通道。
- 訊噪比(SNR):信號與背景雜音的相對強度。
傳統手工設計特徵
梅爾倒譜係數(MFCC)
- 過程:波形 → 分幀 → FFT → 梅爾濾波 → 對數 → DCT → MFCC
- 維度:通常 13-39(13 個靜態係數 + delta + delta-delta)
- 優點:緊湊、計算快、適合傳統分類器(GMM、SVM)。
- 缺點:DCT 可能丟失時頻細節,且對雜訊敏感。
- 應用:語音辨識(特別是傳統 GMM-HMM)、說話者驗證。
梅爾頻譜(Mel-Spectrogram)
- 過程:波形 → 分幀 → FFT → 梅爾濾波 → 對數能量
- 維度:通常 64-128
- 優點:保留時頻結構,神經網路易於學習;視覺化直觀。
- 缺點:維度高於 MFCC,計算稍費時。
- 應用:現代深度學習系統(ASR、音樂分類、聲場分析)的主流輸入。
色彩頻譜(Chroma Features)
- 過程:FFT 後按半音(semitone)聚集能量為 12 維(C, C#, ..., B)。
- 優點:對音樂應用具有高度的語義相關性(和弦、旋律)。
- 應用:和弦識別、音樂相似度、音樂轉錄。
光譜質心、頻譜滾降、過零率等
- 光譜質心(Spectral Centroid):頻譜的加權平均頻率,反映音色亮度。
- 頻譜滾降(Spectral Rolloff):能量的 95% 集中在其以下的頻率。
- 過零率(Zero Crossing Rate):波形通過零軸的次數,與音色粗糙度相關。
- 應用:音樂流派分類、樂器識別。
臨時特徵(Temporal Features)
- 能量、根平方值(RMS)、短時能量。
- 應用:語音/非語音檢測、音量標準化。
梅爾刻度與人耳感知的對應
人耳對頻率的感知非線性:低頻的小變化容易被察覺,高頻的大變化才能被察覺。梅爾刻度(Mel Scale)模擬這一非線性特性: 梅爾頻率 = 2595 × log₁₀(1 + f/700) 其中 f 是物理頻率(Hz)。梅爾濾波組按梅爾刻度均勻分布,使神經網路更好地學習人耳相關特徵。
自監督預訓練表示(Self-Supervised Audio Representations)
Wav2Vec 系列(Meta)
- Wav2Vec 2.0:在原始波形上進行對比預訓練,聚類學習離散音素標籤。
- 方法:遮罩輸入波形的若干時間塊,預測遮罩位置的隱層表示,同時推避干擾樣本。
- 優勢:無需任何標注,生成的表示具有很強的音素級別結構。
- 應用:低資源語言 ASR、說話者識別。
HuBERT(Meta)
- 過程:迭代式 k-means 聚類 → 語言建模目標。
- 特點:更直接地學習人類可理解的音素級別標籤。
- 優勢:表示易於解釋,多語言轉移效果好。
Whisper(OpenAI)
- 大規模多語言、多任務預訓練(ASR、翻譯、語言識別)。
- 生成的表示既有聲學資訊又融合語言理解。
音樂特定的預訓練表示
- MULE、Jukebox 等針對音樂音訊的預訓練模型。
- 捕捉樂器、和弦、節奏等音樂特有的特徵。
多尺度與多域特徵
實際應用中,單一特徵可能不足,常採用:
- 多尺度特徵:同時提取不同時間尺度的特徵(短期 + 中期 + 長期)。
- 多域特徵:時域、頻域、倒譜域特徵組合。
- 空間特徵(多麥克風):方向、擴散度、環境幾何等。
特徵標準化與前處理
- 均值標準化(Standardization):減去均值、除以標準差。
- Whitening:消除特徵間的相關性(PCA)。
- 對數縮放:壓縮大動態範圍。
- 倒譜提升(Cepstral Lifting):強調不同頻率帶的重要性。
特徵提取與任務相關性
最優特徵取決於下游任務:
- 語音辨識:Mel-Spectrogram 或 MFCC(傳統),或原始波形(深度學習)。
- 語音者識別:i-vector、x-vector(深層神經網路提取的說話者特徵)。
- 音樂流派分類:梅爾頻譜、MFCC、色彩特徵的組合。
- 聲音事件檢測:梅爾頻譜、可能加上時間導數。
- 音樂轉錄:色彩特徵、恆Q變換(CQT)。
計算效率與邊緣部署
傳統特徵(MFCC)計算複雜度 O(n log n),適合邊緣設備;神經網路特徵提取需要運行推論,計算量更大但可用量化與蒸馏加速。
開源工具與函式庫
- Librosa(Python):最廣泛使用的音訊分析函式庫,支援多種特徵。
- TorchAudio(PyTorch):與 PyTorch 深度整合,支援預訓練模型。
- Essentia(C++/Python):音樂資訊檢索特化,特徵豐富。
- Hugging Face Transformers:預訓練音訊模型與特徵提取器。