音訊特徵提取(Audio Feature Extraction)是什麼?

從原始音訊訊號中自動計算或學習具有代表性的低維特徵向量,用於後續機器學習任務。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Audio Feature Extraction
主題標籤
訊號處理、音訊分析、深度學習
考點定位
非 iPAS 核心術語
最後更新
2026/06/23
音訊特徵提取(Audio Feature Extraction)是什麼? 訊號處理音訊分析
術語快查

搜尋意圖: 如果你在找「音訊特徵提取 是什麼」或「音訊特徵提取 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 從原始音訊訊號中自動計算或學習具有代表性的低維特徵向量,用於後續機器學習任務。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

從原始音訊訊號中自動計算或學習具有代表性的低維特徵向量,用於後續機器學習任務。

音訊特徵提取(Audio Feature Extraction)是連接原始物理訊號與機器學習演算法之間的橋樑。好的特徵應該低維、高效、能保留任務相關訊息同時去除無關變異。

音訊訊號的基本性質

  • 採樣率(Sample Rate):每秒採樣次數,通常 16-48 kHz 語音、44.1-192 kHz 音樂。
  • 樣本位深(Bit Depth):每個樣本的位元數,通常 16 或 24 bit。
  • 通道數:單聲道、立體聲、多通道。
  • 訊噪比(SNR):信號與背景雜音的相對強度。

傳統手工設計特徵

  1. 梅爾倒譜係數(MFCC)

    • 過程:波形 → 分幀 → FFT → 梅爾濾波 → 對數 → DCT → MFCC
    • 維度:通常 13-39(13 個靜態係數 + delta + delta-delta)
    • 優點:緊湊、計算快、適合傳統分類器(GMM、SVM)。
    • 缺點:DCT 可能丟失時頻細節,且對雜訊敏感。
    • 應用:語音辨識(特別是傳統 GMM-HMM)、說話者驗證。
  2. 梅爾頻譜(Mel-Spectrogram)

    • 過程:波形 → 分幀 → FFT → 梅爾濾波 → 對數能量
    • 維度:通常 64-128
    • 優點:保留時頻結構,神經網路易於學習;視覺化直觀。
    • 缺點:維度高於 MFCC,計算稍費時。
    • 應用:現代深度學習系統(ASR、音樂分類、聲場分析)的主流輸入。
  3. 色彩頻譜(Chroma Features)

    • 過程:FFT 後按半音(semitone)聚集能量為 12 維(C, C#, ..., B)。
    • 優點:對音樂應用具有高度的語義相關性(和弦、旋律)。
    • 應用:和弦識別、音樂相似度、音樂轉錄。
  4. 光譜質心、頻譜滾降、過零率等

    • 光譜質心(Spectral Centroid):頻譜的加權平均頻率,反映音色亮度。
    • 頻譜滾降(Spectral Rolloff):能量的 95% 集中在其以下的頻率。
    • 過零率(Zero Crossing Rate):波形通過零軸的次數,與音色粗糙度相關。
    • 應用:音樂流派分類、樂器識別。
  5. 臨時特徵(Temporal Features)

    • 能量、根平方值(RMS)、短時能量。
    • 應用:語音/非語音檢測、音量標準化。

梅爾刻度與人耳感知的對應

人耳對頻率的感知非線性:低頻的小變化容易被察覺,高頻的大變化才能被察覺。梅爾刻度(Mel Scale)模擬這一非線性特性: 梅爾頻率 = 2595 × log₁₀(1 + f/700) 其中 f 是物理頻率(Hz)。梅爾濾波組按梅爾刻度均勻分布,使神經網路更好地學習人耳相關特徵。

自監督預訓練表示(Self-Supervised Audio Representations)

  1. Wav2Vec 系列(Meta)

    • Wav2Vec 2.0:在原始波形上進行對比預訓練,聚類學習離散音素標籤。
    • 方法:遮罩輸入波形的若干時間塊,預測遮罩位置的隱層表示,同時推避干擾樣本。
    • 優勢:無需任何標注,生成的表示具有很強的音素級別結構。
    • 應用:低資源語言 ASR、說話者識別。
  2. HuBERT(Meta)

    • 過程:迭代式 k-means 聚類 → 語言建模目標。
    • 特點:更直接地學習人類可理解的音素級別標籤。
    • 優勢:表示易於解釋,多語言轉移效果好。
  3. Whisper(OpenAI)

    • 大規模多語言、多任務預訓練(ASR、翻譯、語言識別)。
    • 生成的表示既有聲學資訊又融合語言理解。
  4. 音樂特定的預訓練表示

    • MULE、Jukebox 等針對音樂音訊的預訓練模型。
    • 捕捉樂器、和弦、節奏等音樂特有的特徵。

多尺度與多域特徵

實際應用中,單一特徵可能不足,常採用:

  • 多尺度特徵:同時提取不同時間尺度的特徵(短期 + 中期 + 長期)。
  • 多域特徵:時域、頻域、倒譜域特徵組合。
  • 空間特徵(多麥克風):方向、擴散度、環境幾何等。

特徵標準化與前處理

  • 均值標準化(Standardization):減去均值、除以標準差。
  • Whitening:消除特徵間的相關性(PCA)。
  • 對數縮放:壓縮大動態範圍。
  • 倒譜提升(Cepstral Lifting):強調不同頻率帶的重要性。

特徵提取與任務相關性

最優特徵取決於下游任務:

  • 語音辨識:Mel-Spectrogram 或 MFCC(傳統),或原始波形(深度學習)。
  • 語音者識別:i-vector、x-vector(深層神經網路提取的說話者特徵)。
  • 音樂流派分類:梅爾頻譜、MFCC、色彩特徵的組合。
  • 聲音事件檢測:梅爾頻譜、可能加上時間導數。
  • 音樂轉錄:色彩特徵、恆Q變換(CQT)。

計算效率與邊緣部署

傳統特徵(MFCC)計算複雜度 O(n log n),適合邊緣設備;神經網路特徵提取需要運行推論,計算量更大但可用量化與蒸馏加速。

開源工具與函式庫

  • Librosa(Python):最廣泛使用的音訊分析函式庫,支援多種特徵。
  • TorchAudio(PyTorch):與 PyTorch 深度整合,支援預訓練模型。
  • Essentia(C++/Python):音樂資訊檢索特化,特徵豐富。
  • Hugging Face Transformers:預訓練音訊模型與特徵提取器。

常見問題

為什麼要對聲學特徵取對數(log)?

對數變換有幾個好處:一、人耳對聲強的感知呈對數關係(分貝刻度),對數特徵更符合人類感知;二、音訊信號的動態範圍很大(0 到 1 以上),對數可以壓縮範圍,使神經網路更好地學習;三、對數變換會減輕極端值的影響,讓特徵分布更正常。缺點是對數無法處理零值(需要加一個小常數避免 log(0))。

Mel-Spectrogram 和線性頻譜有什麼區別?

線性頻譜是原始 FFT 的輸出,頻率軸線性均勻分布。Mel-Spectrogram 將頻率軸轉換為梅爾刻度,低頻區間更密集,高頻區間更稀疏,模擬人耳的非線性頻率感知。對神經網路來說,Mel-Spectrogram 更「友善」,因為它強調了人類敏感的低頻區域,減弱了高頻雜訊的影響。但若任務需要精細的高頻信息(如樂器識別中的諧波分析),線性頻譜可能更好。

自監督預訓練表示(如 Wav2Vec)相比傳統特徵有什麼優勢?

傳統特徵(MFCC、Mel-Spectrogram)是人工設計,包含了對「聲學什麼重要」的先驗假設,但這些假設可能不適用於所有任務。Wav2Vec2.0 這類預訓練表示是在大規模未標注語音上自動學習的,無需人工設計,自動發現任務相關的表示。此外,預訓練表示可直接遷移到多種下游任務(ASR、聲者識別、語言識別),避免了為每個任務單獨調整特徵。缺點是預訓練計算成本高,且預訓練與微調任務相差太大時可能效果下降。