自動語音辨識 是什麼?
ASR (Automatic Speech Recognition):自動語音辨識 的完整解釋
將人類口語音頻訊號自動轉換為文字的技術,是語音 AI 的基礎元件,廣泛應用於語音助理、會議記錄、字幕生成等場景。
自動語音辨識是語音 AI 領域歷史最悠久、應用最廣泛的技術之一,從 1952 年貝爾實驗室的 Audrey 系統(只能辨識 10 個數字)到今天能準確辨識多語言連續語音的端對端深度學習系統,經歷了數十年的技術演進。
傳統 ASR 架構(HMM-GMM 時代)
在深度學習普及之前,ASR 系統由以下元件組成:
- 聲學特徵提取:將音頻波形轉換為 MFCC(梅爾頻率倒譜係數)等特徵序列。
- 聲學模型(Acoustic Model):通常使用隱馬可夫模型(HMM)建模語音的時序結構,高斯混合模型(GMM)建模每個狀態的聲學特徵分布,合稱 HMM-GMM 系統。
- 語言模型(Language Model):N-gram 統計語言模型,根據詞序列的統計概率限制解碼結果,提升辨識的流暢度和語義合理性。
- 解碼器:結合聲學模型和語言模型的機率,使用 Viterbi 演算法或 Beam Search 找到最可能的詞序列。
深度學習 ASR 架構
深度學習帶來了 ASR 的技術躍升:
DNN-HMM:以深度神經網路(DNN)替換 GMM 建模聲學特徵,大幅提升辨識準確率。
CTC(Connectionist Temporal Classification):允許神經網路直接輸出字元序列,無需框架對齊(Frame Alignment),簡化了訓練流程。代表系統:DeepSpeech 系列。
Attention-based Encoder-Decoder:以序列到序列(Seq2Seq)架構,編碼器處理音頻特徵,解碼器自迴歸生成文字輸出,注意力機制對齊音頻與文字。
Transformer ASR:將 Transformer 架構引入 ASR,Conformer(Convolution-augmented Transformer)結合卷積局部建模與 Transformer 全局建模,是目前主流架構之一。
Whisper(OpenAI,2022):在 68 萬小時多語言語音資料上預訓練的端對端 ASR 模型,支援 99 種語言,在零樣本設置下達到接近人類水準的辨識率,並同時支援語音翻譯(直接從語音翻譯到英文)。
評估指標:字錯率(WER)
ASR 的主要評估指標是字錯率(Word Error Rate,WER): WER = (替換數 S + 刪除數 D + 插入數 I) / 參考詞數 N × 100%
WER 越低表示辨識效果越好。現代 ASR 系統在特定場景(如乾淨的英文演講)上 WER 已可低於 5%,接近人類轉寫的錯誤率。但在強背景噪音、重口音、多人交叉發言等困難場景下,WER 仍可能大幅上升。
挑戰與難點
- 口音與方言:同一語言的不同腔調對 ASR 系統是重大挑戰,訓練資料中不平衡的口音分布會導致特定口音辨識效果差。
- 低資源語言:許多語言缺乏大量標注語音資料,難以訓練高品質 ASR 系統。無監督預訓練方法(如 wav2vec 2.0)的出現改善了這個問題。
- 說話人重疊(Speaker Diarization):多人同時說話或交替發言的場景,需要同時解決「誰在說話」和「說了什麼」兩個問題。
- 即時辨識的延遲:串流 ASR 需要在接收部分音頻的同時輸出文字,對模型架構和系統工程都有額外要求。
主要應用場景
- 語音助理:Siri、Alexa、Google Assistant 的核心技術。
- 會議記錄與字幕:自動生成視訊字幕、會議記錄,提升內容可存取性(a11y)。
- 語音介面:讓使用者透過說話操作設備,對無障礙設計尤為重要。
- 語音翻譯:先 ASR 將語音轉為文字,再進行機器翻譯,或直接以端對端模型(如 Whisper)從語音翻譯到目標語言文字。
- 電話客服分析:自動將客服通話轉錄並分析情緒、關鍵詞,提升服務品質。