語音辨識 是什麼?

Speech Recognition:語音辨識 的完整解釋

語音辨識是一種將人類語音轉換為機器可理解的文字或指令的技術,使電腦能夠聽懂並處理人類語言。

容易混淆

語音合成 語音辨識是「聽」的技術,把聲音變成文字。 語音合成是「說」的技術,把文字變成聲音。一個是把人的話讓機器懂,另一個是讓機器能用人的方式說話。

最關鍵的區別:先看它是在比意思、比結構,還是在做任務輸出。

記住這句就好

把聲音變文字,就是語音辨識。

實際案例

手機語音輸入把你的口述轉成訊息內容。 會議錄音轉文字,方便後續搜尋和摘要。

算法與應用

核心元件常包含聲學模型、語言模型和解碼器,現在也常用端到端深度學習架構。 評估常看詞錯誤率,因為一個字辨錯就可能影響整句意思。

中英對照與常見說法

說法 出現場合
語音辨識 台灣正式用語
语音识别 簡體寫法
Speech Recognition 英文原名
ASR(Automatic Speech Recognition) 學術與產品文件裡的標準縮寫
STT(Speech-to-Text,語音轉文字) 業界常用的說法,指同一件事

相反方向是 TTS(Text-to-Speech,文字轉語音)。兩者常被搞混,判斷方式看輸入:語音辨識輸入聲音、輸出文字。

現在的做法跟以前差在哪

傳統流程(2010 年代前) 端到端(現在)
組成 聲學模型、發音詞典、語言模型三塊分開訓練 一個模型直接從聲音到文字
需要的資料 音素層級的標註,昂貴 只需要音檔與逐字稿配對
新語言與新詞 要更新詞典 靠資料涵蓋
代表技術 HMM 加 GMM、後來的 HMM 加 DNN CTC、注意力式編碼解碼、Whisper 這類大規模預訓練模型

端到端讓建置門檻大幅下降,代價是不好局部修正。傳統做法要讓模型認得一個新的專有名詞,改詞典就好;端到端模型通常得靠提示、外掛的偏置詞表或重新微調。

評估指標與實務難點

字錯誤率(WER,Word Error Rate)是標準指標:把插入、刪除、替換三種錯誤加起來除以參考文字的總詞數。中文一般改用字元錯誤率(CER),因為中文沒有空格分詞。

WER 可能超過 100%,因為插入錯誤沒有上限。看到一個 WER 數字要問清楚三件事:哪個資料集、有沒有做文字正規化(大小寫、標點、數字寫法)、以及是不是乾淨錄音。安靜錄音室與真實會議室的 WER 常常差兩倍以上。

實務上最難的不是安靜環境的一般對話,而是:多人重疊說話(需要語者分離與語者辨識)、專業術語與人名、口音與語碼轉換(中英夾雜在台灣特別常見)、以及遠場麥克風的迴音與噪音。

標點與斷句通常是另一個模型做的。原始輸出常常是一長串沒有標點的文字,可讀的逐字稿需要額外的標點還原步驟,評估時要分清楚錯的是辨識還是後處理。

情境判斷

Q1(直覺題): 你按住麥克風對手機說話,這就是語音辨識的典型應用嗎?

→ 是。把聲音轉成文字或指令,正是它的主場。

Q2(判斷題): 如果環境很吵、講話又重疊,準確率通常會怎樣?

→ 會下降。看情況,噪音和重疊語音都會讓辨識變難。

語音辨識 在 iPAS 考試中的重點

根據歷年統計,語音辨識 相關題目 平均佔 AI 技術類考題 5%, 屬於中頻考範圍。

常見出題方向:應用場景識別與分析(45%)、技術整合方案設計(35%)、實務應用案例判斷(20%)。

相關術語

常見問題

什麼是語音辨識?

語音辨識是一種將人類語音轉換為機器可理解的文字或指令的技術,使電腦能夠聽懂並處理人類語言。它結合了聲學模型和語言模型,在人機交互中扮演重要角色。

語音辨識在 iPAS 考試中怎麼考?

iPAS 初級考試(L11402)中,語音辨識的考點包括基本概念、核心技術(聲學模型、語言模型)、評估指標(詞錯誤率)和實際應用。常見題型有選擇題、簡答題和案例分析。

語音辨識和哪個術語最常被混淆?

語音辨識最常與語音合成混淆。語音辨識是將語音轉換為文字,而語音合成則是將文字轉換為語音。兩者功能相反,但都是語音處理的重要組成部分,應用於不同場景。

資料來源

← 回到 語音辨識 快查頁

測驗你對 語音辨識 的理解

透過模擬考系統檢驗學習成果

開始測驗