語音辨識(Speech Recognition)是什麼?

語音辨識是一種將人類語音轉換為機器可理解的文字或指令的技術,使電腦能夠聽懂並處理人類語言。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Speech Recognition
主題標籤
語音辨識、Speech Recognition、L11402
考點定位
中頻・初級
最後更新
2026/07/29
語音辨識(Speech Recognition)是什麼? iPAS 中頻 語音辨識Speech Recognition
術語快查

搜尋意圖: 如果你在找「語音辨識 是什麼」、「語音辨識 會怎麼考」或「語音辨識 和相近概念差在哪」,先看這頁的定義、考點定位與延伸比較。

TL;DR: 語音辨識是一種將人類語音轉換為機器可理解的文字或指令的技術,使電腦能夠聽懂並處理人類語言。

實用情境: 適合用在 iPAS 複習、面試快查與閱讀 AI 文章時快速校正概念邊界。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

你有沒有在你對手機說話,想把聲音變成文字或指令,發現只看表面常常不夠?

你可以把它想成讓機器先聽懂你說了什麼,再把聲音轉成文字。

語音助理、字幕、會議轉錄都靠它把口語變成可處理的文字。

你可以把它想成一個把抽象概念拉回日常判斷的提示,先知道它解決什麼問題,再看技術細節。

容易混淆

語音合成 語音辨識是「聽」的技術,把聲音變成文字。 語音合成是「說」的技術,把文字變成聲音。一個是把人的話讓機器懂,另一個是讓機器能用人的方式說話。

最關鍵的區別:先看它是在比意思、比結構,還是在做任務輸出。

記住這句就好

把聲音變文字,就是語音辨識。

實際案例

手機語音輸入把你的口述轉成訊息內容。 會議錄音轉文字,方便後續搜尋和摘要。

算法與應用

核心元件常包含聲學模型、語言模型和解碼器,現在也常用端到端深度學習架構。 評估常看詞錯誤率,因為一個字辨錯就可能影響整句意思。

中英對照與常見說法

說法 出現場合
語音辨識 台灣正式用語
语音识别 簡體寫法
Speech Recognition 英文原名
ASR(Automatic Speech Recognition) 學術與產品文件裡的標準縮寫
STT(Speech-to-Text,語音轉文字) 業界常用的說法,指同一件事

相反方向是 TTS(Text-to-Speech,文字轉語音)。兩者常被搞混,判斷方式看輸入:語音辨識輸入聲音、輸出文字。

現在的做法跟以前差在哪

傳統流程(2010 年代前) 端到端(現在)
組成 聲學模型、發音詞典、語言模型三塊分開訓練 一個模型直接從聲音到文字
需要的資料 音素層級的標註,昂貴 只需要音檔與逐字稿配對
新語言與新詞 要更新詞典 靠資料涵蓋
代表技術 HMM 加 GMM、後來的 HMM 加 DNN CTC、注意力式編碼解碼、Whisper 這類大規模預訓練模型

端到端讓建置門檻大幅下降,代價是不好局部修正。傳統做法要讓模型認得一個新的專有名詞,改詞典就好;端到端模型通常得靠提示、外掛的偏置詞表或重新微調。

評估指標與實務難點

字錯誤率(WER,Word Error Rate)是標準指標:把插入、刪除、替換三種錯誤加起來除以參考文字的總詞數。中文一般改用字元錯誤率(CER),因為中文沒有空格分詞。

WER 可能超過 100%,因為插入錯誤沒有上限。看到一個 WER 數字要問清楚三件事:哪個資料集、有沒有做文字正規化(大小寫、標點、數字寫法)、以及是不是乾淨錄音。安靜錄音室與真實會議室的 WER 常常差兩倍以上。

實務上最難的不是安靜環境的一般對話,而是:多人重疊說話(需要語者分離與語者辨識)、專業術語與人名、口音與語碼轉換(中英夾雜在台灣特別常見)、以及遠場麥克風的迴音與噪音。

標點與斷句通常是另一個模型做的。原始輸出常常是一長串沒有標點的文字,可讀的逐字稿需要額外的標點還原步驟,評估時要分清楚錯的是辨識還是後處理。

情境判斷

Q1(直覺題): 你按住麥克風對手機說話,這就是語音辨識的典型應用嗎?

→ 是。把聲音轉成文字或指令,正是它的主場。

Q2(判斷題): 如果環境很吵、講話又重疊,準確率通常會怎樣?

→ 會下降。看情況,噪音和重疊語音都會讓辨識變難。

iPAS 考題

出題方向: 常考基本定義、聲學模型與語言模型的分工、以及詞錯誤率這個評估指標。 題目: 語音辨識系統的主要目的是什麼? 答案: → 把人類語音轉換成機器可處理的文字或指令。

常見問題

什麼是語音辨識?

語音辨識是一種將人類語音轉換為機器可理解的文字或指令的技術,使電腦能夠聽懂並處理人類語言。它結合了聲學模型和語言模型,在人機交互中扮演重要角色。

語音辨識在 iPAS 考試中怎麼考?

iPAS 初級考試(L11402)中,語音辨識的考點包括基本概念、核心技術(聲學模型、語言模型)、評估指標(詞錯誤率)和實際應用。常見題型有選擇題、簡答題和案例分析。

語音辨識和哪個術語最常被混淆?

語音辨識最常與語音合成混淆。語音辨識是將語音轉換為文字,而語音合成則是將文字轉換為語音。兩者功能相反,但都是語音處理的重要組成部分,應用於不同場景。