語音合成技術(Speech Synthesis)是什麼?

語音合成技術是一種將文字轉換成人類語音的技術,也稱為文字轉語音(TTS)。它廣泛應用於語音助理、導航系統和輔助科技等領域。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Speech Synthesis
主題標籤
語音辨識、機器學習、深度學習
考點定位
非 iPAS 核心術語
最後更新
2026/07/29
語音合成技術(Speech Synthesis)是什麼? 語音辨識機器學習
術語快查

搜尋意圖: 如果你在找「語音合成技術 是什麼」或「語音合成技術 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 語音合成技術是一種將文字轉換成人類語音的技術,也稱為文字轉語音(TTS)。它廣泛應用於語音助理、導航系統和輔助科技等領域。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

你有沒有按下朗讀按鈕,想知道電腦怎麼把文字念得像人一樣?

你可以把它想成把文字變成聲音的技術,像導航、旁白、電子書朗讀都靠它。

它的重要性在於,很多場景不是要你看字,而是要讓資訊直接「說」出來,方便你邊走邊聽、邊做事邊接收內容。

你可以把它想成一個把抽象概念拉回日常判斷的提示,先知道它解決什麼問題,再看技術細節。

容易混淆

語音合成 vs 語音辨識

語音合成:把文字變成聲音,讓機器會說話。

語音辨識:把聲音變成文字,讓機器聽懂人說了什麼。

最關鍵的區別:一個是輸出聲音,一個是輸入聲音。

記住這句就好

看文字要變成自然聲音,就想到語音合成。

實際案例

你在圖書館用手機開啟朗讀功能,長文章就能直接聽,不必一直盯著螢幕。

導航 App 在你開車時播報前方轉彎,這也是語音合成在工作。

算法與應用

它通常會先把文字轉成音素、韻律和停頓資訊,再由聲學模型與聲碼器產生語音。

現代方法多用深度學習來提升自然度,重點會放在音色、重音、停頓和情緒表現。

中英對照與常見說法

說法 出現場合
語音合成 台灣與中國大陸通用的正式用語
语音合成 簡體寫法
Speech Synthesis 英文原名
TTS(Text-to-Speech,文字轉語音) 產品與 API 文件裡最常見的說法
語音生成 近年隨生成式模型出現的新說法

語音合成的範圍比文字轉語音略廣:文字轉語音特指從文字生成,語音合成還包含從其他輸入(例如另一段語音、音素序列)生成人聲。日常對話裡兩者混用不會造成誤解。

技術世代

世代 做法 聽起來
串接式(concatenative) 事先錄大量語音片段,播放時拼接 單字清楚但接縫明顯,語調僵硬
參數式(parametric) 用統計模型產生聲學參數再合成 平順但沉悶,有明顯的機器感
神經式(neural) 深度模型直接產生頻譜與波形 接近真人,語調自然

現在的神經式主流是兩段式:聲學模型把文字轉成梅爾頻譜圖(決定念什麼、怎麼斷句、語調),聲碼器把頻譜還原成波形(決定音質)。近年也有端到端與「把語音當離散 token 用語言模型生成」的做法,後者讓語音合成能力併進大型語言模型。

中文語音合成的特殊難點

多音字判讀。 「行」念 xíng 還是 háng、「重」念 zhòng 還是 chóng、「長」念 cháng 還是 zhǎng,必須靠上下文判斷。這一步叫字音轉換(G2P),是中文語音合成錯誤的主要來源。

三聲連續變調。 兩個三聲相連時前一個要變成二聲(「你好」實際念成 ní hǎo),沒處理會聽起來很生硬。

文字正規化。 數字、日期、單位、英文縮寫都要先決定怎麼念。「3.5」念三點五、「2026/07/29」念年月日、「AI」逐字母念,這些是前處理的規則,不是模型的問題。

中英夾雜在台灣特別常見,模型要能在同一句裡切換發音系統而不突兀。

評估與使用邊界

主要評估方式仍是主觀評分 MOS(請人聽並給 1 到 5 分),客觀指標跟人耳感受的相關性有限。除了自然度,實務上還要看可懂度(在吵雜環境聽不聽得清楚)與一致性(長篇朗讀時音色會不會飄)。

語音複製現在只需要幾秒鐘樣本就能模仿一個人的聲音,這帶來明確的濫用風險。使用他人聲音前必須取得授權,多數服務也要求在輸出中揭露是合成語音。

情境判斷

Q1(直覺題): 你想讓電子書自己唸出來,這是語音合成嗎?

→ 是,因為輸入是文字,輸出是聲音。

Q2(判斷題): 如果聲音很像機器人、語氣很平,問題通常只在文字內容嗎?

→ 不只。看情況,常見原因是韻律建模或聲碼器不夠自然。

常見問題

語音合成和 TTS 是同一件事嗎?

是,TTS 就是 text-to-speech,中文常說文字轉語音。

語音合成一定要很像真人嗎?

不一定,重點是要清楚、自然、符合場景,像語音助理和無障礙朗讀就很看用途。

語音合成可以做多語言嗎?

可以,但通常要處理不同語言的發音規則、韻律和音素對應。