語音合成技術 是什麼?
Speech Synthesis:語音合成技術 的完整解釋
語音合成技術是一種將文字轉換成人類語音的技術,也稱為文字轉語音(TTS)。它廣泛應用於語音助理、導航系統和輔助科技等領域。
容易混淆
語音合成 vs 語音辨識
語音合成:把文字變成聲音,讓機器會說話。
語音辨識:把聲音變成文字,讓機器聽懂人說了什麼。
最關鍵的區別:一個是輸出聲音,一個是輸入聲音。
記住這句就好
看文字要變成自然聲音,就想到語音合成。
實際案例
你在圖書館用手機開啟朗讀功能,長文章就能直接聽,不必一直盯著螢幕。
導航 App 在你開車時播報前方轉彎,這也是語音合成在工作。
算法與應用
它通常會先把文字轉成音素、韻律和停頓資訊,再由聲學模型與聲碼器產生語音。
現代方法多用深度學習來提升自然度,重點會放在音色、重音、停頓和情緒表現。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 語音合成 | 台灣與中國大陸通用的正式用語 |
| 语音合成 | 簡體寫法 |
| Speech Synthesis | 英文原名 |
| TTS(Text-to-Speech,文字轉語音) | 產品與 API 文件裡最常見的說法 |
| 語音生成 | 近年隨生成式模型出現的新說法 |
語音合成的範圍比文字轉語音略廣:文字轉語音特指從文字生成,語音合成還包含從其他輸入(例如另一段語音、音素序列)生成人聲。日常對話裡兩者混用不會造成誤解。
技術世代
| 世代 | 做法 | 聽起來 |
|---|---|---|
| 串接式(concatenative) | 事先錄大量語音片段,播放時拼接 | 單字清楚但接縫明顯,語調僵硬 |
| 參數式(parametric) | 用統計模型產生聲學參數再合成 | 平順但沉悶,有明顯的機器感 |
| 神經式(neural) | 深度模型直接產生頻譜與波形 | 接近真人,語調自然 |
現在的神經式主流是兩段式:聲學模型把文字轉成梅爾頻譜圖(決定念什麼、怎麼斷句、語調),聲碼器把頻譜還原成波形(決定音質)。近年也有端到端與「把語音當離散 token 用語言模型生成」的做法,後者讓語音合成能力併進大型語言模型。
中文語音合成的特殊難點
多音字判讀。 「行」念 xíng 還是 háng、「重」念 zhòng 還是 chóng、「長」念 cháng 還是 zhǎng,必須靠上下文判斷。這一步叫字音轉換(G2P),是中文語音合成錯誤的主要來源。
三聲連續變調。 兩個三聲相連時前一個要變成二聲(「你好」實際念成 ní hǎo),沒處理會聽起來很生硬。
文字正規化。 數字、日期、單位、英文縮寫都要先決定怎麼念。「3.5」念三點五、「2026/07/29」念年月日、「AI」逐字母念,這些是前處理的規則,不是模型的問題。
中英夾雜在台灣特別常見,模型要能在同一句裡切換發音系統而不突兀。
評估與使用邊界
主要評估方式仍是主觀評分 MOS(請人聽並給 1 到 5 分),客觀指標跟人耳感受的相關性有限。除了自然度,實務上還要看可懂度(在吵雜環境聽不聽得清楚)與一致性(長篇朗讀時音色會不會飄)。
語音複製現在只需要幾秒鐘樣本就能模仿一個人的聲音,這帶來明確的濫用風險。使用他人聲音前必須取得授權,多數服務也要求在輸出中揭露是合成語音。
情境判斷
Q1(直覺題): 你想讓電子書自己唸出來,這是語音合成嗎?
→ 是,因為輸入是文字,輸出是聲音。
Q2(判斷題): 如果聲音很像機器人、語氣很平,問題通常只在文字內容嗎?
→ 不只。看情況,常見原因是韻律建模或聲碼器不夠自然。
常見問題
語音合成和 TTS 是同一件事嗎?
是,TTS 就是 text-to-speech,中文常說文字轉語音。
語音合成一定要很像真人嗎?
不一定,重點是要清楚、自然、符合場景,像語音助理和無障礙朗讀就很看用途。
語音合成可以做多語言嗎?
可以,但通常要處理不同語言的發音規則、韻律和音素對應。