文字轉語音 是什麼?
Text-to-Speech:文字轉語音 的完整解釋
文字轉語音 (TTS) 技術將文字轉換為人類可理解的語音。它廣泛應用於輔助工具、語音助手和內容創作等領域。
容易混淆
文字轉語音 vs 語音辨識 文字轉語音是把字念出來 語音辨識是把聲音轉成文字 最關鍵的區別:一個是文字到聲音,一個是聲音到文字
文字轉語音 vs 語音合成技術 文字轉語音是常見任務名稱 語音合成技術是更大的技術範圍 最關鍵的區別:任務名稱和技術家族不要混在一起
文字轉語音 vs 錄音 文字轉語音是模型即時產生 錄音是人先把聲音錄好 最關鍵的區別:一個是生成,一個是預先保存
記住這句就好
先讀懂文字,再把聲音的節奏和情緒補上去。
實際案例
無障礙閱讀 視障使用者打開網頁後,系統自動把文章念出來,資訊就能直接聽懂,不必依賴螢幕閱讀文字
客服播報 店家把公告轉成語音播放,能快速產生多語版本,也能讓排班或叫號流程更省人力
算法與應用
| 文字分析 | 先看標點、數字、專有名詞 | 這會影響停頓和讀法 | | 音素轉換 | 把文字拆成發音單位 | 不同語言規則差很多 | | 韻律控制 | 調整重音、速度、語氣 | 自然度常在這裡拉開差距 | | 聲碼器 | 把聲學特徵變成實際聲波 | 這一步影響聲音是否像真人 |
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 文字轉語音 | 台灣正式用語 |
| 文本转语音、语音合成 | 簡體寫法 |
| Text-to-Speech | 英文原名 |
| TTS | 標準縮寫 |
| 語音合成(speech synthesis) | 學術上的正式名稱,涵蓋範圍略廣 |
相對的方向是 STT(Speech-to-Text,語音轉文字),也叫自動語音辨識(ASR)。兩者常被搞混,判斷方式是看輸入是什麼:TTS 輸入文字、輸出聲音;STT 輸入聲音、輸出文字。
現代 TTS 的兩段式架構
第一段,聲學模型(acoustic model):把文字轉成中間的聲學表示,通常是梅爾頻譜圖(mel-spectrogram)。這一段決定念什麼、怎麼斷句、語調起伏。代表模型有 Tacotron 系列與 FastSpeech 系列。
第二段,聲碼器(vocoder):把頻譜圖還原成實際的音訊波形。這一段決定音質好不好、有沒有雜音。代表模型有 WaveNet、HiFi-GAN。
近年也有直接從文字到波形的端到端模型(例如 VITS),以及把語音當成離散 token 用語言模型生成的做法,後者讓 TTS 能力併進大型語言模型,是目前變化最快的方向。
評估與實務要點
主觀評分 MOS(Mean Opinion Score) 仍是主要評估方式:請人聽並給 1 到 5 分。客觀指標(例如頻譜距離)跟人耳感受的相關性有限。
中文 TTS 的特殊難點是多音字與變調。 「行」要念 xíng 還是 háng、「重」要念 zhòng 還是 chóng,得靠上下文判斷,這一步叫做字音轉換(G2P)。第三聲連續時的變調規則也需要處理,否則聽起來會很生硬。
數字、單位、縮寫要先正規化。 「2026/07/29」該念成年月日、「3.5」該念成三點五、「AI」該逐字母念,這些規則在文字前處理階段就要決定,不是模型的問題。
語音複製(voice cloning)現在只需要幾秒鐘的樣本。 這帶來明確的濫用風險,使用他人聲音前必須取得授權,多數服務也要求聲明。
情境判斷
Q1(直覺題):你要把教學文章做成可聽內容,應該用它嗎? → 可以,這是文字轉語音最典型的用途之一。
Q2(判斷題):你要辨識會議錄音裡每個人說了什麼,還適合嗎? → 不適合,那是語音辨識的工作,不是文字轉語音。
相關術語
常見問題
文字轉語音可以模仿真人聲嗎?
可以到相當接近,但要看資料品質、模型設計和是否有足夠的韻律控制。
它為什麼有時候念錯專有名詞?
因為模型需要知道詞語切分和讀音規則,遇到新詞時容易判斷錯。
TTS 和人類朗讀哪個更適合長篇內容?
長篇、重複播報通常是 TTS 更省力,情感表達和臨場感則常是人類朗讀更強。