文字生成音訊(Text-to-Audio)是什麼?

文字生成音訊(Text-to-Audio)是把一段文字描述直接轉成聲音的生成式 AI 技術,產出的是音樂、音效或環境音,不是唸稿的人聲。它跟文字轉語音(Text-to-Speech)最大的差別,在於生成的是整個聲音場景,還是單純的說話聲。|本頁含完整原理、應用場景、iPAS 考試重點與 4 個常見問答。

英文
Text-to-Audio
主題標籤
生成式AI、深度學習、AI應用
考點定位
非 iPAS 核心術語
最後更新
2026/07/30
文字生成音訊(Text-to-Audio)是什麼? 生成式AI深度學習
術語快查

搜尋意圖: 如果你在找「文字生成音訊 是什麼」或「文字生成音訊 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 文字生成音訊(Text-to-Audio)是把一段文字描述直接轉成聲音的生成式 AI 技術,產出的是音樂、音效或環境音,不是唸稿的人聲。它跟文字轉語音(Text-to-Speech)最大的差別,在於生成的是整個聲音場景,還是單純的說話聲。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

你有沒有想過,一段文字描述能不能直接變成一整段聲音,而不只是把它唸出來?

你可以把它想成請一位配樂師讀你的腳本,然後直接交出成品。 文字生成音訊的重點是:你寫「雨中的城市街道,遠處有車聲」,模型就合成出那個聲音場景。 它重要,是因為影音內容的聲音部分過去只能靠素材庫或錄音,現在多了一條用文字下指令的路。

容易混淆

文字生成音訊 vs 文字轉語音 文字生成音訊:生成音樂、音效以及環境音 文字轉語音:生成人在說話的聲音 最關鍵的區別:文字轉語音的輸出一定是「有人在唸字」,文字生成音訊的輸出通常沒有人聲。這兩個英文名字只差一個字,中文卻是兩件事,查資料時最容易在這裡搞混。

文字生成音訊 vs 音樂生成 文字生成音訊:輸入一定是文字,輸出可以是音樂以外的任何聲音 音樂生成:專指產出音樂,輸入不一定是文字,也可能是旋律片段或和弦 最關鍵的區別:音樂生成是「輸出限定音樂」,文字生成音訊是「輸入限定文字」,兩者重疊但不等於。

文字生成音訊 vs 語音合成技術 文字生成音訊:屬於生成式 AI 的音訊分支 語音合成技術:專門處理把文字變成語音的整套技術 最關鍵的區別:語音合成技術是文字轉語音的底層,跟文字生成音訊是兩條並行的線,不是上下游。

記住這句就好

輸出裡有沒有人在說話,就能分辨你看到的是文字生成音訊還是文字轉語音。

實際案例

案例:短影音要配一段 15 秒的背景音樂 用文字描述情緒與樂器,直接生成一段可用的配樂,不用翻素材庫比對授權

案例:遊戲需要「木門在石造地窖裡緩慢推開」的音效 這種指定得很細的音效在素材庫不一定找得到,用文字描述生成比錄製快

案例:Podcast 想要一段雨聲當轉場 環境音用生成的就夠,不必外出實地錄音

算法與應用

主流做法是先把聲音壓成一種比較好處理的表示,再讓模型依照文字條件一步步生成,最後還原成波形 常見的代表性系統:Meta 的 AudioCraft,底下 MusicGen 負責文字生成音樂、AudioGen 負責文字生成音效;Stability AI 的 Stable Audio,依官方頁面目前標示為 Stable Audio 3.0;學術端常被引用的 AudioLDM 走的是 latent diffusion(潛在擴散)路線 實務上影響成品的通常是三件事:描述寫得夠不夠具體、要生成的長度,以及模型本身擅長音樂還是音效 商用之前要看清楚該模型的授權條款,不同系統對輸出內容的商用權利規定並不一致

情境判斷

Q1(直覺題): 你要讓網站的無障礙功能把文章唸給視障使用者聽,該用文字生成音訊嗎? → 不是,那是文字轉語音的工作。文字生成音訊產出的通常沒有人聲。

Q2(判斷題): 你要幫一支產品影片配背景音樂,一定要用文字生成音訊嗎? → 看情況。如果只要一段情緒對的通用配樂,授權音樂庫可能更快也更安全;如果需要的氛圍很特定、素材庫翻不到,用生成的才划算。

常見問題

文字生成音訊跟文字轉語音是同一件事嗎?

不是。文字轉語音(Text-to-Speech)生成的是人在說話的聲音,文字生成音訊(Text-to-Audio)生成的是音樂、音效或環境音。兩者英文只差一個字,是最常見的混淆點。

生成出來的音樂可以商用嗎?

要看你用的是哪一個系統,各家對輸出內容的商用權利規定不一樣,使用前要讀該模型或該服務的官方授權條款,不要憑印象假設可以。

為什麼同一段描述每次生成的結果都不一樣?

這類模型本身就帶隨機性,加上描述的具體程度、長度設定與模型版本都會影響結果。要穩定就把描述寫得更具體,並且固定其他設定。

它能生成人聲唱歌嗎?

部分系統做得到,但那通常是獨立的歌聲合成功能,跟一般理解的文字生成音訊不完全是同一條技術線,要看該系統的官方說明。