搜尋意圖: 如果你在找「自然語言處理 是什麼」、「自然語言處理 會怎麼考」或「自然語言處理 和相近概念差在哪」,先看這頁的定義、考點定位與延伸比較。
TL;DR: 自然語言處理使電腦能理解、分析和生成人類語言,是 AI 語音助理與翻譯等應用的核心技術
實用情境: 適合用在 iPAS 複習、面試快查與閱讀 AI 文章時快速校正概念邊界。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
你有沒有想過,電腦怎麼從人話裡抓出意思? 你可以把它想成讓機器學會讀、寫、切詞、分類、抽資訊,像在處理一整套語言工作。 自然語言處理是把文字變成可計算資料的總稱,從分詞到理解,再到生成都屬於它。 這也讓它很適合先拿到可用答案,再慢慢把精度往上推。
容易混淆
自然語言處理 vs 自然語言理解 自然語言處理:整個大領域 自然語言理解:偏理解語意的子領域 最關鍵的區別:先看它是在比什麼,再看它怎麼做。
自然語言處理 vs 語音辨識 自然語言處理:處理文字 語音辨識:先把聲音轉成文字 最關鍵的區別:先看它是在比什麼,再看它怎麼做。
記住這句就好
人話要先變成電腦看得懂的資料。
實際案例
搜尋引擎 把查詢切詞、去停用詞、理解意圖,找出最相關頁面。
客服系統 把使用者輸入分成意圖、實體、和回覆內容,再走後續流程。
算法與應用
NLP 的工作鏈很長,常包含文字前處理、特徵表示、理解、與生成。 現代 NLP 幾乎都離不開語言模型。 它的難點在語意、上下文、歧義和跨語言差異。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 自然語言處理 | 台灣正式用語 |
| 自然语言处理 | 簡體寫法,簡體資料的標準用語 |
| Natural Language Processing | 英文原名 |
| NLP | 標準縮寫,注意這個縮寫在心理學領域另指神經語言程式學,是完全不同的東西 |
| 自然語言理解(NLU)/自然語言生成(NLG) | 自然語言處理底下的兩個子領域,前者管讀懂,後者管寫出 |
這個領域包含哪些任務
| 層次 | 代表任務 |
|---|---|
| 詞彙層 | 斷詞、詞性標註、詞幹還原、命名實體識別 |
| 句法層 | 依存句法分析、成分句法分析 |
| 語意層 | 語意角色標註、指代消解、情感分析 |
| 語用與應用層 | 機器翻譯、摘要、問答、對話、檢索 |
中文的處理跟英文有一個關鍵差異:中文沒有空格分詞。英文靠空格就能切出詞,中文得先做斷詞,而斷詞本身就是一個容易出錯的任務(「研究生命起源」可以切成「研究生/命/起源」或「研究/生命/起源」)。這也是為什麼子詞切分(subword tokenization)對中文特別重要。
從規則到大型語言模型的三個階段
規則時期(1950 到 1990 年代):語言學家手寫文法規則與詞典。優點是可解釋、可控,缺點是覆蓋不了語言的無窮變化,維護成本隨規則數量爆炸。
統計與機器學習時期(1990 到 2013 年前後):改用標註語料訓練統計模型,代表方法有隱馬可夫模型、條件隨機場、以及統計式機器翻譯。這時期的主力工作是特徵工程。
深度學習與預訓練時期(2013 年之後):先是詞向量(word2vec、GloVe)讓詞有了連續的語意表示,接著循環神經網路與注意力機制處理序列,2017 年 Transformer 架構問世後,預訓練加微調成為標準流程,再演進到現在的大型語言模型。
現在的實務分工大致是:需要生成、需要跨任務彈性,用大型語言模型;需要低延遲、低成本、固定輸出格式的分類與抽取,用小型編碼器模型微調仍然更划算。
情境判斷
Q1(直覺題): 你要讓系統看懂一句中文並判斷意圖,這屬於什麼?
Q2(判斷題): 如果一個系統只有文字輸入,沒有聲音,也沒有影像,還算 NLP 嗎?
iPAS 考題
Q:自然語言處理最常做的事情有哪些? → 分詞、分類、資訊抽取、問答、生成,核心是把人話變成可計算的資料。
Q:為什麼中文 NLP 一開始常先做分詞? → 因為中文沒有明確空格切詞,電腦需要先把句子切成可處理的單位。
常見問題
NLP 和 AI 是一樣嗎?
不是,NLP 只是 AI 的一個分支。
它一定要用深度學習嗎?
不一定,傳統統計方法也屬於 NLP。
分詞為什麼常被提到?
因為它是中文 NLP 最基礎的前處理步驟之一。