自然語言處理 是什麼?

Natural Language Processing:自然語言處理 的完整解釋

自然語言處理使電腦能理解、分析和生成人類語言,是 AI 語音助理與翻譯等應用的核心技術

容易混淆

自然語言處理 vs 自然語言理解 自然語言處理:整個大領域 自然語言理解:偏理解語意的子領域 最關鍵的區別:先看它是在比什麼,再看它怎麼做。

自然語言處理 vs 語音辨識 自然語言處理:處理文字 語音辨識:先把聲音轉成文字 最關鍵的區別:先看它是在比什麼,再看它怎麼做。

記住這句就好

人話要先變成電腦看得懂的資料。

實際案例

搜尋引擎 把查詢切詞、去停用詞、理解意圖,找出最相關頁面。

客服系統 把使用者輸入分成意圖、實體、和回覆內容,再走後續流程。

算法與應用

NLP 的工作鏈很長,常包含文字前處理、特徵表示、理解、與生成。 現代 NLP 幾乎都離不開語言模型。 它的難點在語意、上下文、歧義和跨語言差異。

中英對照與常見說法

說法 出現場合
自然語言處理 台灣正式用語
自然语言处理 簡體寫法,簡體資料的標準用語
Natural Language Processing 英文原名
NLP 標準縮寫,注意這個縮寫在心理學領域另指神經語言程式學,是完全不同的東西
自然語言理解(NLU)/自然語言生成(NLG) 自然語言處理底下的兩個子領域,前者管讀懂,後者管寫出

這個領域包含哪些任務

層次 代表任務
詞彙層 斷詞、詞性標註、詞幹還原、命名實體識別
句法層 依存句法分析、成分句法分析
語意層 語意角色標註、指代消解、情感分析
語用與應用層 機器翻譯、摘要、問答、對話、檢索

中文的處理跟英文有一個關鍵差異:中文沒有空格分詞。英文靠空格就能切出詞,中文得先做斷詞,而斷詞本身就是一個容易出錯的任務(「研究生命起源」可以切成「研究生/命/起源」或「研究/生命/起源」)。這也是為什麼子詞切分(subword tokenization)對中文特別重要。

從規則到大型語言模型的三個階段

規則時期(1950 到 1990 年代):語言學家手寫文法規則與詞典。優點是可解釋、可控,缺點是覆蓋不了語言的無窮變化,維護成本隨規則數量爆炸。

統計與機器學習時期(1990 到 2013 年前後):改用標註語料訓練統計模型,代表方法有隱馬可夫模型、條件隨機場、以及統計式機器翻譯。這時期的主力工作是特徵工程。

深度學習與預訓練時期(2013 年之後):先是詞向量(word2vec、GloVe)讓詞有了連續的語意表示,接著循環神經網路與注意力機制處理序列,2017 年 Transformer 架構問世後,預訓練加微調成為標準流程,再演進到現在的大型語言模型。

現在的實務分工大致是:需要生成、需要跨任務彈性,用大型語言模型;需要低延遲、低成本、固定輸出格式的分類與抽取,用小型編碼器模型微調仍然更划算。

情境判斷

Q1(直覺題):你要讓系統看懂一句中文並判斷意圖,這屬於什麼? → 自然語言處理,因為核心是讓機器處理人類語言。

Q2(判斷題):如果一個系統只有文字輸入,沒有聲音,也沒有影像,還算 NLP 嗎? → 算,NLP 的主要對象就是文字與語言結構。

自然語言處理 在 iPAS 考試中的重點

根據歷年統計,自然語言處理 相關題目 平均佔 AI 技術類考題 8%, 屬於高頻考範圍。

常見出題方向:NLP 核心技術原理(40%)、NLP 應用場景分析(40%)、NLP 技術選型判斷(20%)。

相關術語

常見問題

NLP 和 AI 是一樣嗎?

不是,NLP 只是 AI 的一個分支。

它一定要用深度學習嗎?

不一定,傳統統計方法也屬於 NLP。

分詞為什麼常被提到?

因為它是中文 NLP 最基礎的前處理步驟之一。

資料來源

← 回到 自然語言處理 快查頁

測驗你對 自然語言處理 的理解

透過模擬考系統檢驗學習成果

開始測驗