自然語言處理 是什麼?
Natural Language Processing:自然語言處理 的完整解釋
自然語言處理使電腦能理解、分析和生成人類語言,是 AI 語音助理與翻譯等應用的核心技術
容易混淆
自然語言處理 vs 自然語言理解 自然語言處理:整個大領域 自然語言理解:偏理解語意的子領域 最關鍵的區別:先看它是在比什麼,再看它怎麼做。
自然語言處理 vs 語音辨識 自然語言處理:處理文字 語音辨識:先把聲音轉成文字 最關鍵的區別:先看它是在比什麼,再看它怎麼做。
記住這句就好
人話要先變成電腦看得懂的資料。
實際案例
搜尋引擎 把查詢切詞、去停用詞、理解意圖,找出最相關頁面。
客服系統 把使用者輸入分成意圖、實體、和回覆內容,再走後續流程。
算法與應用
NLP 的工作鏈很長,常包含文字前處理、特徵表示、理解、與生成。 現代 NLP 幾乎都離不開語言模型。 它的難點在語意、上下文、歧義和跨語言差異。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 自然語言處理 | 台灣正式用語 |
| 自然语言处理 | 簡體寫法,簡體資料的標準用語 |
| Natural Language Processing | 英文原名 |
| NLP | 標準縮寫,注意這個縮寫在心理學領域另指神經語言程式學,是完全不同的東西 |
| 自然語言理解(NLU)/自然語言生成(NLG) | 自然語言處理底下的兩個子領域,前者管讀懂,後者管寫出 |
這個領域包含哪些任務
| 層次 | 代表任務 |
|---|---|
| 詞彙層 | 斷詞、詞性標註、詞幹還原、命名實體識別 |
| 句法層 | 依存句法分析、成分句法分析 |
| 語意層 | 語意角色標註、指代消解、情感分析 |
| 語用與應用層 | 機器翻譯、摘要、問答、對話、檢索 |
中文的處理跟英文有一個關鍵差異:中文沒有空格分詞。英文靠空格就能切出詞,中文得先做斷詞,而斷詞本身就是一個容易出錯的任務(「研究生命起源」可以切成「研究生/命/起源」或「研究/生命/起源」)。這也是為什麼子詞切分(subword tokenization)對中文特別重要。
從規則到大型語言模型的三個階段
規則時期(1950 到 1990 年代):語言學家手寫文法規則與詞典。優點是可解釋、可控,缺點是覆蓋不了語言的無窮變化,維護成本隨規則數量爆炸。
統計與機器學習時期(1990 到 2013 年前後):改用標註語料訓練統計模型,代表方法有隱馬可夫模型、條件隨機場、以及統計式機器翻譯。這時期的主力工作是特徵工程。
深度學習與預訓練時期(2013 年之後):先是詞向量(word2vec、GloVe)讓詞有了連續的語意表示,接著循環神經網路與注意力機制處理序列,2017 年 Transformer 架構問世後,預訓練加微調成為標準流程,再演進到現在的大型語言模型。
現在的實務分工大致是:需要生成、需要跨任務彈性,用大型語言模型;需要低延遲、低成本、固定輸出格式的分類與抽取,用小型編碼器模型微調仍然更划算。
情境判斷
Q1(直覺題):你要讓系統看懂一句中文並判斷意圖,這屬於什麼? → 自然語言處理,因為核心是讓機器處理人類語言。
Q2(判斷題):如果一個系統只有文字輸入,沒有聲音,也沒有影像,還算 NLP 嗎? → 算,NLP 的主要對象就是文字與語言結構。
自然語言處理 在 iPAS 考試中的重點
根據歷年統計,自然語言處理 相關題目 平均佔 AI 技術類考題 8%, 屬於高頻考範圍。
常見出題方向:NLP 核心技術原理(40%)、NLP 應用場景分析(40%)、NLP 技術選型判斷(20%)。
相關術語
常見問題
NLP 和 AI 是一樣嗎?
不是,NLP 只是 AI 的一個分支。
它一定要用深度學習嗎?
不一定,傳統統計方法也屬於 NLP。
分詞為什麼常被提到?
因為它是中文 NLP 最基礎的前處理步驟之一。
資料來源
- iPAS AI 應用規劃師評鑑內容範圍參考(115.02) ,經濟部產業人才能力鑑定