詞頻-逆文檔頻率(TF-IDF)是什麼?

TF-IDF 是信息檢索和文本挖掘中的經典特徵提取方法。它通過計算詞的局部重要性(TF)和全局重要性(IDF)的乘積,評估詞在文檔中的相關性。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
TF-IDF
主題標籤
自然語言處理、信息檢索、特徵提取
考點定位
非 iPAS 核心術語
最後更新
2026/06/23
詞頻-逆文檔頻率(TF-IDF)是什麼? 自然語言處理信息檢索
術語快查

搜尋意圖: 如果你在找「詞頻-逆文檔頻率 是什麼」或「詞頻-逆文檔頻率 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: TF-IDF 是信息檢索和文本挖掘中的經典特徵提取方法。它通過計算詞的局部重要性(TF)和全局重要性(IDF)的乘積,評估詞在文檔中的相關性。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

TF-IDF 是信息檢索和文本挖掘中的經典特徵提取方法。它通過計算詞的局部重要性(TF)和全局重要性(IDF)的乘積,評估詞在文檔中的相關性。

核心概念

TF-IDF 由兩個部分組成:

  1. 詞頻(Term Frequency, TF):衡量一個詞在單個文檔中出現的頻率。最簡單的方式是詞的原始計數,但更常見的是使用歸一化的頻率,如 TF(t, d) = 詞t在文檔d中出現的次數 / 文檔d的總詞數

  2. 逆文檔頻率(Inverse Document Frequency, IDF):衡量一個詞在整個文檔集合中的稀有程度。常見的計算方式為 IDF(t) = log(N / df(t)),其中 N 是總文檔數,df(t) 是包含詞 t 的文檔數。

最終的 TF-IDF 值為:TF-IDF(t, d) = TF(t, d) × IDF(t)

這個值越大,說明這個詞對該文檔的區分度越高,即該詞對確定文檔主題越有幫助。

運作原理

TF-IDF 的計算遵循以下邏輯:

  1. 建立詞彙表:將所有文檔分詞後,去除停用詞,建立唯一詞彙的表。

  2. 計算 TF:對每個文檔,計算其中每個詞的相對頻率。

  3. 計算 IDF:統計每個詞出現在多少個文檔中,計算其 IDF 值。

  4. 計算 TF-IDF:將 TF 和 IDF 相乘,得到每個詞在每個文檔中的 TF-IDF 值。

  5. 文檔向量化:每個文檔可以表示為一個向量,其中每維代表一個詞的 TF-IDF 值。

實際應用

TF-IDF 被廣泛應用於:

  • 信息檢索:搜索引擎的早期排序算法
  • 文本分類:將文檔的 TF-IDF 向量作為分類器的輸入
  • 文本相似度計算:利用向量空間模型計算文檔間的相似性
  • 關鍵詞提取:識別文檔中最重要的詞彙
  • 垃圾郵件檢測:提取郵件的特徵向量用於分類
  • 推薦系統:計算內容之間的相似度

常見誤區

許多人認為 TF-IDF 已經完全過時,但實際上它仍然是一個有效的基線方法。它不僅在資源有限的場景中仍然實用,而且在許多情況下,當與新的深度學習方法結合時,仍能提供價值。此外,理解 TF-IDF 對於理解更複雜的文本表示方法(如 Word2Vec、BERT)的基礎概念非常重要。

常見問題

為什麼 TF-IDF 中要除以文檔長度?

除以文檔長度是為了進行長度歸一化。如果不進行歸一化,長文檔會因為包含更多的詞而自然獲得更高的 TF 值,即使這些詞對確定文檔主題沒有特殊意義。歸一化確保了詞頻的公平比較,使得短文檔和長文檔的詞頻值具有可比性。

TF-IDF 在處理語言多樣性時有什麼限制?

TF-IDF 基於詞袋模型,完全忽略了詞的順序和句子結構,也無法理解詞之間的語義關係。例如,同義詞會被視為完全不同的詞。此外,它還難以處理多語言文本、符號和特殊術語等。現代的方法如詞嵌入(Word2Vec、GloVe)和語言模型(BERT)能更好地捕捉語義信息。

TF-IDF 與現代深度學習方法相比如何?

深度學習方法(如 BERT、GPT)能夠捕捉更複雜的語義和句法信息,通常在各種 NLP 任務上表現更優。然而,TF-IDF 仍有優勢:它計算簡單、無需大規模訓練數據、可解釋性強、計算速度快。在資源有限或需要快速實現的場景中,TF-IDF 仍然是一個可靠的選擇。許多現代系統會結合兩者,使用 TF-IDF 作為初步篩選或基線方法。