搜尋意圖: 如果你在找「詞頻-逆文檔頻率 是什麼」或「詞頻-逆文檔頻率 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: TF-IDF 是信息檢索和文本挖掘中的經典特徵提取方法。它通過計算詞的局部重要性(TF)和全局重要性(IDF)的乘積,評估詞在文檔中的相關性。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
TF-IDF 是信息檢索和文本挖掘中的經典特徵提取方法。它通過計算詞的局部重要性(TF)和全局重要性(IDF)的乘積,評估詞在文檔中的相關性。
核心概念
TF-IDF 由兩個部分組成:
詞頻(Term Frequency, TF):衡量一個詞在單個文檔中出現的頻率。最簡單的方式是詞的原始計數,但更常見的是使用歸一化的頻率,如
TF(t, d) = 詞t在文檔d中出現的次數 / 文檔d的總詞數。逆文檔頻率(Inverse Document Frequency, IDF):衡量一個詞在整個文檔集合中的稀有程度。常見的計算方式為
IDF(t) = log(N / df(t)),其中 N 是總文檔數,df(t) 是包含詞 t 的文檔數。
最終的 TF-IDF 值為:TF-IDF(t, d) = TF(t, d) × IDF(t)
這個值越大,說明這個詞對該文檔的區分度越高,即該詞對確定文檔主題越有幫助。
運作原理
TF-IDF 的計算遵循以下邏輯:
建立詞彙表:將所有文檔分詞後,去除停用詞,建立唯一詞彙的表。
計算 TF:對每個文檔,計算其中每個詞的相對頻率。
計算 IDF:統計每個詞出現在多少個文檔中,計算其 IDF 值。
計算 TF-IDF:將 TF 和 IDF 相乘,得到每個詞在每個文檔中的 TF-IDF 值。
文檔向量化:每個文檔可以表示為一個向量,其中每維代表一個詞的 TF-IDF 值。
實際應用
TF-IDF 被廣泛應用於:
- 信息檢索:搜索引擎的早期排序算法
- 文本分類:將文檔的 TF-IDF 向量作為分類器的輸入
- 文本相似度計算:利用向量空間模型計算文檔間的相似性
- 關鍵詞提取:識別文檔中最重要的詞彙
- 垃圾郵件檢測:提取郵件的特徵向量用於分類
- 推薦系統:計算內容之間的相似度
常見誤區
許多人認為 TF-IDF 已經完全過時,但實際上它仍然是一個有效的基線方法。它不僅在資源有限的場景中仍然實用,而且在許多情況下,當與新的深度學習方法結合時,仍能提供價值。此外,理解 TF-IDF 對於理解更複雜的文本表示方法(如 Word2Vec、BERT)的基礎概念非常重要。
常見問題
為什麼 TF-IDF 中要除以文檔長度?
除以文檔長度是為了進行長度歸一化。如果不進行歸一化,長文檔會因為包含更多的詞而自然獲得更高的 TF 值,即使這些詞對確定文檔主題沒有特殊意義。歸一化確保了詞頻的公平比較,使得短文檔和長文檔的詞頻值具有可比性。
TF-IDF 在處理語言多樣性時有什麼限制?
TF-IDF 基於詞袋模型,完全忽略了詞的順序和句子結構,也無法理解詞之間的語義關係。例如,同義詞會被視為完全不同的詞。此外,它還難以處理多語言文本、符號和特殊術語等。現代的方法如詞嵌入(Word2Vec、GloVe)和語言模型(BERT)能更好地捕捉語義信息。
TF-IDF 與現代深度學習方法相比如何?
深度學習方法(如 BERT、GPT)能夠捕捉更複雜的語義和句法信息,通常在各種 NLP 任務上表現更優。然而,TF-IDF 仍有優勢:它計算簡單、無需大規模訓練數據、可解釋性強、計算速度快。在資源有限或需要快速實現的場景中,TF-IDF 仍然是一個可靠的選擇。許多現代系統會結合兩者,使用 TF-IDF 作為初步篩選或基線方法。