詞頻-逆文檔頻率 是什麼?
TF-IDF:詞頻-逆文檔頻率 的完整解釋
TF-IDF 是信息檢索和文本挖掘中的經典特徵提取方法。它通過計算詞的局部重要性(TF)和全局重要性(IDF)的乘積,評估詞在文檔中的相關性。
核心概念
TF-IDF 由兩個部分組成:
詞頻(Term Frequency, TF):衡量一個詞在單個文檔中出現的頻率。最簡單的方式是詞的原始計數,但更常見的是使用歸一化的頻率,如
TF(t, d) = 詞t在文檔d中出現的次數 / 文檔d的總詞數。逆文檔頻率(Inverse Document Frequency, IDF):衡量一個詞在整個文檔集合中的稀有程度。常見的計算方式為
IDF(t) = log(N / df(t)),其中 N 是總文檔數,df(t) 是包含詞 t 的文檔數。
最終的 TF-IDF 值為:TF-IDF(t, d) = TF(t, d) × IDF(t)
這個值越大,說明這個詞對該文檔的區分度越高,即該詞對確定文檔主題越有幫助。
運作原理
TF-IDF 的計算遵循以下邏輯:
建立詞彙表:將所有文檔分詞後,去除停用詞,建立唯一詞彙的表。
計算 TF:對每個文檔,計算其中每個詞的相對頻率。
計算 IDF:統計每個詞出現在多少個文檔中,計算其 IDF 值。
計算 TF-IDF:將 TF 和 IDF 相乘,得到每個詞在每個文檔中的 TF-IDF 值。
文檔向量化:每個文檔可以表示為一個向量,其中每維代表一個詞的 TF-IDF 值。
實際應用
TF-IDF 被廣泛應用於:
- 信息檢索:搜索引擎的早期排序算法
- 文本分類:將文檔的 TF-IDF 向量作為分類器的輸入
- 文本相似度計算:利用向量空間模型計算文檔間的相似性
- 關鍵詞提取:識別文檔中最重要的詞彙
- 垃圾郵件檢測:提取郵件的特徵向量用於分類
- 推薦系統:計算內容之間的相似度
常見誤區
許多人認為 TF-IDF 已經完全過時,但實際上它仍然是一個有效的基線方法。它不僅在資源有限的場景中仍然實用,而且在許多情況下,當與新的深度學習方法結合時,仍能提供價值。此外,理解 TF-IDF 對於理解更複雜的文本表示方法(如 Word2Vec、BERT)的基礎概念非常重要。