節點分類 是什麼?

Node Classification:節點分類 的完整解釋

一種圖學習任務,目標是為圖中的節點預測標籤或類別,利用圖結構和節點特徵進行學習。

核心概念

節點分類是監督或半監督學習任務,將圖的節點分為多個預定義的類別。在標準監督設定中,需要完整的標籤集;在半監督設定中(更常見),只有少量標籤節點。模型透過以下方式進行學習:

  1. 利用已標籤節點的特徵和標籤進行訓練
  2. 透過圖結構傳播資訊(節點傾向與相鄰節點同類)
  3. 預測無標籤節點的標籤

節點分類背後的假設是「同質性假設」(homophily assumption):相連節點更可能屬於同一類別。這個假設在社交網路、引文網路中通常成立,但在某些異質圖或推薦系統中可能不成立。

運作原理

  • 特徵表示:每個節點初始有特徵向量,可來自多種來源:

  • 內容特徵:文本、屬性、元數據

  • 結構特徵:度數、三角形計數等

  • 學習特徵:由深度模型自動提取

  • 圖神經網路聚合:使用 GCN、GAT 或其他 GNN,利用圖結構傳播資訊。每層 GNN 對節點聚合鄰域資訊,逐漸形成包含多跳鄰域資訊的表示。

  • 分類器:在 GNN 的最後一層輸出上接一個分類頭(如 softmax 線性層),輸出節點屬於各類的機率分佈。

  • 訓練:在已標籤節點上計算交叉熵損失,使用反向傳播更新 GNN 和分類器參數。

  • 評估:在獨立的測試集上評估準確率、精準率、召回率等指標。在半監督設定中,常使用引文網路(Cora、Citeseer、Pubmed)作為標準基準。

實際應用

  • 社交網路分析:預測使用者屬性(興趣類別、年齡群組等)。Facebook、LinkedIn 等利用好友關係和用戶行為進行使用者分類,用於定向廣告和推薦。

  • 引文網路分類:在學術論文引用網路上,根據論文內容和引用關係預測研究領域或主題。這是最經典的節點分類基準。

  • 蛋白質功能預測:在蛋白質互作網路上,根據結構相似性和相互作用預測蛋白質的生物學功能。

  • 網頁分類:在網際網路的超連結圖上預測網頁的主題類別,用於搜尋引擎排名或內容推薦。

  • 欺詐檢測:在交易網路或社交網路上,結合交易特徵和網路結構偵測欺詐行為。銀行、電商等應用此技術。

  • 藥物靶點發現:在蛋白質相互作用網路和疾病基因網路上,預測基因與疾病的關聯。

常見誤區

  • 誤區一:節點分類總是遵循同質性假設。在推薦系統(使用者-物品二部圖)、異質圖、或社交網路中的反抗性關係中,相連節點可能屬於不同類別。此時簡單的圖傳播反而有害。

  • 誤區二:更多訓練標籤總是更好。在半監督設定中,標籤節點比例過高會削弱圖結構的作用,使 GNN 退化為無圖的文本分類。最優的標籤比例需要實驗確定。

  • 誤區三:任何圖都適合節點分類。若圖本身無結構信息(隨機圖)或節點特徵已充分區分,圖結構貢獻有限。節點分類受益於結構有意義、標籤分佈不均的圖。

  • 誤區四:節點分類精度接近 100% 表示學習完美。引文網路(Cora、Citeseer)等基準中,簡單特徵已能達到 80% 左右精度。更高精度往往來自過擬合或基準本身標籤品質不高。

與相關技術的比較

  • 文本分類:節點分類類似文本分類,但額外利用了圖結構。若忽略圖結構,節點分類退化為文本分類。圖結構可以平滑標籤傳播,改進少標籤或新類別上的性能。

  • 社交網路推理:推理(如預測關注、預測互動)通常針對特定邊或用戶對。節點分類針對節點本身,更多利用內容和全局結構。

  • 圖分類:圖分類對整個圖進行分類(如分子是否有毒性)。節點分類對圖內的節點分類。二者都用 GNN,但汇聚策略不同(圖分類最後通常用全局池化)。

  • 連結預測:連結預測預測兩個節點間是否存在邊。節點分類預測節點的標籤。二者都利用圖結構,但目標不同。

常見問題