節點分類(Node Classification)是什麼?

一種圖學習任務,目標是為圖中的節點預測標籤或類別,利用圖結構和節點特徵進行學習。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Node Classification
主題標籤
機器學習、深度學習、神經網路
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
節點分類(Node Classification)是什麼? 機器學習深度學習
術語快查

搜尋意圖: 如果你在找「節點分類 是什麼」或「節點分類 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 一種圖學習任務,目標是為圖中的節點預測標籤或類別,利用圖結構和節點特徵進行學習。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

一種圖學習任務,目標是為圖中的節點預測標籤或類別,利用圖結構和節點特徵進行學習。

核心概念

節點分類是監督或半監督學習任務,將圖的節點分為多個預定義的類別。在標準監督設定中,需要完整的標籤集;在半監督設定中(更常見),只有少量標籤節點。模型透過以下方式進行學習:

  1. 利用已標籤節點的特徵和標籤進行訓練
  2. 透過圖結構傳播資訊(節點傾向與相鄰節點同類)
  3. 預測無標籤節點的標籤

節點分類背後的假設是「同質性假設」(homophily assumption):相連節點更可能屬於同一類別。這個假設在社交網路、引文網路中通常成立,但在某些異質圖或推薦系統中可能不成立。

運作原理

  • 特徵表示:每個節點初始有特徵向量,可來自多種來源:

  • 內容特徵:文本、屬性、元數據

  • 結構特徵:度數、三角形計數等

  • 學習特徵:由深度模型自動提取

  • 圖神經網路聚合:使用 GCN、GAT 或其他 GNN,利用圖結構傳播資訊。每層 GNN 對節點聚合鄰域資訊,逐漸形成包含多跳鄰域資訊的表示。

  • 分類器:在 GNN 的最後一層輸出上接一個分類頭(如 softmax 線性層),輸出節點屬於各類的機率分佈。

  • 訓練:在已標籤節點上計算交叉熵損失,使用反向傳播更新 GNN 和分類器參數。

  • 評估:在獨立的測試集上評估準確率、精準率、召回率等指標。在半監督設定中,常使用引文網路(Cora、Citeseer、Pubmed)作為標準基準。

實際應用

  • 社交網路分析:預測使用者屬性(興趣類別、年齡群組等)。Facebook、LinkedIn 等利用好友關係和用戶行為進行使用者分類,用於定向廣告和推薦。

  • 引文網路分類:在學術論文引用網路上,根據論文內容和引用關係預測研究領域或主題。這是最經典的節點分類基準。

  • 蛋白質功能預測:在蛋白質互作網路上,根據結構相似性和相互作用預測蛋白質的生物學功能。

  • 網頁分類:在網際網路的超連結圖上預測網頁的主題類別,用於搜尋引擎排名或內容推薦。

  • 欺詐檢測:在交易網路或社交網路上,結合交易特徵和網路結構偵測欺詐行為。銀行、電商等應用此技術。

  • 藥物靶點發現:在蛋白質相互作用網路和疾病基因網路上,預測基因與疾病的關聯。

常見誤區

  • 誤區一:節點分類總是遵循同質性假設。在推薦系統(使用者-物品二部圖)、異質圖、或社交網路中的反抗性關係中,相連節點可能屬於不同類別。此時簡單的圖傳播反而有害。

  • 誤區二:更多訓練標籤總是更好。在半監督設定中,標籤節點比例過高會削弱圖結構的作用,使 GNN 退化為無圖的文本分類。最優的標籤比例需要實驗確定。

  • 誤區三:任何圖都適合節點分類。若圖本身無結構信息(隨機圖)或節點特徵已充分區分,圖結構貢獻有限。節點分類受益於結構有意義、標籤分佈不均的圖。

  • 誤區四:節點分類精度接近 100% 表示學習完美。引文網路(Cora、Citeseer)等基準中,簡單特徵已能達到 80% 左右精度。更高精度往往來自過擬合或基準本身標籤品質不高。

與相關技術的比較

  • 文本分類:節點分類類似文本分類,但額外利用了圖結構。若忽略圖結構,節點分類退化為文本分類。圖結構可以平滑標籤傳播,改進少標籤或新類別上的性能。

  • 社交網路推理:推理(如預測關注、預測互動)通常針對特定邊或用戶對。節點分類針對節點本身,更多利用內容和全局結構。

  • 圖分類:圖分類對整個圖進行分類(如分子是否有毒性)。節點分類對圖內的節點分類。二者都用 GNN,但汇聚策略不同(圖分類最後通常用全局池化)。

  • 連結預測:連結預測預測兩個節點間是否存在邊。節點分類預測節點的標籤。二者都利用圖結構,但目標不同。

常見問題

在半監督節點分類中,訓練集、驗證集、測試集如何劃分?

標準做法是從所有節點中隨機抽取小比例(如 5-20%)作為訓練集,另外 10-30% 作為驗證集用於超參調整,剩餘作為測試集。關鍵是三個集合不重疊,且測試集保留到最後才評估。值得注意的是,圖的邊是固定的,在所有集合中共享;只有節點標籤被劃分。某些研究會刪除測試集節點的相關邊以加大難度,但標準基準(如 Cora)不這麼做。

如何處理標籤不均衡的節點分類問題?

標籤不均衡(某些類別樣本過少)會導致模型偏向多數類。常用的應對策略包括:(1) 加權損失函數,對稀有類使用更高權重,(2) 過採樣(復制稀有類樣本)或欠採樣(移除多數類樣本),(3) 使用焦點損失(focal loss)強調困難樣本,(4) 使用微調的評估指標(如宏平均)而非整體準確率。對於高度不均衡的情況,可結合圖結構的標籤傳播(如標籤傳播演算法)初始化,提升模型對稀有類的敏感性。

節點分類模型如何泛化到看不見的節點?

標準的歸納設定中,節點分類模型在訓練集基礎上預測測試集(兩者都是已知圖的一部分)。若要預測完全新加入的節點(圖外推),模型需要基於節點特徵進行預測,不能依賴其他節點的資訊(因為新節點未連接到圖)。這種情況下,GNN 的優勢大幅降低,可能回到簡單的特徵分類器。若新節點有初始邊(如推薦系統中新用戶的初始評分),可以進行一步或多步局部 GNN 推理。