連結預測(Link Prediction)是什麼?

一種圖學習任務,目標是預測圖中兩個節點之間是否存在或將存在邊的連結。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Link Prediction
主題標籤
機器學習、深度學習、知識圖譜
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
連結預測(Link Prediction)是什麼? 機器學習深度學習
術語快查

搜尋意圖: 如果你在找「連結預測 是什麼」或「連結預測 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 一種圖學習任務,目標是預測圖中兩個節點之間是否存在或將存在邊的連結。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

一種圖學習任務,目標是預測圖中兩個節點之間是否存在或將存在邊的連結。

核心概念

連結預測透過學習節點的低維表示,然後基於節點對的表示相似度預測邊的存在。核心假設是相似的節點表示更容易之間有邊。這個假設在大多數真實圖上成立,因為相同類型或相近的實體傾向相連。

連結預測與節點分類的重要區別是,連結預測是邊級任務(預測邊),而節點分類是節點級任務。這使得連結預測對圖拓撲變化更敏感,更能反映模型對圖結構的學習。

運作原理

  • 節點嵌入學習:使用 GNN(GCN、GAT 等)對圖進行前向傳播,得到每個節點的最終表示向量 z_u 和 z_v。

  • 邊評分函數:定義邊評分函數,衡量節點對 (u, v) 間的邊概率。常用的評分函數包括:

  • 內積:score(u, v) = z_u^T z_v

  • 餘弦相似度:score(u, v) = (z_u · z_v) / (||z_u|| · ||z_v||)

  • 多層感知器:score(u, v) = MLP([z_u; z_v])

  • 距離:score(u, v) = -||z_u - z_v||_2

  • 二元分類:將評分透過 sigmoid 函數轉換為 0-1 之間的概率,表示存在邊的機率。

  • 訓練:在已知邊(正例)和不存在邊的節點對(負例)上計算二元交叉熵損失。負採樣策略(如隨機採樣、難負採樣)對訓練效果影響重大。

  • 推理:在測試時,對所有未見過的節點對計算評分,排序後預測最高分的節點對存在邊。

實際應用

  • 社交網路推薦:Facebook、LinkedIn 等使用連結預測推薦好友。根據現有好友關係和使用者特徵,預測兩個陌生人成為朋友的概率。

  • 知識圖譜補全:知識圖譜中存在大量缺失關係。使用連結預測補全知識圖譜,如預測未知的人物關係、地點屬性等。Google 知識圖譜利用此技術。

  • 推薦系統:在使用者-物品二部圖上進行連結預測,等同於預測使用者會購買或點擊哪些物品。Amazon、Netflix 等應用此技術。

  • 蛋白質相互作用預測:在蛋白質互作網路中預測兩個蛋白質是否相互作用。這對藥物發現和生物學研究至關重要。

  • 交通流量預測:在交通網路上預測未來道路間的連接強度(流量),用於交通規劃和智慧出行。

  • 詐欺檢測:在金融交易網路上,預測異常交易對(可能為欺詐)。

常見誤區

  • 誤區一:連結預測只需比較節點表示的相似度。即使節點表示學得很好,邊評分函數的設計也很重要。簡單的內積可能不足以捕捉複雜的關係。多層感知器等更複雜的評分函數通常更有效。

  • 誤區二:負採樣越多越好。適量的負採樣有助於訓練,但過多負採樣會導致類別不均衡,損害模型性能。常見做法是負採樣數與正例相等或稍多(1:1 到 1:10)。

  • 誤區三:連結預測精度在大型圖上總是很高。在大規模、稀疏、特徵豐富的圖上,連結預測往往困難。可能需要特殊的採樣策略、負採樣技巧或模型改進。

  • 誤區四:邊評分函數無關緊要。實驗表明,選擇不同的評分函數(如內積 vs. MLP)會導致性能差異 5-10%。對應用應根據圖性質和邊的語義選擇適當的評分函數。

與相關技術的比較

  • 節點分類:節點分類預測節點的離散標籤,連結預測預測邊的存在(二元分類)。節點分類利用節點特徵和結構,連結預測重點在於學習兩個節點間的相似度。

  • 圖匹配:圖匹配尋找兩個圖之間的結構相似性。連結預測在單一圖內預測缺失邊。兩者都涉及圖結構,但問題定義和方法不同。

  • 推薦系統:推薦系統通常是連結預測在二部圖上的應用。推薦系統額外考慮時間動態、隱含反饋等因素。

  • 隨機遊走/Node2Vec:這些無監督方法學習節點嵌入而不依賴邊標籤,可用於連結預測。但無監督嵌入通常劣於有監督的 GNN 方法。

常見問題

在連結預測中,訓練時應使用哪些邊作為負例?

標準做法是使用不存在的邊(即訓練圖中沒有連接的節點對)作為負例。但若簡單隨機採樣,可能樣本過於簡單(大多數隨機對都不存在邊)。難負採樣策略包括:(1) 根據高次相似度節點對採樣(如共同鄰居多的節點對),(2) 基於模型分數採樣(困難的錯誤預測),(3) 根據結構距離採樣(如距離為 3 的節點對)。難負採樣能提升模型的區分能力。

如何評估連結預測模型?

常見的評估指標包括:(1) AUC(Area Under ROC Curve),衡量模型的排序能力,(2) 平均精度(AP),關注排序靠前的正例,(3) Hit@K,評估前 K 個預測中有多少是正確的,(4) NDCG,考慮排序位置的加權指標。不同應用場景可能選擇不同指標。AUC 是最常用的,因為它不依賴於決策閾值。

連結預測在靜態圖和動態圖上有何不同?

靜態連結預測在固定圖上預測缺失邊,訓練測試邊集不重疊即可。動態連結預測預測未來時刻的新邊,需要時間序列信息。動態設定更複雜,因為圖結構和節點特徵隨時間演變。模型需捕捉演變模式,如使用循環網路或時態圖神經網路。動態設定更貼近現實(社交網路、引用網路都隨時間變化),但評估更困難。