知識圖譜嵌入 是什麼?

Knowledge Graph Embedding:知識圖譜嵌入 的完整解釋

一種技術,將知識圖譜中的實體和關係嵌入到連續向量空間,以便進行關係預測和推理。

核心概念

知識圖譜是結構化數據的表示,包含實體(nodes)和關係(edges)。傳統知識圖譜是符號表示(離散、符號化),不利於機器學習。嵌入技術將符號表示轉換為向量表示,從而能應用深度學習、相似度計算等技巧。

KGE 的目標是學習到一個評分函數 f(h, r, t),使得:

  • 正確三元組(h, r, t)的評分高(接近 1 或 0)
  • 負例三元組的評分低

通過這個學習過程,實體和關係的嵌入向量編碼了知識圖譜的結構和語義。

運作原理

  • 基礎評分函數:不同的 KGE 方法定義不同的評分函數。常見的包括:

  • TransE:最簡單和最知名的方法。假設 h + r ≈ t(頭實體加上關係向量接近尾實體),評分為 -||h + r - t||。

  • TransH:改進 TransE,允許關係有不同的表示空間。在關係特定的超平面上進行平移。

  • TransR:進一步改進,每個關係有自己的投影矩陣,將實體投影到關係特定的空間。

  • RotatE:將嵌入解釋為複數空間,使用旋轉表示關係。評分為 -||h * r - t||,其中 * 表示逐元素複數乘法(旋轉)。

  • DistMult:使用雙線性評分函數,適合建模對稱關係。評分為 h^T diag(r) t。

  • ComplEx:DistMult 在複數域的擴展,能建模不對稱關係。

  • 訓練目標:使用負採樣和邊際損失訓練:

  • L = Σ [γ + f(h', r, t') - f(h, r, t)]_+

其中 (h', r, t') 是負例,γ 是邊際(margin),[x]_+ = max(0, x)。

  • 優化:使用隨機梯度下降或 Adam 優化器,常與正規化(實體/關係嵌入範數約束)結合。

實際應用

  • 知識圖譜補全:Google 知識圖譜、DBpedia、Freebase 等大規模知識圖譜都包含缺失的三元組。KGE 預測新的三元組,擴充知識圖譜。

  • 推薦系統:使用知識圖譜的項目、屬性、用戶交互,KGE 學習隱向量,改進推薦精度。阿里巴巴、騰訊等應用此技術。

  • 問答系統:在開放域問答中,KGE 幫助從知識圖譜檢索相關實體和關係,回答「誰是…」、「什麼是…」等問題。

  • 實體對齊:在多個知識圖譜間識別相同實體(如維基百科和 DBpedia 中的同一人物)。KGE 提供統一的向量空間。

  • 語義搜尋:利用嵌入的語義相似性,改進搜尋引擎的結果。查詢可轉換為向量,與實體嵌入比較找最相似的實體。

  • 鏈接預測和關係分類:預測兩個實體間的關係類型,用於自動知識圖譜構建和信息抽取。

常見誤區

  • 誤區一:所有 KGE 方法在所有圖上性能相同。不同方法針對不同類型的關係優化。TransE 對一對多、多對一關係表現差,RotatE 和 ComplEx 更適合這些情況。選型需根據圖的關係特性而定。

  • 誤區二:嵌入維數越高越好。高維嵌入增加參數,容易過擬合。常見維數為 50-200,超過 500 通常無益。最優維數需透過實驗確定。

  • 誤區三:KGE 能自動發現隱藏的關係。KGE 只能預測訓練時見過的關係類型。對於新出現的關係類型或跨領域的類比,KGE 無法直接應用。

  • 誤區四:KGE 評分高的三元組一定正確。模型訓練的目標是在正例上評分高於負例,但這不保證預測是邏輯上正確的。常見情況是模型學到虛假的統計相關性而非因果關係。

與相關技術的比較

  • 圖神經網路:GNN 在知識圖譜上聚合鄰域特徵,學習節點表示。KGE 方法(尤其是基於平移的方法)不直接利用結構信息,而是基於評分函數優化。混合方法結合二者優勢。

  • 符號推理:符號知識圖譜推理使用邏輯規則(如 SPARQL 查詢)。KGE 是統計方法,能處理不完整和不確定的知識,但缺乏符號推理的可解釋性。

  • 語言模型嵌入:預訓練語言模型(如 BERT)能為文本生成嵌入。KGE 專門針對知識圖譜的結構,與語言模型可互補(如將實體描述與結構嵌入結合)。

  • 路徑排名演算法(PageRank):PageRank 是圖的全局排序演算法,不學習嵌入。KGE 學習局部的向量表示,更適合相似度計算和關係預測。

常見問題