知識圖譜嵌入 是什麼?
Knowledge Graph Embedding:知識圖譜嵌入 的完整解釋
一種技術,將知識圖譜中的實體和關係嵌入到連續向量空間,以便進行關係預測和推理。
核心概念
知識圖譜是結構化數據的表示,包含實體(nodes)和關係(edges)。傳統知識圖譜是符號表示(離散、符號化),不利於機器學習。嵌入技術將符號表示轉換為向量表示,從而能應用深度學習、相似度計算等技巧。
KGE 的目標是學習到一個評分函數 f(h, r, t),使得:
- 正確三元組(h, r, t)的評分高(接近 1 或 0)
- 負例三元組的評分低
通過這個學習過程,實體和關係的嵌入向量編碼了知識圖譜的結構和語義。
運作原理
基礎評分函數:不同的 KGE 方法定義不同的評分函數。常見的包括:
TransE:最簡單和最知名的方法。假設 h + r ≈ t(頭實體加上關係向量接近尾實體),評分為 -||h + r - t||。
TransH:改進 TransE,允許關係有不同的表示空間。在關係特定的超平面上進行平移。
TransR:進一步改進,每個關係有自己的投影矩陣,將實體投影到關係特定的空間。
RotatE:將嵌入解釋為複數空間,使用旋轉表示關係。評分為 -||h * r - t||,其中 * 表示逐元素複數乘法(旋轉)。
DistMult:使用雙線性評分函數,適合建模對稱關係。評分為 h^T diag(r) t。
ComplEx:DistMult 在複數域的擴展,能建模不對稱關係。
訓練目標:使用負採樣和邊際損失訓練:
L = Σ [γ + f(h', r, t') - f(h, r, t)]_+
其中 (h', r, t') 是負例,γ 是邊際(margin),[x]_+ = max(0, x)。
- 優化:使用隨機梯度下降或 Adam 優化器,常與正規化(實體/關係嵌入範數約束)結合。
實際應用
知識圖譜補全:Google 知識圖譜、DBpedia、Freebase 等大規模知識圖譜都包含缺失的三元組。KGE 預測新的三元組,擴充知識圖譜。
推薦系統:使用知識圖譜的項目、屬性、用戶交互,KGE 學習隱向量,改進推薦精度。阿里巴巴、騰訊等應用此技術。
問答系統:在開放域問答中,KGE 幫助從知識圖譜檢索相關實體和關係,回答「誰是…」、「什麼是…」等問題。
實體對齊:在多個知識圖譜間識別相同實體(如維基百科和 DBpedia 中的同一人物)。KGE 提供統一的向量空間。
語義搜尋:利用嵌入的語義相似性,改進搜尋引擎的結果。查詢可轉換為向量,與實體嵌入比較找最相似的實體。
鏈接預測和關係分類:預測兩個實體間的關係類型,用於自動知識圖譜構建和信息抽取。
常見誤區
誤區一:所有 KGE 方法在所有圖上性能相同。不同方法針對不同類型的關係優化。TransE 對一對多、多對一關係表現差,RotatE 和 ComplEx 更適合這些情況。選型需根據圖的關係特性而定。
誤區二:嵌入維數越高越好。高維嵌入增加參數,容易過擬合。常見維數為 50-200,超過 500 通常無益。最優維數需透過實驗確定。
誤區三:KGE 能自動發現隱藏的關係。KGE 只能預測訓練時見過的關係類型。對於新出現的關係類型或跨領域的類比,KGE 無法直接應用。
誤區四:KGE 評分高的三元組一定正確。模型訓練的目標是在正例上評分高於負例,但這不保證預測是邏輯上正確的。常見情況是模型學到虛假的統計相關性而非因果關係。
與相關技術的比較
圖神經網路:GNN 在知識圖譜上聚合鄰域特徵,學習節點表示。KGE 方法(尤其是基於平移的方法)不直接利用結構信息,而是基於評分函數優化。混合方法結合二者優勢。
符號推理:符號知識圖譜推理使用邏輯規則(如 SPARQL 查詢)。KGE 是統計方法,能處理不完整和不確定的知識,但缺乏符號推理的可解釋性。
語言模型嵌入:預訓練語言模型(如 BERT)能為文本生成嵌入。KGE 專門針對知識圖譜的結構,與語言模型可互補(如將實體描述與結構嵌入結合)。
路徑排名演算法(PageRank):PageRank 是圖的全局排序演算法,不學習嵌入。KGE 學習局部的向量表示,更適合相似度計算和關係預測。