圖文對齐 是什麼?
Image-Text Alignment:圖文對齐 的完整解釋
在多模態學習中,將圖像和文本的表示映射到共同的語義空間,使得語義相關的圖文對的表示相近。
核心概念
圖文對齐的核心理念是:語義相關的圖像和文本應該在向量空間中相鄰,無關的應該相距遠。具體地,模型學習兩個編碼器(圖像編碼器和文本編碼器),分別將圖像和文本映射到一個共同的嵌入空間。在該空間中,使用餘弦相似度、歐氏距離等度量來衡量圖文對的語義接近度。
圖文對齐與傳統多模態融合的區別在於:融合通常將特徵拼接或相加,而對齐則要求特徵在語義級別產生對應。對齐的圖像和文本表示可以獨立儲存和檢索,支持跨模態的相似度計算,而無需實時計算融合特徵。
圖文對齐的成功關鍵在於訓練目標的設計。最常見的是對比學習(Contrastive Learning),其目標是最大化正樣本對(匹配的圖文)的相似度,最小化負樣本對(不匹配的圖文)的相似度。
運作原理
圖文對齐的運作通常遵循以下流程:
首先是編碼器設計。圖像編碼器是一個CNN或Vision Transformer,輸入圖像,輸出固定維度的向量(如768維或512維)。文本編碼器是一個預訓練的語言模型(如BERT),輸入文本,輸出表示向量。兩個編碼器可以有不同的內部結構,但輸出維度必須相同或經過投影層後維度相同。
接著是對齐嵌入空間。兩個編碼器的輸出都被投影到相同的嵌入空間(通常維度為256或512)。投影通常是簡單的線性變換:I_embed = Image_encoder(img) @ W_i,T_embed = Text_encoder(text) @ W_t,其中W_i和W_t是可學習的投影矩陣。
然後進行對比損失計算。給定一批資料中的N個圖文對,構造一個N×N的相似度矩陣。對於第i個圖文對,圖像i與對應的文本i為正樣本,圖像i與其他的N-1個文本為負樣本。計算對比損失(如InfoNCE損失):
L_i = -log( exp(sim(I_i, T_i) / τ) / Σ_j exp(sim(I_i, T_j) / τ) )
其中sim表示相似度函數(通常是餘弦相似度),τ是溫度參數(通常0.07左右),控制相似度分佈的銳度。
最小化批內損失:平均所有樣本的損失。由於使用了批內的所有樣本作為負樣本,較大的批大小能提供更難的負樣本,有助於學習更好的表示。這也是為什麼CLIP等模型需要大規模批訓練。
特徵正規化:在計算相似度前,將嵌入向量進行L2正規化,使其位於單位球面上。這有助於穩定訓練並提高泛化能力。
對稱化的對比損失:通常不僅計算文本到圖像的損失,也計算圖像到文本的損失,然後求和:L = L_image_to_text + L_text_to_image。
訓練時的關鍵考慮:
- 批大小:更大的批提供更多負樣本,改進對齐效果。CLIP使用批大小32768。
- 數據量:需要大量圖文對進行訓練。CLIP在4億圖文對上訓練。
- 學習率調度:通常使用預熱和餘弦衰減。
- 數據增強:對圖像和文本都應用增強,增加訓練的魯棒性。
實際應用
圖文對齐在多個領域有重要應用。
在跨模態檢索中,一旦模型訓練完成,可以將所有圖像和文本預先編碼並儲存。在推理時,用文本查詢圖像或用圖像查詢文本只需計算相似度,無需重新訓練。這比傳統的基於文本索引的方法更精確,因為它理解語義而非匹配關鍵詞。
在零樣本分類中,給定一個圖像和多個文本描述(如「狗」、「貓」),將它們編碼並計算相似度。圖像被分類為相似度最高的類別。CLIP因此能在未見過的分類上也表現良好。
在圖像搜索和推薦系統中,對齐的表示使得系統能根據使用者查詢自然語言進行搜索,或根據圖像推薦相似內容。
在跨模態微調中,預訓練的對齐模型可以快速微調到特定領域任務,如醫療影像描述、電商商品描述等。
在視覺推理和VQA中,對齐提供的視覺語言表示改進了後續推理的品質。
在多語言應用中,圖文對齐可以跨越語言邊界,實現真正的多語言視覺理解。
常見誤區
誤區一:圖文對齐只需要簡單的相似度學習。實際上,直接最大化相似度會導致退化解(所有表示都相同)。對比損失的關鍵是同時考慮負樣本,防止這種退化。溫度參數的選擇也至關重要。
誤區二:更大的嵌入維度總是更好。實際上,維度過大可能導致過擬合,特別是在特定領域資料集上。CLIP使用512維已足夠表示豐富的語義。
誤區三:圖文對齐後,所有下游任務都能自動改進。實際上,對齐的質量取決於預訓練資料的多樣性和規模。在領域特定任務上,對齐可能捕捉不到特定領域的語義,需要微調。
誤區四:批大小不重要。實際上,批大小對對比學習至關重要。小批大小提供的負樣本少,學習信號弱。大規模批訓練(通常需要多GPU)是CLIP等方法成功的重要因素。
與相關技術的比較
圖文對齐 vs 融合:對齐在共同空間中進行相似度計算,融合則將特徵結合用於下游任務。對齐適合檢索和零樣本任務,融合適合需要深度交互的任務。
圖文對齐 vs 機器翻譯類對齐:圖文對齐跨越視覺和語言領域,機器翻譯對齐在語言內進行。前者的語義鴻溝更大,需要更複雜的對齐方法。
圖文對齐 vs 知識圖譜對齐:知識圖譜對齐在符號結構間進行,圖文對齐在連續向量空間進行。前者更結構化,後者更靈活。
圖文對齐 vs 度量學習:度量學習的通用目標是拉近相似樣本、推遠不相似樣本,圖文對齐是度量學習在多模態領域的應用。
圖文對齐 vs 自監督學習:對齐通常使用自監督的對比目標,但自監督還包含其他目標如掩碼預測。對齐是自監督在多模態領域的一種常見方法。