跨模態注意力 是什麼?
Cross-modal Attention:跨模態注意力 的完整解釋
融合來自不同模態(文本、圖像、音頻等)資訊的注意力機制,用於多模態深度學習任務。
核心概念
跨模態注意力機制的核心思想是:給定一個查詢模態(如文本)和一個被查詢模態(如圖像),利用查詢模態的語義信息,對被查詢模態的特徵進行選擇性加權。這與單模態注意力不同,單模態注意力在同一模態內部操作(如自注意力),而跨模態注意力建立了不同模態特徵空間之間的橋樑。
在數學上,跨模態注意力通常表示為:Output = Attention(Q_source, K_target, V_target) = softmax(Q_source * K_target^T) * V_target。其中Q來自一個模態(查詢模態),K和V來自另一個模態(被查詢模態)。這使得來自查詢模態的信息能夠動態地從被查詢模態中檢索最相關的內容。
跨模態注意力的成功關鍵在於特徵空間的對齊。不同模態的原始特徵(圖像的視覺特徵、文本的語義特徵)存在於完全不同的空間中。通過將它們投影到共同的嵌入空間,並在該空間中進行注意力計算,模型能夠捕捉不同模態間的對應關係。
運作原理
跨模態注意力的一般運作流程如下:
首先,對每個模態分別進行編碼。圖像被輸入到CNN或Vision Transformer中,生成圖像特徵矩陣I ∈ R^{H×W×C_v}(H、W為空間維度,C_v為視覺特徵維度)。文本被輸入到BERT或其他文本編碼器中,生成文本特徵矩陣T ∈ R^{L×C_t}(L為文本長度,C_t為文本特徵維度)。
接著,進行模態內的自注意力計算。圖像和文本分別在各自模態內進行自注意力,增強每個模態內的特徵表示。
然後,計算跨模態注意力。在視覺問答任務中,文本編碼器輸出的特徵作為查詢Q,圖像特徵作為鍵K和值V。計算注意力權重:α = softmax(Q W_q * (K W_k)^T / √d),其中W_q和W_k是可學習的投影矩陣,d是特徵維度。注意力權重的形狀為L×(H×W),表示文本中每個詞相對於圖像中每個位置的關注度。
加權聚合:使用注意力權重對圖像特徵進行加權聚合,得到跨模態融合特徵:C = α * V W_v。這些融合特徵包含了對應文本詞語相關的圖像信息。
雙向融合:在許多應用中,跨模態注意力是雙向進行的。不僅文本關注圖像,圖像也關注文本(如圖像描述生成中,圖像特徵用於指導生成的每個詞語)。此時需要同時計算:視覺到文本的注意力和文本到視覺的注意力。
融合與輸出:融合後的特徵與原始特徵進行拼接或相加,輸入到後續的融合層或任務特定的頭部(如分類器、生成器)。
在視覺語言預訓練(如ViLBERT、LXMERT、ALBEF)中,跨模態注意力通常在Transformer層中實現。編碼器包含三部分:單模態自注意力層(圖像、文本各自內部)和跨模態融合層(互相關注)。多個這樣的層堆疊,使得信息逐層融合。
實際應用
跨模態注意力在多個多模態AI任務中取得重要應用。
在視覺問答(VQA)任務中,跨模態注意力被用於根據問題動態選擇圖像中最相關的區域。給定一個圖像和一個問題(如「圖中有幾隻貓?」),模型使用問題文本的特徵作為查詢,關注圖像中與問題相關的區域(貓的位置),最後基於這些區域的特徵和問題特徵進行推理得出答案。
在影像描述生成(Image Captioning)任務中,跨模態注意力指導解碼器在生成描述的每個詞語時,關注圖像中的不同區域。例如,生成「一隻狗在草地上」時,生成「狗」時關注狗的位置,生成「草地」時關注背景區域。
在視覺語言預訓練中,跨模態注意力使模型能夠在無監督學習中學習圖像和文本的對齐。模型在大規模圖文對資料集上進行預訓練,學習跨模態的語義對應。預訓練後的模型在VQA、檢索等下游任務上快速微調,取得優異結果。
在視覺推理任務中,跨模態注意力支持複雜的多步推理。例如,對於組合式VQA問題,模型需要多次關注圖像的不同部分進行推理。
在音視頻融合任務中,跨模態注意力用於對齐音頻和視頻特徵,應用於視頻理解、說話人檢測等。
常見誤區
誤區一:跨模態注意力就是特徵拼接。實際上,特徵拼接只是簡單地將不同模態的特徵連接在一起,而跨模態注意力進行選擇性聚合,只保留最相關的信息。這使得模型更高效且更能捕捉模態間的語義對應。
誤區二:跨模態注意力自動解決模態間的語義不對齐。實際上,跨模態注意力是建立在特徵編碼質量和初步對齐基礎上的。如果編碼器未能有效學習各模態的特徵,或資料集本身缺乏模態間的對應關係,跨模態注意力的效果也有限。
誤區三:跨模態注意力權重反映了模態間的真實對應。實際上,注意力權重是模型學習的結果,可能受到網絡架構、訓練目標等多因素影響。不能將注意力權重直接解釋為模態間的對應關係。
誤區四:更多跨模態層總是更好。實際上,過多的跨模態融合層可能導致模態特徵過度混合,損失各自的區別性。適當的層數(通常6-12層)已足以進行有效的融合。
與相關技術的比較
跨模態注意力 vs 特徵拼接:拼接保留完整信息但增加計算量,注意力進行選擇性聚合,更高效。注意力能學習動態的融合方式,拼接是靜態的。
跨模態注意力 vs 協方差對齐:協方差對齐通過統計學方法對齐特徵分佈,注意力則通過參數化的可學習機制進行融合。兩者可結合使用。
跨模態注意力 vs 圖神經網絡:GNN在有結構關係的數據(如知識圖譜)上運行,跨模態注意力直接在特徵向量間進行。對於序列化多模態數據,注意力更適合。
跨模態注意力 vs 雙流網絡:雙流網絡分別處理不同模態並在最後融合,跨模態注意力可在多個層級進行融合。多層級融合通常性能更優。
跨模態注意力 vs 對比學習:對比學習通過拉近相似實例的表示進行模態對齐,跨模態注意力則在序列處理中進行微觀的位置級對齐。兩者互補,常結合使用。