跨模態注意力(Cross-modal Attention)是什麼?

融合來自不同模態(文本、圖像、音頻等)資訊的注意力機制,用於多模態深度學習任務。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Cross-modal Attention
主題標籤
多模態AI、深度學習、神經網路
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
跨模態注意力(Cross-modal Attention)是什麼? 多模態AI深度學習
術語快查

搜尋意圖: 如果你在找「跨模態注意力 是什麼」或「跨模態注意力 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 融合來自不同模態(文本、圖像、音頻等)資訊的注意力機制,用於多模態深度學習任務。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

融合來自不同模態(文本、圖像、音頻等)資訊的注意力機制,用於多模態深度學習任務。

核心概念

跨模態注意力機制的核心思想是:給定一個查詢模態(如文本)和一個被查詢模態(如圖像),利用查詢模態的語義信息,對被查詢模態的特徵進行選擇性加權。這與單模態注意力不同,單模態注意力在同一模態內部操作(如自注意力),而跨模態注意力建立了不同模態特徵空間之間的橋樑。

在數學上,跨模態注意力通常表示為:Output = Attention(Q_source, K_target, V_target) = softmax(Q_source * K_target^T) * V_target。其中Q來自一個模態(查詢模態),K和V來自另一個模態(被查詢模態)。這使得來自查詢模態的信息能夠動態地從被查詢模態中檢索最相關的內容。

跨模態注意力的成功關鍵在於特徵空間的對齊。不同模態的原始特徵(圖像的視覺特徵、文本的語義特徵)存在於完全不同的空間中。通過將它們投影到共同的嵌入空間,並在該空間中進行注意力計算,模型能夠捕捉不同模態間的對應關係。

運作原理

跨模態注意力的一般運作流程如下:

首先,對每個模態分別進行編碼。圖像被輸入到CNN或Vision Transformer中,生成圖像特徵矩陣I ∈ R^{H×W×C_v}(H、W為空間維度,C_v為視覺特徵維度)。文本被輸入到BERT或其他文本編碼器中,生成文本特徵矩陣T ∈ R^{L×C_t}(L為文本長度,C_t為文本特徵維度)。

接著,進行模態內的自注意力計算。圖像和文本分別在各自模態內進行自注意力,增強每個模態內的特徵表示。

然後,計算跨模態注意力。在視覺問答任務中,文本編碼器輸出的特徵作為查詢Q,圖像特徵作為鍵K和值V。計算注意力權重:α = softmax(Q W_q * (K W_k)^T / √d),其中W_q和W_k是可學習的投影矩陣,d是特徵維度。注意力權重的形狀為L×(H×W),表示文本中每個詞相對於圖像中每個位置的關注度。

加權聚合:使用注意力權重對圖像特徵進行加權聚合,得到跨模態融合特徵:C = α * V W_v。這些融合特徵包含了對應文本詞語相關的圖像信息。

雙向融合:在許多應用中,跨模態注意力是雙向進行的。不僅文本關注圖像,圖像也關注文本(如圖像描述生成中,圖像特徵用於指導生成的每個詞語)。此時需要同時計算:視覺到文本的注意力和文本到視覺的注意力。

融合與輸出:融合後的特徵與原始特徵進行拼接或相加,輸入到後續的融合層或任務特定的頭部(如分類器、生成器)。

在視覺語言預訓練(如ViLBERT、LXMERT、ALBEF)中,跨模態注意力通常在Transformer層中實現。編碼器包含三部分:單模態自注意力層(圖像、文本各自內部)和跨模態融合層(互相關注)。多個這樣的層堆疊,使得信息逐層融合。

實際應用

跨模態注意力在多個多模態AI任務中取得重要應用。

在視覺問答(VQA)任務中,跨模態注意力被用於根據問題動態選擇圖像中最相關的區域。給定一個圖像和一個問題(如「圖中有幾隻貓?」),模型使用問題文本的特徵作為查詢,關注圖像中與問題相關的區域(貓的位置),最後基於這些區域的特徵和問題特徵進行推理得出答案。

在影像描述生成(Image Captioning)任務中,跨模態注意力指導解碼器在生成描述的每個詞語時,關注圖像中的不同區域。例如,生成「一隻狗在草地上」時,生成「狗」時關注狗的位置,生成「草地」時關注背景區域。

在視覺語言預訓練中,跨模態注意力使模型能夠在無監督學習中學習圖像和文本的對齐。模型在大規模圖文對資料集上進行預訓練,學習跨模態的語義對應。預訓練後的模型在VQA、檢索等下游任務上快速微調,取得優異結果。

在視覺推理任務中,跨模態注意力支持複雜的多步推理。例如,對於組合式VQA問題,模型需要多次關注圖像的不同部分進行推理。

在音視頻融合任務中,跨模態注意力用於對齐音頻和視頻特徵,應用於視頻理解、說話人檢測等。

常見誤區

誤區一:跨模態注意力就是特徵拼接。實際上,特徵拼接只是簡單地將不同模態的特徵連接在一起,而跨模態注意力進行選擇性聚合,只保留最相關的信息。這使得模型更高效且更能捕捉模態間的語義對應。

誤區二:跨模態注意力自動解決模態間的語義不對齐。實際上,跨模態注意力是建立在特徵編碼質量和初步對齐基礎上的。如果編碼器未能有效學習各模態的特徵,或資料集本身缺乏模態間的對應關係,跨模態注意力的效果也有限。

誤區三:跨模態注意力權重反映了模態間的真實對應。實際上,注意力權重是模型學習的結果,可能受到網絡架構、訓練目標等多因素影響。不能將注意力權重直接解釋為模態間的對應關係。

誤區四:更多跨模態層總是更好。實際上,過多的跨模態融合層可能導致模態特徵過度混合,損失各自的區別性。適當的層數(通常6-12層)已足以進行有效的融合。

與相關技術的比較

  • 跨模態注意力 vs 特徵拼接:拼接保留完整信息但增加計算量,注意力進行選擇性聚合,更高效。注意力能學習動態的融合方式,拼接是靜態的。

  • 跨模態注意力 vs 協方差對齐:協方差對齐通過統計學方法對齐特徵分佈,注意力則通過參數化的可學習機制進行融合。兩者可結合使用。

  • 跨模態注意力 vs 圖神經網絡:GNN在有結構關係的數據(如知識圖譜)上運行,跨模態注意力直接在特徵向量間進行。對於序列化多模態數據,注意力更適合。

  • 跨模態注意力 vs 雙流網絡:雙流網絡分別處理不同模態並在最後融合,跨模態注意力可在多個層級進行融合。多層級融合通常性能更優。

  • 跨模態注意力 vs 對比學習:對比學習通過拉近相似實例的表示進行模態對齐,跨模態注意力則在序列處理中進行微觀的位置級對齐。兩者互補,常結合使用。

常見問題

跨模態注意力如何處理不同模態特徵維度不同的問題?

跨模態注意力通過投影矩陣(或全連接層)將不同模態的特徵投影到共同的特徵空間。例如,圖像特徵維度可能是2048,文本特徵維度為768。定義投影矩陣W_q(用於查詢)和W_k(用於鍵),將它們都投影到相同維度d(如512)。投影後,可以計算它們之間的相似度:attention = softmax(Q W_q^T * (K W_k)^T / √d)。這樣的投影實現了特徵空間的對齐,使得不同模態的信息可以在共同空間中進行比較和融合。投影矩陣在訓練中可學習,模型自動學習到有效的對齐方式。

在視覺問答中,跨模態注意力如何確定應該關注圖像的哪個部分?

在VQA任務中,問題文本首先被編碼成特徵向量序列(通常是BERT的輸出)。這些文本特徵作為查詢Q,而圖像區域特徵(通常從Faster R-CNN或ViT提取)作為鍵K和值V。計算注意力權重時,模型學習如何根據問題的語義內容來評估每個圖像區域的相關性。例如,對於問題「有多少個人?」,模型會學習給予圖像中人物區域更高的權重。這種權重是通過反向傳播學習的,使得模型在訓練資料上最小化答案預測的損失。注意力權重反映了文本和視覺特徵的相似度分佈。

跨模態注意力為什麼需要雙向進行?

在許多多模態任務中,兩個模態都包含有用的信息,需要相互指導。在圖像描述生成中,不僅圖像對生成詞語有指導作用(視覺到文本),已生成的詞語也對應該關注圖像的哪個部分有指導作用(文本到視覺)。例如,當生成詞「狗」時,解碼器應該關注圖像中狗的位置;而圖像中狗的位置又應該指導生成狗相關的詞語。雙向注意力使模型能建立這樣的相互依賴關係。在視覺語言預訓練中,雙向跨模態注意力幫助模型深度理解圖文對的語義對應,提高預訓練效果。