跨模態學習 是什麼?
Cross-modal Learning:跨模態學習 的完整解釋
在不同數據模態(如文本、影像、音訊)之間建立聯繫與對齊,學習跨模態的統一表示或進行跨模態推理的機器學習方法。
跨模態學習(Cross-modal Learning)近十年來成為深度學習領域最活躍的方向之一,隨著多模態大模型(如 GPT-4V、Gemini、Claude 3)的出現,跨模態能力已成為通用 AI 系統的標配能力。
跨模態問題的核心難點
不同模態數據的表示空間天然不同:
- 文本是離散的符號序列,語義由詞彙與句法結構編碼。
- 影像是連續的像素陣列,視覺語義由空間結構、紋理、色彩編碼。
- 音訊是時間序列的頻譜信息,語義由聲學特徵與節奏編碼。
- 視頻結合空間(每幀內容)與時間(幀間運動)兩個維度。
跨模態學習需要解決的核心問題是『表示對齐』:將不同模態的數據投影到共同的語義空間,使得語義相關的內容在空間中接近。
跨模態學習的典型方法
1. 聯合嵌入(Joint Embedding)
最經典的方法,例如 CLIP(Contrastive Language-Image Pre-training):
- 分別用文本編碼器和影像編碼器將文本和影像投影到共同的 D 維向量空間。
- 使用對比損失(Contrastive Loss):相關的文本-影像對在空間中被推近,不相關的被推遠。
- 在海量弱標注數據(互聯網圖文對)上預訓練,習得強大的跨模態表示。
- CLIP 的成功開啟了多模態預訓練的新時代,其後續變體(如 OpenCLIP、Chinese CLIP)廣泛應用於影像分類、零樣本學習等。
2. 多模態融合(Multimodal Fusion)
在共同表示空間中進行特徵融合:
- 早期融合(Early Fusion):在特徵提取前就融合不同模態的原始信息,適合模態間互動密切的情況(如視頻理解)。
- 晚期融合(Late Fusion):各模態獨立進行特徵提取與預測,最後再在決策層融合(如將不同模態的分類機率加權平均),簡單但適合模態差異大的情況。
- 混合融合(Hybrid Fusion):在多層進行融合,既捕捉早期的互動細節,又避免過早融合導致的信息損失。
3. 跨模態對齊(Cross-modal Alignment)
在細粒度層級建立模態間的對應:
- 詞級圖像對齊:在文本的詞與影像的視覺區域(Region)之間建立對應(如物體檢測 + 詞彙綁定)。
- 句級視頻對齊:將字幕的句子與視頻的時間段對齐,用於視頻理解與檢索。
- 自注意機制的多模態對齐:使用 Cross-modal Attention,讓文本中的每個詞動態參與影像特徵的計算。
4. 生成式跨模態轉換
從一個模態生成另一個模態的內容:
- 文本到影像生成(Text-to-Image):給定文本描述,生成符合描述的影像。DALL-E、Stable Diffusion 等擴散模型是當代典型。
- 影像到文本生成(Image Captioning):給定影像,生成自然語言描述,常用 CNN 編碼影像 + RNN/Transformer 解碼文本。
- 視頻摘要:從視頻生成文字或圖像摘要。
- 音訊到文本(語音識別):雖然通常視為單一任務,本質上也是跨模態生成。
5. 多模態融合架構(視頻/多媒體理解)
針對包含多種模態的複雜數據(如視頻含影像+音訊+字幕):
- 用分別的編碼器提取視覺、音訊、文本特徵。
- 利用 Transformer 的自注意與交叉注意機制融合:自注意捕捉各模態內部的長距離依賴,交叉注意模型模態間的互動。
- 例如,CLIP 的視頻擴展、ViLBERT(Vision and Language BERT)等都採用這種多模態 Transformer 架構。
跨模態學習的應用場景
- 影像檢索:用文本查詢來檢索相關影像(或反向),CLIP 等模型使其成為現實。
- VQA(視覺問答):給定一張影像與一個自然語言問題,系統生成回答。結合影像與文本理解。
- 影像分類與零樣本學習:CLIP 在未見過的類別上直接進行零樣本分類,無需微調。
- 視頻理解:結合視覺內容、音訊與字幕,進行視頻分類、事件檢測、動作識別。
- 醫療報告生成:從醫學影像(X 光、CT)自動生成診斷報告文本。
- 多模態情感分析:從文本、音訊(語調、音量)、視覺(表情)多個角度分析情感。
- 自動駕駛:融合相機、雷達、LiDAR 多個傳感器的信息進行目標檢測與路徑規劃。
跨模態學習的挑戰與最新進展
挑戰:
- 模態的不對齐:多模態數據往往在時間、粒度上不對齐,如視頻的某幀對應字幕的某句需要推斷。
- 模態差異導致的語義鴻溝:不同模態天然難以直接比較,需要深層語義對齐。
- 計算複雜度:多模態模型參數眾多,訓練推論都昂貴。
最新進展:
- 大規模多模態預訓練:如 GPT-4V、Gemini 等在海量多模態數據上進行自監督預訓練,習得強大的跨模態理解能力,可通過簡單的 prompt 適應各種下游任務。
- 端到端可微:現代多模態模型都是端到端可微的,允許跨模態梯度流動,提升融合效率。