多視角學習 是什麼?

Multi-view Learning:多視角學習 的完整解釋

利用同一對象的多個不同視角或特徵表示進行機器學習,並從多視角中提取一致性信息以提升模型性能。

多視角學習(Multi-view Learning)是機器學習中的重要研究方向,尤其在實際應用中極為常見。大量現實問題天然涉及多個視角,利用這些視角的互補與一致性信息是提升預測性能與模型魯棒性的關鍵。

多視角的定義與特性

視角(View)通常定義為數據的一個特徵子集、一個特徵提取器、或一個數據模態。視角之間應該滿足:

  1. 多樣性(Diversity):每個視角從不同的角度描述對象,包含不同的信息維度。
  2. 充分性(Sufficiency):理想情況下,任何單個視角都不足以完全刻畫對象,需要多視角結合。
  3. 一致性(Consistency):不同視角對同一對象應給出一致的預測,或至少有相關聯的結構。

多視角學習的典型框架

多視角學習主要分為三大類方法:

1. 多視角聚類(Multi-view Clustering)

目標是在多視角數據上找到一致的聚類結構。代表方法:

  • Multi-view K-means:在多視角上同時執行 K-means,目標是最小化所有視角上的聚類損失加權和。
  • Co-clustering:相鄰視角之間互相約束,例如如果兩個樣本在視角 A 上被聚為一類,則在視角 B 上也應傾向於聚為一類。
  • 譜聚類多視角擴展:構建多視角的親和矩陣(Affinity Matrix),在聯合的譜空間進行聚類。

2. 多視角半監督學習(Multi-view Semi-supervised Learning)

在標注資料稀缺的情況下,利用多視角的一致性約束:

  • Co-training(協同訓練):用少量標注樣本訓練兩個分類器(分別在視角 1 和視角 2 上),交替互相標注對方無法確信的樣本。充分利用每個視角的特色與互補性。
  • 多視角自監督學習:利用視角間的一致性作為自監督信號(如視角 A 的表示應與視角 B 的表示相似)。

3. 多視角表示學習(Multi-view Representation Learning)

學習統一的、從多視角提取的潛在表示:

  • Canonical Correlation Analysis (CCA) 與變體:找到兩個視角在潛在空間中相關性最高的線性變換,使得變換後的表示維度低且高度相關。
  • Multi-view Deep Learning:使用多個深度神經網路分別編碼各視角,在中間層或頂層融合表示,終端層進行預測。
  • 多視角對比學習:例如 CLIP 的思想可推廣:同一對象(如圖文對)的不同視角在表示空間中應相近,不同對象應遠離,建立起跨視角的語義對齊。

多視角學習的優勢

  1. 提升性能:多視角互補信息可以彌補任何單一視角的不足,提升準確度。
  2. 增強魯棒性:若某一視角受到噪音污染或缺失,其他視角可維持模型性能。
  3. 加快收斂:在半監督場景中,多視角一致性約束可以加快標注樣本的有效利用。
  4. 提供可解釋性:分析哪些視角在特定決策中扮演重要角色,增強模型的可解釋性。

實務中常見的視角設計

  • 網頁分類:頁面文本內容、頁面結構(DOM 樹)、入站超連結錨文本、出站連結等。
  • 視頻理解:視覺幀序列、光流信息、音訊特徵、字幕文本。
  • 推薦系統:用戶基本屬性、購買歷史序列、用戶評論、社交網絡。
  • 人臉識別:正臉、側臉、不同光照、不同年齡,多視角提升跨條件泛化能力。
  • 醫學影像:不同掃描模式(CT、MRI、PET)的同一患者,多視角融合支持精準診斷。

與相關概念的區別

  • 多視角學習 vs. 多模態學習:多模態強調不同的數據型別(文本、影像、音訊);多視角強調同一對象的多個表示或子集,模態可以相同或不同。
  • 多視角學習 vs. 多任務學習:多任務學習是多個預測目標(如同時做分類和回歸),多視角學習是同一目標但從多個視角進行。

常見問題