搜尋意圖: 如果你在找「音視覺學習 是什麼」或「音視覺學習 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 利用音頻和視覺信息的相關性,訓練神經網絡進行特徵學習的方法,通常不需要人工標籤。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
利用音頻和視覺信息的相關性,訓練神經網絡進行特徵學習的方法,通常不需要人工標籤。
核心概念
音視覺學習基於一個簡單的假設:在同一視頻中出現的音頻和視覺信息在語義上通常是相關的。例如,看到籃球入籃的視覺信息,通常伴隨著「唰」的聲音。系統可以通過拉近這兩種模態的特徵距離來學習有意義的表示,而無需人工注釋。
這種方法屬於「自監督學習」(self-supervised learning),區別於傳統的有監督學習(需要人工標籤)和無監督學習(無任何目標信號)。自監督學習利用數據本身的結構作為監督信號。
音視覺學習的關鍵洞察是:預訓練特徵編碼器可以大幅減少下游任務所需的標籤數據量。例如,用未標籤視頻預訓練視覺編碼器,然後用少量標籤數據在行動識別任務上微調,效果往往比從頭開始訓練好很多。
運作原理
特徵編碼
音視覺學習系統包含兩個編碼器:視覺編碼器和音頻編碼器。視覺編碼器(通常是 3D CNN)將視頻幀序列編碼為特徵向量。音頻編碼器(通常是 1D CNN 或 Transformer)將聲譜特徵編碼為特徵向量。
對比學習
最常見的音視覺學習方法是基於「對比損失」(contrastive loss)。給定一段視頻,系統計算其音頻特徵和視覺特徵,將它們作為正對;同時隨機採樣其他視頻的音頻或視覺特徵作為負樣本。損失函數鼓勵正對相似,負對不相似。
例如,同一視頻的音視頻特徵應該有高餘弦相似度,不同視頻的特徵應該有低相似度。通過在大規模未標籤視頻上重複這個過程,系統逐漸學會什麼樣的特徵是「好的」。
多模態對齐
在音視覺學習中,一個關鍵挑戰是時間對齐。視頻的不同時間片段的音頻和視覺信息不一定完全同步。例如,音軌可能有延遲或提前。系統需要學習跨時間的對齐,即決定視覺的哪一幀對應音頻的哪一幀。
正負樣本選擇
對比學習的效果很大程度上取決於負樣本的選擇。在小數據集上,隨機負樣本可能質量差;在大規模數據集上,需要仔細的負樣本採樣策略。一些方法使用「困難負樣本開採」,專門選擇與正樣本相近但實際不同的樣本作為負樣本,加強學習信號。
實際應用
視頻分類的預訓練
在標籤有限的情況下,使用音視覺學習預訓練視覺編碼器,然後用少量標籤視頻微調,性能遠優於隨機初始化。例如,用 100 小時未標籤視頻預訓練,然後用 10 小時標籤視頻微調行動識別,效果可能接近用 100 小時標籤視頻從頭訓練。
音樂和樂器識別
音樂視頻中的視覺信息(演奏者、樂器)和音頻信息(樂器聲)天然配對。音視覺學習可以自動學習樂器特徵,用於樂器識別或音樂流派分類,無需人工標註。
聲音定位
在多聲源場景中(如樂隊演奏或多人對話),視覺信息可以幫助定位每個聲源的位置。例如,看到某人嘴部運動時,音頻中哪部分聲音對應這個人的聲音。音視覺學習可以學會將聲音與畫面中發聲的位置相關聯。
視頻檢索
在大規模視頻檔案庫中,用自然語言(文本)或音頻查詢視頻。使用音視覺預訓練的特徵,系統可以更準確地匹配查詢和結果。例如,搜索「女人笑聲」,系統可以找到所有笑聲特徵與查詢相近的視頻。
跨模態檢索
用音頻片段檢索相關的視覺內容(如用槍聲尋找動作片段),或反之(用槍戰畫面尋找包含槍聲的視頻)。音視覺學習提供的統一特徵空間使跨模態搜索成為可能。
常見誤區
誤區 1:假設所有音視頻對都是同步的
實際視頻中,音軌和視軌常有時間偏移。字幕視頻、配音視頻或直播延遲都會導致不同步。簡單地假設音視頻完全同步會引入噪聲,降低學習效果。需要採用時間對齐策略,或者使用寬鬆的對齐窗口(例如,音頻片段可以對應前後 2 秒內的任何視覺幀)。
誤區 2:忽視弱關聯對和虛假對齐
並非所有音視頻對都有強相關性。例如,背景音樂和視覺內容的關聯弱;背景噪聲和畫面無直接關係。簡單的對比學習會將這些虛假對視為正樣本,污染特徵表示。解決方案包括篩選高質量視頻、使用細粒度對齐模塊或加入置信度加權。
誤區 3:預訓練特徵在所有任務上都有效
音視覺預訓練特別適合與聲音相關的下游任務(如樂器識別、說話人檢測)。但在完全視覺的任務上(如人臉識別、純視覺行動識別),音視覺預訓練可能不如視覺單模態預訓練有效。需要針對下游任務特性選擇預訓練方式。
誤區 4:只用簡單的特徵相似度
簡單的餘弦相似度或歐氏距離不足以捕捉複雜的音視覺關係。例如,類似的樂器聲可能來自不同的視覺背景。現代方法使用更複雜的匹配模塊(如注意力、圖卷積)來建立更精細的關聯。
與相關技術的比較
與「多模態融合」的區別:多模態融合是將多種模態的信息整合成統一輸出(如音視覺融合進行分類)。音視覺學習是利用模態間的對應關係進行特徵學習,目的是獲得更好的特徵表示。音視覺學習的輸出特徵可以用於下游多模態融合。
與「有監督預訓練」的區別:有監督預訓練需要人工標籤(如標記每幀的物體類別),非常耗時。音視覺學習無需人工標籤,可直接利用互聯網視頻,成本更低。但有監督預訓練如果標籤質量高,效果可能更好。
與「自監督學習(非音視頻)」的區別:自監督學習還包括只用視覺的方法(如旋轉預測、遮擋補全)和只用音頻的方法(如頻譜遮擋預測)。音視覺學習利用兩種模態的天然對應,通常比單模態自監督更強。
與「弱監督學習」的區別:弱監督學習用質量較差的標籤(如視頻級別標籤而非幀級別)進行訓練。音視覺學習不需要任何人工標籤,完全利用自然配對的音視頻。
常見問題
為什麼說音視覺學習比有監督預訓練更具優勢?
主要優勢是成本和規模。有監督預訓練需要人類逐幀或逐秒地標籤視頻(「這是狗」「這是打籃球」),成本很高。而且高質量標籤常被限制在特定領域或語言。相比之下,互聯網上有數十億小時的未標籤視頻,且音視頻配對是自動存在的(無需人工標註)。使用這些數據,音視覺學習可以進行大規模預訓練,學到更通用的特徵表示。當然,如果標籤成本不是瓶頸,而且下游任務與標籤領域接近,有監督預訓練仍可能更優。
音視覺學習中的時間對齐為什麼困難?如何解決?
困難在於視頻製作中音軌和視軌可能出現偏移:配音視頻有意延遲、直播有網絡延遲、編輯時可能移動音軌。簡單假設音視同步會在訓練數據中引入噪聲。解決方案包括:(1)使用寬鬆的對齐窗口,比如認為視覺幀 t 對應時間 [t-2, t+2] 秒的音頻,而不是精確的 t 秒;(2)學習對齁模塊,自動估計音視軌間的延遲並修正;(3)篩選高度同步的視頻進行預訓練。這些方法都有權衡,需根據應用場景選擇。
如何區分真正的音視覺對應和虛假對應?
這是個開放問題。常見方法包括:(1)利用視頻的領域特性,如音樂視頻中樂器和聲音配對很強,但背景音樂可能弱;(2)使用多個視頻時間段的對齁度作為置信度加權,即使是同一視頻,不同時段的對應強度也不同;(3)結合其他信號,如同一時段物體運動和聲音頻率的變化是否同步;(4)在下游任務上驗證,如果某些預訓練特徵在行動識別上性能好,說明對應關係是有效的。在實踐中,通常接受一定比例的虛假對,因為充足的數據量和對比學習的魯棒性可以抵消這種噪聲。