音視覺學習 是什麼?
Audio Visual Learning:音視覺學習 的完整解釋
利用音頻和視覺信息的相關性,訓練神經網絡進行特徵學習的方法,通常不需要人工標籤。
核心概念
音視覺學習基於一個簡單的假設:在同一視頻中出現的音頻和視覺信息在語義上通常是相關的。例如,看到籃球入籃的視覺信息,通常伴隨著「唰」的聲音。系統可以通過拉近這兩種模態的特徵距離來學習有意義的表示,而無需人工注釋。
這種方法屬於「自監督學習」(self-supervised learning),區別於傳統的有監督學習(需要人工標籤)和無監督學習(無任何目標信號)。自監督學習利用數據本身的結構作為監督信號。
音視覺學習的關鍵洞察是:預訓練特徵編碼器可以大幅減少下游任務所需的標籤數據量。例如,用未標籤視頻預訓練視覺編碼器,然後用少量標籤數據在行動識別任務上微調,效果往往比從頭開始訓練好很多。
運作原理
特徵編碼
音視覺學習系統包含兩個編碼器:視覺編碼器和音頻編碼器。視覺編碼器(通常是 3D CNN)將視頻幀序列編碼為特徵向量。音頻編碼器(通常是 1D CNN 或 Transformer)將聲譜特徵編碼為特徵向量。
對比學習
最常見的音視覺學習方法是基於「對比損失」(contrastive loss)。給定一段視頻,系統計算其音頻特徵和視覺特徵,將它們作為正對;同時隨機採樣其他視頻的音頻或視覺特徵作為負樣本。損失函數鼓勵正對相似,負對不相似。
例如,同一視頻的音視頻特徵應該有高餘弦相似度,不同視頻的特徵應該有低相似度。通過在大規模未標籤視頻上重複這個過程,系統逐漸學會什麼樣的特徵是「好的」。
多模態對齐
在音視覺學習中,一個關鍵挑戰是時間對齐。視頻的不同時間片段的音頻和視覺信息不一定完全同步。例如,音軌可能有延遲或提前。系統需要學習跨時間的對齐,即決定視覺的哪一幀對應音頻的哪一幀。
正負樣本選擇
對比學習的效果很大程度上取決於負樣本的選擇。在小數據集上,隨機負樣本可能質量差;在大規模數據集上,需要仔細的負樣本採樣策略。一些方法使用「困難負樣本開採」,專門選擇與正樣本相近但實際不同的樣本作為負樣本,加強學習信號。
實際應用
視頻分類的預訓練
在標籤有限的情況下,使用音視覺學習預訓練視覺編碼器,然後用少量標籤視頻微調,性能遠優於隨機初始化。例如,用 100 小時未標籤視頻預訓練,然後用 10 小時標籤視頻微調行動識別,效果可能接近用 100 小時標籤視頻從頭訓練。
音樂和樂器識別
音樂視頻中的視覺信息(演奏者、樂器)和音頻信息(樂器聲)天然配對。音視覺學習可以自動學習樂器特徵,用於樂器識別或音樂流派分類,無需人工標註。
聲音定位
在多聲源場景中(如樂隊演奏或多人對話),視覺信息可以幫助定位每個聲源的位置。例如,看到某人嘴部運動時,音頻中哪部分聲音對應這個人的聲音。音視覺學習可以學會將聲音與畫面中發聲的位置相關聯。
視頻檢索
在大規模視頻檔案庫中,用自然語言(文本)或音頻查詢視頻。使用音視覺預訓練的特徵,系統可以更準確地匹配查詢和結果。例如,搜索「女人笑聲」,系統可以找到所有笑聲特徵與查詢相近的視頻。
跨模態檢索
用音頻片段檢索相關的視覺內容(如用槍聲尋找動作片段),或反之(用槍戰畫面尋找包含槍聲的視頻)。音視覺學習提供的統一特徵空間使跨模態搜索成為可能。
常見誤區
誤區 1:假設所有音視頻對都是同步的
實際視頻中,音軌和視軌常有時間偏移。字幕視頻、配音視頻或直播延遲都會導致不同步。簡單地假設音視頻完全同步會引入噪聲,降低學習效果。需要採用時間對齐策略,或者使用寬鬆的對齐窗口(例如,音頻片段可以對應前後 2 秒內的任何視覺幀)。
誤區 2:忽視弱關聯對和虛假對齐
並非所有音視頻對都有強相關性。例如,背景音樂和視覺內容的關聯弱;背景噪聲和畫面無直接關係。簡單的對比學習會將這些虛假對視為正樣本,污染特徵表示。解決方案包括篩選高質量視頻、使用細粒度對齐模塊或加入置信度加權。
誤區 3:預訓練特徵在所有任務上都有效
音視覺預訓練特別適合與聲音相關的下游任務(如樂器識別、說話人檢測)。但在完全視覺的任務上(如人臉識別、純視覺行動識別),音視覺預訓練可能不如視覺單模態預訓練有效。需要針對下游任務特性選擇預訓練方式。
誤區 4:只用簡單的特徵相似度
簡單的餘弦相似度或歐氏距離不足以捕捉複雜的音視覺關係。例如,類似的樂器聲可能來自不同的視覺背景。現代方法使用更複雜的匹配模塊(如注意力、圖卷積)來建立更精細的關聯。
與相關技術的比較
與「多模態融合」的區別:多模態融合是將多種模態的信息整合成統一輸出(如音視覺融合進行分類)。音視覺學習是利用模態間的對應關係進行特徵學習,目的是獲得更好的特徵表示。音視覺學習的輸出特徵可以用於下游多模態融合。
與「有監督預訓練」的區別:有監督預訓練需要人工標籤(如標記每幀的物體類別),非常耗時。音視覺學習無需人工標籤,可直接利用互聯網視頻,成本更低。但有監督預訓練如果標籤質量高,效果可能更好。
與「自監督學習(非音視頻)」的區別:自監督學習還包括只用視覺的方法(如旋轉預測、遮擋補全)和只用音頻的方法(如頻譜遮擋預測)。音視覺學習利用兩種模態的天然對應,通常比單模態自監督更強。
與「弱監督學習」的區別:弱監督學習用質量較差的標籤(如視頻級別標籤而非幀級別)進行訓練。音視覺學習不需要任何人工標籤,完全利用自然配對的音視頻。