遮蔽自編碼器 是什麼?

Masked Autoencoder:遮蔽自編碼器 的完整解釋

計算機視覺領域的自監督學習方法,隨機遮蔽輸入影像的部分區域,訓練模型從可見像素重建被遮蔽區域,類似於視覺版的遮蔽語言模型。

核心概念

遮蔽自編碼器(MAE)是 2021 年由 Meta AI 提出的一種視覺自監督學習方法,將 BERT 中的遮蔽語言模型思想遷移到計算機視覺領域。MAE 的核心洞察是:視覺世界具有高度的冗餘性和結構性,模型只需要觀察影像的一部分就能推斷出未見的部分,這個過程能強制模型學習有意義的視覺表示。

MAE 的工作流程如下:首先,將輸入影像分割成不重疊的小塊(patches),通常每塊 16×16 像素;其次,隨機選擇約 75% 的影像塊進行遮蔽,使用特殊的遮蔽 token 替換;再次,將未遮蔽的 25% 影像塊輸入編碼器;最後,編碼器的輸出連同遮蔽 token 輸入解碼器,解碼器負責重建所有像素或所有遮蔽塊。

75% 的遮蔽比例遠高於 BERT 中的 15%,這反映了視覺數據與語言數據的根本差異。視覺信息的冗餘度更高,即使只看 25% 的影像信息,模型仍能對整個影像有合理的推斷。這種高遮蔽比例也減少了需要編碼的 token 數量,大大降低了計算成本。

運作原理

MAE 的架構由三部分組成:編碼器、解碼器和重建目標。編碼器通常是一個 Vision Transformer(ViT),專為處理影像塊序列而設計。ViT 將影像塊轉換為固定維度的嵌入向量,然後通過自注意力層處理這些向量。

在編碼階段,只有未遮蔽的影像塊被輸入編碼器。解碼器是一個較小的 Transformer,接收編碼器的輸出(包含未遮蔽塊的表示)和遮蔽 token。遮蔽 token 是可學習的向量,整個解碼器學習如何將這些 token 轉換為有意義的像素值。

重建目標通常是像素級的損失函式。最簡單的形式是平均平方誤差(MSE),計算重建像素值與真實像素值的差異。某些變體使用感知損失或其他更複雜的重建目標,但基本思想保持不變。

MAE 的一個重要特性是它只在未遮蔽區域應用注意力計算,這被稱為「非對稱設計」。編碼器只看見未遮蔽的塊(大約 1/4 的 token),因此計算成本相對較低;而解碼器雖然看見完整的 token 序列(包括遮蔽 token),但體積通常較小。這種非對稱設計是 MAE 高效性的關鍵。

實際應用

MAE 在視覺預訓練中取得了顯著成效。通過在大規模無標籤影像資料集(如 ImageNet-1K)上進行 MAE 預訓練,然後在下游任務(如物體檢測、實例分割、語義分割)上進行微調,模型的性能可以與有監督預訓練相媲美,甚至在某些情況下超越。

MAE 也被應用於多模態學習中。在視覺-語言預訓練(如 CLIP 的後續工作)中,MAE 提供的視覺表示能更好地與文本信息對齊。此外,MAE 的思想也被擴展到視頻(如視頻 MAE)、3D 點雲和其他視覺模態。

在實踐中,MAE 預訓練通常在高性能 GPU 上進行,訓練時間可達數週。預訓練完成後,編碼器被提取出來,用於初始化下游任務的模型。解碼器通常被丟棄,因為它僅用於預訓練,對下游任務無用。

MAE 的成功也啟發了其他視覺自監督方法的發展,如 SimMIM、BEiT 等,這些方法都沿用了遮蔽重建的核心思想,但在具體實現和改進上有所不同。

常見誤區

誤區一:認為 MAE 只能用於影像分類。實際上,MAE 提供的預訓練表示能遷移到多種視覺任務,包括檢測、分割、動作識別等。預訓練的通用性是 MAE 的主要優勢。

誤區二:認為遮蔽比例越高越好。雖然 75% 在實踐中效果良好,但最優的遮蔽比例可能因資料集和任務而異。過高的遮蔽比例可能導致重建任務過於困難,過低的比例則不足以迫使模型學習深層結構。

誤區三:認為 MAE 主要依靠低級特徵(如顏色、邊界)進行重建。實際上,MAE 學習到的表示具有高度的語義性,能捕捉物體和場景的高級特徵。這正是為什麼 MAE 預訓練對高級視覺任務有幫助。

誤區四:認為 MAE 與對比學習方法(如 MoCo、SimCLR)能直接替代。兩者都是自監督方法,但學習信號不同。MAE 是生成式的(重建遮蔽部分),對比學習是判別式的(區分相似和不相似樣本)。兩種方法各有優缺點,某些應用中結合使用能達到最佳效果。

與相關技術的比較

MAE 與自回歸模型(如 PixelCNN)的區別在於訓練和推理的靈活性。自回歸模型必須按順序預測像素,逐像素生成影像,效率較低;MAE 則能並行重建所有遮蔽區域,效率更高。

MAE 與有監督學習的區別在於訓練數據的需求。有監督學習需要高質量的標籤,成本高;MAE 只需要無標籤影像,可利用互聯網上的海量圖像資源。

MAE 與視覺 Transformer 的關係緊密。雖然 MAE 的思想可適用於 CNN 架構,但 Vision Transformer 的全局感受野使其特別適合 MAE 任務。ViT 的自注意力機制能有效處理稀疏的 token 序列(只有 25% 的非遮蔽 token),而 CNN 的局部連接則在這種情況下效率較低。

常見問題