遮蔽自編碼器(Masked Autoencoder)是什麼?

計算機視覺領域的自監督學習方法,隨機遮蔽輸入影像的部分區域,訓練模型從可見像素重建被遮蔽區域,類似於視覺版的遮蔽語言模型。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Masked Autoencoder
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
遮蔽自編碼器(Masked Autoencoder)是什麼?
術語快查

搜尋意圖: 如果你在找「遮蔽自編碼器 是什麼」或「遮蔽自編碼器 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 計算機視覺領域的自監督學習方法,隨機遮蔽輸入影像的部分區域,訓練模型從可見像素重建被遮蔽區域,類似於視覺版的遮蔽語言模型。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

計算機視覺領域的自監督學習方法,隨機遮蔽輸入影像的部分區域,訓練模型從可見像素重建被遮蔽區域,類似於視覺版的遮蔽語言模型。

核心概念

遮蔽自編碼器(MAE)是 2021 年由 Meta AI 提出的一種視覺自監督學習方法,將 BERT 中的遮蔽語言模型思想遷移到計算機視覺領域。MAE 的核心洞察是:視覺世界具有高度的冗餘性和結構性,模型只需要觀察影像的一部分就能推斷出未見的部分,這個過程能強制模型學習有意義的視覺表示。

MAE 的工作流程如下:首先,將輸入影像分割成不重疊的小塊(patches),通常每塊 16×16 像素;其次,隨機選擇約 75% 的影像塊進行遮蔽,使用特殊的遮蔽 token 替換;再次,將未遮蔽的 25% 影像塊輸入編碼器;最後,編碼器的輸出連同遮蔽 token 輸入解碼器,解碼器負責重建所有像素或所有遮蔽塊。

75% 的遮蔽比例遠高於 BERT 中的 15%,這反映了視覺數據與語言數據的根本差異。視覺信息的冗餘度更高,即使只看 25% 的影像信息,模型仍能對整個影像有合理的推斷。這種高遮蔽比例也減少了需要編碼的 token 數量,大大降低了計算成本。

運作原理

MAE 的架構由三部分組成:編碼器、解碼器和重建目標。編碼器通常是一個 Vision Transformer(ViT),專為處理影像塊序列而設計。ViT 將影像塊轉換為固定維度的嵌入向量,然後通過自注意力層處理這些向量。

在編碼階段,只有未遮蔽的影像塊被輸入編碼器。解碼器是一個較小的 Transformer,接收編碼器的輸出(包含未遮蔽塊的表示)和遮蔽 token。遮蔽 token 是可學習的向量,整個解碼器學習如何將這些 token 轉換為有意義的像素值。

重建目標通常是像素級的損失函式。最簡單的形式是平均平方誤差(MSE),計算重建像素值與真實像素值的差異。某些變體使用感知損失或其他更複雜的重建目標,但基本思想保持不變。

MAE 的一個重要特性是它只在未遮蔽區域應用注意力計算,這被稱為「非對稱設計」。編碼器只看見未遮蔽的塊(大約 1/4 的 token),因此計算成本相對較低;而解碼器雖然看見完整的 token 序列(包括遮蔽 token),但體積通常較小。這種非對稱設計是 MAE 高效性的關鍵。

實際應用

MAE 在視覺預訓練中取得了顯著成效。通過在大規模無標籤影像資料集(如 ImageNet-1K)上進行 MAE 預訓練,然後在下游任務(如物體檢測、實例分割、語義分割)上進行微調,模型的性能可以與有監督預訓練相媲美,甚至在某些情況下超越。

MAE 也被應用於多模態學習中。在視覺-語言預訓練(如 CLIP 的後續工作)中,MAE 提供的視覺表示能更好地與文本信息對齊。此外,MAE 的思想也被擴展到視頻(如視頻 MAE)、3D 點雲和其他視覺模態。

在實踐中,MAE 預訓練通常在高性能 GPU 上進行,訓練時間可達數週。預訓練完成後,編碼器被提取出來,用於初始化下游任務的模型。解碼器通常被丟棄,因為它僅用於預訓練,對下游任務無用。

MAE 的成功也啟發了其他視覺自監督方法的發展,如 SimMIM、BEiT 等,這些方法都沿用了遮蔽重建的核心思想,但在具體實現和改進上有所不同。

常見誤區

誤區一:認為 MAE 只能用於影像分類。實際上,MAE 提供的預訓練表示能遷移到多種視覺任務,包括檢測、分割、動作識別等。預訓練的通用性是 MAE 的主要優勢。

誤區二:認為遮蔽比例越高越好。雖然 75% 在實踐中效果良好,但最優的遮蔽比例可能因資料集和任務而異。過高的遮蔽比例可能導致重建任務過於困難,過低的比例則不足以迫使模型學習深層結構。

誤區三:認為 MAE 主要依靠低級特徵(如顏色、邊界)進行重建。實際上,MAE 學習到的表示具有高度的語義性,能捕捉物體和場景的高級特徵。這正是為什麼 MAE 預訓練對高級視覺任務有幫助。

誤區四:認為 MAE 與對比學習方法(如 MoCo、SimCLR)能直接替代。兩者都是自監督方法,但學習信號不同。MAE 是生成式的(重建遮蔽部分),對比學習是判別式的(區分相似和不相似樣本)。兩種方法各有優缺點,某些應用中結合使用能達到最佳效果。

與相關技術的比較

MAE 與自回歸模型(如 PixelCNN)的區別在於訓練和推理的靈活性。自回歸模型必須按順序預測像素,逐像素生成影像,效率較低;MAE 則能並行重建所有遮蔽區域,效率更高。

MAE 與有監督學習的區別在於訓練數據的需求。有監督學習需要高質量的標籤,成本高;MAE 只需要無標籤影像,可利用互聯網上的海量圖像資源。

MAE 與視覺 Transformer 的關係緊密。雖然 MAE 的思想可適用於 CNN 架構,但 Vision Transformer 的全局感受野使其特別適合 MAE 任務。ViT 的自注意力機制能有效處理稀疏的 token 序列(只有 25% 的非遮蔽 token),而 CNN 的局部連接則在這種情況下效率較低。

常見問題

遮蔽自編碼器(MAE)的訓練目標是什麼?

遮蔽自編碼器的訓練目標是從部分可見的輸入重建完整輸入。以影像 MAE 為例,模型將影像分成固定大小的 patch,隨機遮蔽 75% 的 patch,只讓編碼器看到剩餘的 25% 可見 patch,然後用解碼器重建被遮蔽部分的像素值。這個任務難度極高,迫使模型學習影像的深層語意結構而非依賴局部紋理。訓練完成後,只保留編碼器部分,搭配少量標籤數據進行微調(fine-tuning),即可應用於分類、偵測等下游任務,達到與監督學習相近甚至更好的效果。

遮蔽自編碼器和 BERT 的遮蔽語言模型有什麼關聯?

遮蔽自編碼器(MAE)的設計靈感直接來自 BERT 的遮蔽語言模型(Masked Language Model)。BERT 在文字序列中隨機遮蔽一定比例的詞彙 token,讓模型根據上下文預測這些遮蔽詞;MAE 則將這個概念移植到影像領域,把影像切成 patch 後遮蔽大量 patch,讓模型重建像素值。兩者的核心思路相同:利用輸入自身作為監督信號,透過重建任務學習輸入的語意表示,無需人工標籤。MAE 的成功驗證了這個自監督學習範式在視覺模態同樣有效,推動了視覺基礎模型(Vision Foundation Model)的發展。

遮蔽自編碼器和去噪自編碼器(Denoising Autoencoder)有什麼不同?

遮蔽自編碼器(MAE)和去噪自編碼器(DAE)都是自監督學習方法,但策略不同。DAE 在輸入添加隨機雜訊(如高斯噪聲),讓模型學習重建乾淨輸入;MAE 則是直接遮蔽輸入的一大部分(通常 75% 的 patch),讓模型從可見部分預測遮蔽部分。MAE 的遮蔽比例遠大於 DAE 的噪聲比例,使模型必須學習更深層的語意結構。此外,MAE 通常採用非對稱架構:編碼器只處理可見 patch,解碼器才負責重建所有 patch,這讓計算效率比 DAE 更高。在影像任務上,MAE 的表示學習效果通常優於傳統 DAE。