對比式語言影像預訓練 是什麼?

Contrastive Language-Image Pre-training:對比式語言影像預訓練 的完整解釋

OpenAI 提出的多模態預訓練架構,透過對比學習同時訓練文字與影像編碼器,使兩者的語意空間對齊。

CLIP(Contrastive Language-Image Pre-training)是多模態人工智慧領域的里程碑研究,由 OpenAI 研究團隊於 2021 年初發表,論文標題為「Learning Transferable Visual Models From Natural Language Supervision」。這項工作的核心貢獻在於證明:只要使用大規模的圖文配對資料與簡潔的對比學習目標,就能訓練出具備驚人零次遷移能力的視覺理解模型,且其在多項視覺基準上的表現甚至可媲美針對特定任務精調過的監督式模型。

一、模型架構設計

CLIP 由兩個編碼器組成,分別負責不同模態的表示學習。視覺編碼器可以是 ResNet(殘差卷積網路)或 Vision Transformer(ViT),負責將輸入影像轉換成固定維度的向量表示。文字編碼器則是一個 Transformer 語言模型,負責將文字描述(可以是一個詞、一句話、或一段描述)也轉換成相同維度的向量表示。

兩個編碼器的輸出會被投影到同一個共享向量空間,並透過對比學習目標進行訓練。訓練時,同一批次(batch)內有 N 對圖文配對,正確的 N 對應有高相似度(接近 1),其餘的 N² - N 個不匹配配對應有低相似度(接近 0)。損失函數計算的是預測矩陣與理想對角矩陣之間的交叉熵,這就是「對比式」名稱的由來。

二、訓練資料的規模

CLIP 的成功很大程度來自訓練資料的規模。OpenAI 從網際網路爬取了 WIT(WebImageText)資料集,包含約 4 億對圖文配對,遠超過當時學術界常用的 ImageNet(100 萬張、1000 類)或 Conceptual Captions(300 萬對)。大規模、多樣化的配對使模型學到了從「貓」「一隻橘色的貓坐在沙發上」到「一幅描繪日落的油畫」等各種層次的視覺語意。

三、零次遷移能力

CLIP 最令研究界驚豔的特性是其強大的零次遷移能力。傳統視覺分類模型需要為每個任務準備標注資料並重新訓練。CLIP 則可以直接對任意分類問題進行推理,方法是將候選類別名稱轉換成文字提示(prompt),例如「a photo of a [類別名]」,然後計算輸入圖像與所有候選文字提示的相似度,選取相似度最高者作為預測類別。

研究報告顯示,CLIP 在 ImageNet 的零次遷移準確率達到 76.2%,接近早期有監督訓練的 ResNet-50 水準(76.1%),且 CLIP 完全沒有看過 ImageNet 的訓練樣本。這意味著 CLIP 可以在不需要額外標注資料的情況下,直接泛化到新的視覺分類任務。

四、後續影響與衍生應用

CLIP 對 AI 社群產生了深遠影響,催生了大量後續研究與應用。在文生圖領域,DALL-E 2、Stable Diffusion 的 CLIP 文字條件機制都直接或間接利用 CLIP 的文字空間作為語意導引。在圖像檢索系統中,CLIP 的多模態向量空間使得以文字搜尋圖片(或以圖搜文)成為可能,許多電子商務平台已採用此技術。在開放詞彙偵測(Open-vocabulary Detection)與分割領域,CLIP 的視覺語意表示被整合進 GLIP、OWL-ViT 等模型。在影片理解領域,VideoCLIP 等工作將對比預訓練擴展到時序維度。

五、侷限性與批評

CLIP 並非沒有缺點。首先,對比學習目標只對齊圖文的整體語意,對細粒度(Fine-grained)的視覺差異(如計數、空間關係、顏色比較)表現較弱。其次,由於訓練資料來自網際網路,可能包含社會偏見,例如在某些職業類別上存在性別或種族刻板印象。第三,CLIP 在需要精確推理而非語意相似度判斷的任務(如光學字元辨識、計數)上仍有明顯瓶頸。

六、iPAS 考試關聯

在 iPAS AI 應用規劃師考試中,CLIP 通常出現在多模態學習與視覺語言模型的考題中,考生需理解對比學習的原理、CLIP 如何進行零次遷移推理,以及其與 DALL-E、Stable Diffusion 等生成模型的關係。熟悉 CLIP 有助於理解多模態 AI 系統的設計思維。

常見問題