對比式語言影像預訓練(Contrastive Language-Image Pre-training)是什麼?

OpenAI 提出的多模態預訓練架構,透過對比學習同時訓練文字與影像編碼器,使兩者的語意空間對齊。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Contrastive Language-Image Pre-training
主題標籤
多模態學習、對比學習、視覺語言模型
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
對比式語言影像預訓練(Contrastive Language-Image Pre-training)是什麼? 多模態學習對比學習
術語快查

搜尋意圖: 如果你在找「對比式語言影像預訓練 是什麼」或「對比式語言影像預訓練 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: OpenAI 提出的多模態預訓練架構,透過對比學習同時訓練文字與影像編碼器,使兩者的語意空間對齊。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

OpenAI 提出的多模態預訓練架構,透過對比學習同時訓練文字與影像編碼器,使兩者的語意空間對齊。

CLIP(Contrastive Language-Image Pre-training)是多模態人工智慧領域的里程碑研究,由 OpenAI 研究團隊於 2021 年初發表,論文標題為「Learning Transferable Visual Models From Natural Language Supervision」。這項工作的核心貢獻在於證明:只要使用大規模的圖文配對資料與簡潔的對比學習目標,就能訓練出具備驚人零次遷移能力的視覺理解模型,且其在多項視覺基準上的表現甚至可媲美針對特定任務精調過的監督式模型。

一、模型架構設計

CLIP 由兩個編碼器組成,分別負責不同模態的表示學習。視覺編碼器可以是 ResNet(殘差卷積網路)或 Vision Transformer(ViT),負責將輸入影像轉換成固定維度的向量表示。文字編碼器則是一個 Transformer 語言模型,負責將文字描述(可以是一個詞、一句話、或一段描述)也轉換成相同維度的向量表示。

兩個編碼器的輸出會被投影到同一個共享向量空間,並透過對比學習目標進行訓練。訓練時,同一批次(batch)內有 N 對圖文配對,正確的 N 對應有高相似度(接近 1),其餘的 N² - N 個不匹配配對應有低相似度(接近 0)。損失函數計算的是預測矩陣與理想對角矩陣之間的交叉熵,這就是「對比式」名稱的由來。

二、訓練資料的規模

CLIP 的成功很大程度來自訓練資料的規模。OpenAI 從網際網路爬取了 WIT(WebImageText)資料集,包含約 4 億對圖文配對,遠超過當時學術界常用的 ImageNet(100 萬張、1000 類)或 Conceptual Captions(300 萬對)。大規模、多樣化的配對使模型學到了從「貓」「一隻橘色的貓坐在沙發上」到「一幅描繪日落的油畫」等各種層次的視覺語意。

三、零次遷移能力

CLIP 最令研究界驚豔的特性是其強大的零次遷移能力。傳統視覺分類模型需要為每個任務準備標注資料並重新訓練。CLIP 則可以直接對任意分類問題進行推理,方法是將候選類別名稱轉換成文字提示(prompt),例如「a photo of a [類別名]」,然後計算輸入圖像與所有候選文字提示的相似度,選取相似度最高者作為預測類別。

研究報告顯示,CLIP 在 ImageNet 的零次遷移準確率達到 76.2%,接近早期有監督訓練的 ResNet-50 水準(76.1%),且 CLIP 完全沒有看過 ImageNet 的訓練樣本。這意味著 CLIP 可以在不需要額外標注資料的情況下,直接泛化到新的視覺分類任務。

四、後續影響與衍生應用

CLIP 對 AI 社群產生了深遠影響,催生了大量後續研究與應用。在文生圖領域,DALL-E 2、Stable Diffusion 的 CLIP 文字條件機制都直接或間接利用 CLIP 的文字空間作為語意導引。在圖像檢索系統中,CLIP 的多模態向量空間使得以文字搜尋圖片(或以圖搜文)成為可能,許多電子商務平台已採用此技術。在開放詞彙偵測(Open-vocabulary Detection)與分割領域,CLIP 的視覺語意表示被整合進 GLIP、OWL-ViT 等模型。在影片理解領域,VideoCLIP 等工作將對比預訓練擴展到時序維度。

五、侷限性與批評

CLIP 並非沒有缺點。首先,對比學習目標只對齊圖文的整體語意,對細粒度(Fine-grained)的視覺差異(如計數、空間關係、顏色比較)表現較弱。其次,由於訓練資料來自網際網路,可能包含社會偏見,例如在某些職業類別上存在性別或種族刻板印象。第三,CLIP 在需要精確推理而非語意相似度判斷的任務(如光學字元辨識、計數)上仍有明顯瓶頸。

六、iPAS 考試關聯

在 iPAS AI 應用規劃師考試中,CLIP 通常出現在多模態學習與視覺語言模型的考題中,考生需理解對比學習的原理、CLIP 如何進行零次遷移推理,以及其與 DALL-E、Stable Diffusion 等生成模型的關係。熟悉 CLIP 有助於理解多模態 AI 系統的設計思維。

常見問題

CLIP 和一般的影像分類模型有什麼根本差異?

傳統影像分類模型(如 ResNet、EfficientNet)在訓練時只知道固定的幾千個類別,要應用到新類別就必須重新收集資料並微調模型。CLIP 的根本差異在於它學習的是影像與文字語意之間的對應關係,而非固定類別的映射。因此,只要能用文字描述出一個概念,CLIP 就可以在從未見過這個類別任何訓練樣本的情況下進行辨識,這就是「零次遷移」能力的來源。這種能力使 CLIP 在開放領域的視覺理解任務上有顯著優勢。

對比學習(Contrastive Learning)在 CLIP 中是如何運作的?

在 CLIP 的訓練中,每個批次包含 N 對圖文配對(例如一張貓的圖片配上「一隻橘色的貓」)。模型同時將 N 張圖片與 N 段文字各自編碼成向量,計算所有 N×N 對的相似度分數。對比學習的目標是最大化 N 個正確配對(對角線)的相似度,同時最小化其餘 N²−N 個不匹配配對的相似度。這個目標迫使模型學習到有意義的跨模態語意表示,而非只記住特定視覺特徵,因此具有很強的泛化能力。

CLIP 可以直接用來生成圖片嗎?

CLIP 本身是一個判別式模型,只負責計算圖文的相似度分數,無法直接生成圖片。但 CLIP 的文字編碼器或共享語意空間常被生成模型借用作為條件訊號。例如 OpenAI 的 DALL-E 2 使用 CLIP 的文字向量作為擴散模型的條件輸入;許多 Stable Diffusion 版本也整合了 CLIP 文字編碼器。因此,CLIP 在文生圖系統中扮演的是「語意理解與條件導引」的角色,而實際圖片生成工作由擴散模型或其他生成架構負責。