影像描述生成 是什麼?
Image Captioning:影像描述生成 的完整解釋
影像描述生成(Image Captioning)是電腦視覺與自然語言處理的交叉任務,旨在讓模型自動為輸入影像產生自然語言描述,是多模態 AI 的核心應用之一,評估指標常用 BLEU、CIDEr、SPI
核心概念
影像描述生成(Image Captioning)是一項橋接視覺與語言的多模態任務:輸入一張影像,輸出一段自然語言描述。其本質是一個序列生成問題,需要模型:
- 理解視覺內容:識別影像中的物體(Object)、屬性(Attribute)、動作(Action)和場景(Scene)
- 建立視覺-語言對應:將視覺特徵映射到語言空間的語意概念
- 生成流暢描述:依語法和語意規則生成自然、流暢且語意精確的句子
任務的複雜性來源:
- 語言多樣性:同一張影像可以有多種正確描述,如「一隻棕色的狗在公園裡跑步」和「在綠色草地上奔跑的拉布拉多犬」都描述了同一場景
- 細粒度識別:區分「站著的老人」和「坐著的年輕男性」需要精細的視覺理解
- 關係理解:「貓坐在電腦鍵盤上」要求模型理解空間位置關係,而非僅識別物體
- 常識推理:「一個人拿著雨傘走在濕地板上」暗示「可能在下雨」,需要超越圖面的推理
運作原理
模型架構演進:
第一代:CNN + RNN 架構(2014-2019)
以 Vinyals 等人的「Show and Tell」(2014 NeurIPS)為代表,用 Inception/ResNet 提取影像全局特徵向量,輸入 LSTM 序列模型逐詞生成描述。主要缺點:LSTM 在長序列生成中容易遺忘早期視覺資訊,全局特徵向量無法區分影像不同區域。
第二代:注意力機制增強(2015-2020)
引入軟注意力(Soft Attention)後,模型在生成每個詞時動態聚焦影像的不同區域:生成「狗」時關注狗的位置,生成「跑步」時關注腿部動態。「Show, Attend and Tell」(Xu et al., 2015)是此方向的里程碑。底部對上的注意力(Bottom-Up Attention)進一步將注意力聚焦到區域特徵(Region Features),由 RCNN 提取影像中的物件區塊,顯著提升 MSCOCO 基準表現。
第三代:視覺 Transformer 架構(2020 至今)
Vision Transformer(ViT)將影像切分成固定大小的 Patch,作為序列輸入 Transformer 編碼器,解決 CNN 局部感受野的限制。CLIP(Contrastive Language-Image Pre-Training)以大規模影像-文字對比學習,建立強大的視覺-語言聯合表示空間。
現代主流架構(如 BLIP-2、LLaVA、InstructBLIP)以 CLIP 或 ViT 為視覺編碼器,連接橋接層(Q-Former 或線性投影),輸入凍結或微調的 LLM(LLaMA、Vicuna 等)生成描述。
評估指標:
- BLEU-4:n-gram 精確率,歷史最廣泛使用,但對語義等效描述不敏感
- METEOR:考慮詞幹匹配和同義詞,與人類判斷相關性更高
- CIDEr(Consensus-based Image Description Evaluation):專為影像描述設計,加強罕見 n-gram 的權重,更能區分模型質量
- SPICE(Semantic Propositional Image Caption Evaluation):將描述解析為語義場景圖(Scene Graph)後比較,不依賴 n-gram 表面形式
實際應用
無障礙輔助技術:為視障使用者自動描述影像是最直接的社會應用。Microsoft Azure AI Vision、Google Cloud Vision API 和 Apple 的 VoiceOver 都整合了影像描述功能,讓視障人士能理解社群媒體上的照片和文件中的圖表。
電子商務影像搜尋:自動為商品圖片生成描述標籤,提升商品的可搜尋性,減少人工標注成本。Amazon、Shopify 等平台利用影像描述技術自動補全商品資訊。
醫療影像報告生成:X 光、病理切片的自動描述生成是高度活躍的研究方向,目標是輔助放射科醫師生成初步報告,提高診斷效率。此領域需要特別強調準確性和可解釋性,幻覺問題(Hallucination)的容忍度極低。
多模態 AI 助理:GPT-4V、Claude 3 Vision、Gemini 等多模態大模型的核心能力之一即是影像理解和描述,支援使用者上傳圖片進行問答,如「這張圖的公式是什麼意思?」「這個紅斑是什麼皮膚問題?」
常見誤區
誤區一:影像描述生成只是物體識別加文字生成
優質的影像描述不僅需要識別物體,還需要理解物體之間的空間關係(「左邊」「上方」「在…裡面」)、動態情景(「跑步中的男孩」vs.「站立的男孩」)、情緒和氣氛(「歡樂的家庭聚餐」),以及常識推理(「空蕩蕩的教室」暗示「課後或假日」)。這些理解需要多層次的語意抽象,遠超單純的物體分類。
誤區二:BLEU 分數高代表影像描述品質好
BLEU 是 n-gram 表面形式比對,對「一隻白色的貓在窗邊睡覺」和「一隻雪白的貓正在窗台上休息」給出很低的相似度,儘管語義幾乎等同。影像描述評估應搭配 CIDEr、SPICE 等指標,並定期進行人工評估,因為這些評估指標仍無法完全捕捉人類的語言感知。
誤區三:現代多模態 LLM 已解決影像描述問題
儘管 GPT-4V 等模型在一般場景的影像描述上表現出色,但在特定領域(如醫療影像、工業零件、稀有物種)、低解析度或模糊影像、複雜空間關係、以及含有文字的影像(Scene Text Understanding)上仍有明顯限制。影像描述的幻覺問題(描述了影像中不存在的物體)也是當前研究的核心挑戰。
與相關技術的比較
| 任務 | 輸入 | 輸出 | 典型模型 | 評估指標 |
|---|---|---|---|---|
| 影像描述生成 | 影像 | 自然語言描述 | BLIP-2、LLaVA | BLEU、CIDEr、SPICE |
| 視覺問答(VQA) | 影像 + 問題 | 短答案 | CLIP、FLAVA | VQA Accuracy |
| 影像搜尋 | 文字查詢 | 影像列表 | CLIP | Recall@K |
| 光學字元識別(OCR) | 影像中的文字 | 文字字串 | TrOCR | CER、WER |
| 影像分類 | 影像 | 類別標籤 | ViT、ResNet | Top-1/Top-5 Accuracy |
影像描述生成是多模態 AI 理解能力的綜合測試,其進步常常驅動視覺問答、圖文對齊等相關任務的同步提升,是評估視覺語言模型(VLM)基礎能力的核心基準任務之一。