視覺問答(Visual Question Answering)是什麼?

視覺問答(VQA)是一種人工智慧任務,要求模型根據給定的圖像回答自然語言問題,結合了電腦視覺和自然語言處理。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Visual Question Answering
主題標籤
機器學習、深度學習、電腦視覺
考點定位
非 iPAS 核心術語
最後更新
2026/07/29
視覺問答(Visual Question Answering)是什麼? 機器學習深度學習
術語快查

搜尋意圖: 如果你在找「視覺問答 是什麼」或「視覺問答 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 視覺問答(VQA)是一種人工智慧任務,要求模型根據給定的圖像回答自然語言問題,結合了電腦視覺和自然語言處理。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

你有沒有看過一張圖,還想直接問「這裡面是什麼」? 你可以把視覺問答想成「看著圖片回答文字問題」 模型不只要看懂圖,還要把問題和圖像線索對起來 這比單純圖像分類更進一步,因為答案常需要推理

你可以把它想成一個把抽象概念拉回日常判斷的提示,先知道它解決什麼問題,再看技術細節。

容易混淆

視覺問答 vs 圖像分類 視覺問答要回答問題 圖像分類只給一個類別標籤 最關鍵的區別:有沒有問題要回答

視覺問答 vs 圖像描述 視覺問答是針對提問作答 圖像描述是整體描述圖片 最關鍵的區別:定向回答和整體敘述

視覺問答 vs 視覺語言模型 視覺問答是任務 視覺語言模型是常見底層模型 最關鍵的區別:任務和模型

記住這句就好

先看圖,再抓問題關鍵字,最後把兩邊接起來回答。

實際案例

購物客服 使用者上傳商品照片再問尺寸或顏色,系統可直接回覆,減少人工處理

教材理解 學生看到圖表後問「哪一段最高」,模型要從圖像讀出對應位置再答題

算法與應用

| 圖像特徵 | 先看圖片內容 | 是回答的基礎 | | 問題理解 | 抓出問題在問什麼 | 關鍵詞很重要 | | 注意力對齊 | 把問題和圖像區域連起來 | 常是性能關鍵 | | 答案生成 | 輸出簡短或句子型答案 | 常比分類更彈性 |

中英對照與常見說法

說法 出現場合
視覺問答 台灣與中國大陸通用譯名
视觉问答 簡體寫法
Visual Question Answering 英文原名
VQA 標準縮寫
圖像問答 口語變體,意思相同

一個 VQA 系統要做哪三件事

第一,看懂圖。 用視覺編碼器把影像轉成特徵。早期用 CNN 加上物件偵測抽出區域特徵,現在多半用視覺 Transformer(ViT)直接切成影像區塊編碼。

第二,看懂問題。 用語言模型把問題轉成向量表示。

第三,把兩邊對起來並回答。 這一步是 VQA 的核心難點,叫做跨模態融合。做法從早期的簡單相乘、注意力機制,演進到現在把影像特徵直接投影成語言模型看得懂的 token,交給大型語言模型生成答案。

回答形式有兩種設計。分類式把答案限定在一個固定的候選集合(例如最常見的三千個答案),問題變成多選一,準確率好算但答不出集合外的東西。生成式直接產生文字,彈性大但評估困難,因為「兩個人」與「2 人」語意相同卻字串不同。

這個任務為什麼難

語言先驗偏誤(language prior bias) 是 VQA 最著名的問題。模型可以完全不看圖,只靠問題的統計規律就答對相當比例的題目:問「香蕉是什麼顏色」答黃色、問「有幾隻」答二,正確率就不低。這代表高分不等於真的看懂圖。VQA-CP 這類資料集就是刻意把訓練集與測試集的答案分布錯開,用來揭穿這種取巧。

需要圖片以外的知識。「這個標誌代表可以停車嗎」需要交通規則知識,光看圖看不出來。這類題目催生了知識型 VQA(Knowledge-based VQA)的研究方向。

計數與空間關係一直是弱項。數超過五個物件、判斷「左邊數來第三個」,即使是現在的多模態大模型也常出錯。

實際用在哪

視障輔助(拍照問前面是什麼)、電商(問商品圖的細節)、醫療影像初步問答、工業檢測(問這張照片有沒有缺件)、教育與文件理解(問圖表上的數字)。

情境判斷

Q1(直覺題): 你問模型「這張圖裡有幾個人」,這屬於 VQA 嗎?

是,因為它要根據圖片回答文字問題。

Q2(判斷題): 如果題目只要模型寫出圖片內容摘要,還算同一類嗎?

比較接近圖像描述,不完全是 VQA。

常見問題

視覺問答需要真的理解圖嗎?

需要,至少要能把問題對應到圖中的區域或物件。

它和聊天機器人有何不同?

聊天機器人主要處理文字,VQA 還要加上影像。

為什麼答案有時候很短?

因為很多 VQA 資料集本來就以短答案為主。