圖像識別(Image Recognition)是什麼?

圖像識別是電腦視覺領域的一項任務,旨在識別圖像中的對象、人物、地點或事件。它比圖像分類更廣泛,可能涉及定位和標記圖像中的多個對象。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Image Recognition
主題標籤
電腦視覺、深度學習、模型訓練
考點定位
非 iPAS 核心術語
最後更新
2026/07/30
圖像識別(Image Recognition)是什麼? 電腦視覺深度學習
術語快查

搜尋意圖: 如果你在找「圖像識別 是什麼」或「圖像識別 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 圖像識別是電腦視覺領域的一項任務,旨在識別圖像中的對象、人物、地點或事件。它比圖像分類更廣泛,可能涉及定位和標記圖像中的多個對象。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

你有沒有想過,AI 不只看出這是貓,還能知道這是誰、在哪裡、在做什麼?

你可以把圖像識別想成對圖片做更廣義的辨認。 它比單純分類更進一步,會去認出物體、人物、場景或事件,常常還會牽涉位置資訊。

你可以把它想成一個把抽象概念拉回日常判斷的提示,先知道它解決什麼問題,再看技術細節。

容易混淆

圖像識別 vs 圖像分類 分類只關心整張圖的類別 識別的範圍更廣,可能包括人物、場景和位置 最關鍵的區別是整體分類,還是廣義辨認

圖像識別 vs 物件偵測 識別偏向知道是什麼 偵測還要知道在哪裡 最關鍵的區別是辨認本體,還是定位加辨認

記住這句就好

不只貼標籤,還要知道是什麼。

實際案例

相片搜尋 手機或雲端相簿可以靠圖像識別找出人臉、地點或特定物件。

門禁和安防 圖像識別常被用來辨認人員身份,協助門禁或監控系統。

算法與應用

圖像識別的範圍比圖像分類大,常和偵測、分割一起出現。 在實務上,模型好不好通常要看準確率、召回率和誤判成本。

中英對照與常見說法

說法 出現場合
圖像識別、影像辨識 台灣兩種說法都常見,「影像辨識」較正式
图像识别 簡體寫法
Image Recognition 英文原名
電腦視覺(Computer Vision) 涵蓋範圍更廣的上位詞

幾個容易混淆的任務

任務 輸出 例子
影像分類(classification) 整張圖一個標籤 這是貓
物件偵測(detection) 多個邊界框加類別 圖上有 2 隻貓,位置在這裡
語義分割(segmentation) 每個像素一個類別 這些像素屬於貓
影像檢索(retrieval) 相似影像清單 找出跟這張最像的商品
人臉辨識(face recognition) 身分 這是誰

日常講「圖像識別」時,指的可能是上面任何一種。溝通規格時一定要問清楚要的是哪一個,因為資料標註成本與模型選擇差很多:分類只要一張圖一個標籤,分割要逐像素標,成本差上百倍。

技術演進

手工特徵時期:SIFT、HOG 這類人工設計的特徵抽取器,加上 SVM 之類的分類器。表現受限於特徵設計的好壞。

卷積神經網路時期:2012 年 AlexNet 在 ImageNet 上大幅領先之後,特徵改由網路自己學。之後是 VGG、ResNet(用殘差連接讓網路能疊到很深)、EfficientNet 這一系列。

Transformer 與多模態時期:ViT 把影像切成區塊當序列處理;CLIP 用大量圖文配對訓練,讓模型能用文字描述辨識沒有專門訓練過的類別,這使得零樣本影像辨識變得實用。

實務上最常見的三個坑

訓練資料與實際場景不一致。 用網路上乾淨的商品照訓練,上線後拍的是倉庫裡歪斜、反光、部分遮擋的照片,準確率直接腰斬。資料收集要盡量在真實環境下做。

模型學到了不該學的線索。 所有正樣本都是同一台相機在同一個角度拍的,模型可能是靠背景或色調在判斷。用 Grad-CAM 這類工具看模型在注意哪裡,是最快發現這個問題的方法。

類別不平衡與長尾。 實際場景裡少數類別佔絕大多數樣本,罕見但重要的類別(瑕疵、危險物)樣本極少。整體準確率會漂亮但沒有用,評估一定要看各類別的召回率。

情境判斷

Q1: 你要讓系統在照片裡找出某個人,會想到什麼? → 圖像識別,若還要畫框定位,則會進一步用物件偵測。

Q2: 你只要知道照片屬於哪一類,還需要完整識別嗎? → 不一定,只做圖像分類就夠了。

常見問題

圖像識別和物件偵測一樣嗎?

不一樣,物件偵測更重視位置。

它常用什麼模型?

CNN、遷移學習和更進階的視覺模型都常見。

有什麼限制?

光線、角度、遮擋和資料偏差都會影響結果。