圖像識別 是什麼?

Image Recognition:圖像識別 的完整解釋

圖像識別是電腦視覺領域的一項任務,旨在識別圖像中的對象、人物、地點或事件。它比圖像分類更廣泛,可能涉及定位和標記圖像中的多個對象。

容易混淆

圖像識別 vs 圖像分類 分類只關心整張圖的類別 識別的範圍更廣,可能包括人物、場景和位置 最關鍵的區別是整體分類,還是廣義辨認

圖像識別 vs 物件偵測 識別偏向知道是什麼 偵測還要知道在哪裡 最關鍵的區別是辨認本體,還是定位加辨認

記住這句就好

不只貼標籤,還要知道是什麼。

實際案例

相片搜尋 手機或雲端相簿可以靠圖像識別找出人臉、地點或特定物件。

門禁和安防 圖像識別常被用來辨認人員身份,協助門禁或監控系統。

算法與應用

圖像識別的範圍比圖像分類大,常和偵測、分割一起出現。 在實務上,模型好不好通常要看準確率、召回率和誤判成本。

中英對照與常見說法

說法 出現場合
圖像識別、影像辨識 台灣兩種說法都常見,「影像辨識」較正式
图像识别 簡體寫法
Image Recognition 英文原名
電腦視覺(Computer Vision) 涵蓋範圍更廣的上位詞

幾個容易混淆的任務

任務 輸出 例子
影像分類(classification) 整張圖一個標籤 這是貓
物件偵測(detection) 多個邊界框加類別 圖上有 2 隻貓,位置在這裡
語義分割(segmentation) 每個像素一個類別 這些像素屬於貓
影像檢索(retrieval) 相似影像清單 找出跟這張最像的商品
人臉辨識(face recognition) 身分 這是誰

日常講「圖像識別」時,指的可能是上面任何一種。溝通規格時一定要問清楚要的是哪一個,因為資料標註成本與模型選擇差很多:分類只要一張圖一個標籤,分割要逐像素標,成本差上百倍。

技術演進

手工特徵時期:SIFT、HOG 這類人工設計的特徵抽取器,加上 SVM 之類的分類器。表現受限於特徵設計的好壞。

卷積神經網路時期:2012 年 AlexNet 在 ImageNet 上大幅領先之後,特徵改由網路自己學。之後是 VGG、ResNet(用殘差連接讓網路能疊到很深)、EfficientNet 這一系列。

Transformer 與多模態時期:ViT 把影像切成區塊當序列處理;CLIP 用大量圖文配對訓練,讓模型能用文字描述辨識沒有專門訓練過的類別,這使得零樣本影像辨識變得實用。

實務上最常見的三個坑

訓練資料與實際場景不一致。 用網路上乾淨的商品照訓練,上線後拍的是倉庫裡歪斜、反光、部分遮擋的照片,準確率直接腰斬。資料收集要盡量在真實環境下做。

模型學到了不該學的線索。 所有正樣本都是同一台相機在同一個角度拍的,模型可能是靠背景或色調在判斷。用 Grad-CAM 這類工具看模型在注意哪裡,是最快發現這個問題的方法。

類別不平衡與長尾。 實際場景裡少數類別佔絕大多數樣本,罕見但重要的類別(瑕疵、危險物)樣本極少。整體準確率會漂亮但沒有用,評估一定要看各類別的召回率。

情境判斷

Q1: 你要讓系統在照片裡找出某個人,會想到什麼? → 圖像識別,若還要畫框定位,則會進一步用物件偵測。

Q2: 你只要知道照片屬於哪一類,還需要完整識別嗎? → 不一定,只做圖像分類就夠了。

相關術語

常見問題

圖像識別和物件偵測一樣嗎?

不一樣,物件偵測更重視位置。

它常用什麼模型?

CNN、遷移學習和更進階的視覺模型都常見。

有什麼限制?

光線、角度、遮擋和資料偏差都會影響結果。