圖像識別 是什麼?
Image Recognition:圖像識別 的完整解釋
圖像識別是電腦視覺領域的一項任務,旨在識別圖像中的對象、人物、地點或事件。它比圖像分類更廣泛,可能涉及定位和標記圖像中的多個對象。
容易混淆
圖像識別 vs 圖像分類 分類只關心整張圖的類別 識別的範圍更廣,可能包括人物、場景和位置 最關鍵的區別是整體分類,還是廣義辨認
圖像識別 vs 物件偵測 識別偏向知道是什麼 偵測還要知道在哪裡 最關鍵的區別是辨認本體,還是定位加辨認
記住這句就好
不只貼標籤,還要知道是什麼。
實際案例
相片搜尋 手機或雲端相簿可以靠圖像識別找出人臉、地點或特定物件。
門禁和安防 圖像識別常被用來辨認人員身份,協助門禁或監控系統。
算法與應用
圖像識別的範圍比圖像分類大,常和偵測、分割一起出現。 在實務上,模型好不好通常要看準確率、召回率和誤判成本。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 圖像識別、影像辨識 | 台灣兩種說法都常見,「影像辨識」較正式 |
| 图像识别 | 簡體寫法 |
| Image Recognition | 英文原名 |
| 電腦視覺(Computer Vision) | 涵蓋範圍更廣的上位詞 |
幾個容易混淆的任務
| 任務 | 輸出 | 例子 |
|---|---|---|
| 影像分類(classification) | 整張圖一個標籤 | 這是貓 |
| 物件偵測(detection) | 多個邊界框加類別 | 圖上有 2 隻貓,位置在這裡 |
| 語義分割(segmentation) | 每個像素一個類別 | 這些像素屬於貓 |
| 影像檢索(retrieval) | 相似影像清單 | 找出跟這張最像的商品 |
| 人臉辨識(face recognition) | 身分 | 這是誰 |
日常講「圖像識別」時,指的可能是上面任何一種。溝通規格時一定要問清楚要的是哪一個,因為資料標註成本與模型選擇差很多:分類只要一張圖一個標籤,分割要逐像素標,成本差上百倍。
技術演進
手工特徵時期:SIFT、HOG 這類人工設計的特徵抽取器,加上 SVM 之類的分類器。表現受限於特徵設計的好壞。
卷積神經網路時期:2012 年 AlexNet 在 ImageNet 上大幅領先之後,特徵改由網路自己學。之後是 VGG、ResNet(用殘差連接讓網路能疊到很深)、EfficientNet 這一系列。
Transformer 與多模態時期:ViT 把影像切成區塊當序列處理;CLIP 用大量圖文配對訓練,讓模型能用文字描述辨識沒有專門訓練過的類別,這使得零樣本影像辨識變得實用。
實務上最常見的三個坑
訓練資料與實際場景不一致。 用網路上乾淨的商品照訓練,上線後拍的是倉庫裡歪斜、反光、部分遮擋的照片,準確率直接腰斬。資料收集要盡量在真實環境下做。
模型學到了不該學的線索。 所有正樣本都是同一台相機在同一個角度拍的,模型可能是靠背景或色調在判斷。用 Grad-CAM 這類工具看模型在注意哪裡,是最快發現這個問題的方法。
類別不平衡與長尾。 實際場景裡少數類別佔絕大多數樣本,罕見但重要的類別(瑕疵、危險物)樣本極少。整體準確率會漂亮但沒有用,評估一定要看各類別的召回率。
情境判斷
Q1: 你要讓系統在照片裡找出某個人,會想到什麼? → 圖像識別,若還要畫框定位,則會進一步用物件偵測。
Q2: 你只要知道照片屬於哪一類,還需要完整識別嗎? → 不一定,只做圖像分類就夠了。
相關術語
常見問題
圖像識別和物件偵測一樣嗎?
不一樣,物件偵測更重視位置。
它常用什麼模型?
CNN、遷移學習和更進階的視覺模型都常見。
有什麼限制?
光線、角度、遮擋和資料偏差都會影響結果。