邊界框偵測 是什麼?

Bounding Box:邊界框偵測 的完整解釋

邊界框偵測是一種電腦視覺技術,用於在影像或影片中定位和識別物體,並使用矩形框標示出物體的位置。

容易混淆

邊界框 vs 圖像分類 分類只回答有沒有,邊界框還要回答物體在哪裡。

邊界框 vs 語義分割 邊界框只畫矩形,分割則要描出更精細的輪廓。

邊界框 vs 追蹤 邊界框是單張影像的定位,追蹤是跨時間維持同一物體的軌跡。

記住這句就好

先看它要解決的是什麼問題,再看它是不是最合適的方法。

實際案例

案例 1:行車影像 系統先框出車、人、腳踏車,才能再做距離或風險判斷。

案例 2:賣場盤點 貨架上哪一格缺貨,可以先靠邊界框標出商品位置。

算法與應用

面向 重點
核心 模型要同時做分類和定位,通常會輸出類別與座標。
評估 常用 IoU、Precision、Recall、mAP 來看效果。
注意 框得準不代表一定適合後續任務,還要看速度和穩定性。

中英對照與常見說法

說法 出現場合
邊界框 台灣與中國大陸通用譯名
边界框 簡體寫法
Bounding Box 英文原名
bbox 程式碼與標註檔案裡最常見的縮寫
定界框、外接矩形 較少見的變體

三種常見的座標格式

格式 四個數字代表 出現在哪
xyxy 左上角 x、左上角 y、右下角 x、右下角 y PASCAL VOC、多數推論輸出
xywh 左上角 x、左上角 y、寬、高 COCO 標註檔
cxcywh 中心點 x、中心點 y、寬、高 YOLO 系列,且數值多半已正規化到 0 到 1

格式搞錯是物件偵測最常見的低級錯誤,症狀是框全部歪掉或縮在左上角。看到座標值都在 0 到 1 之間,代表已經除以影像寬高做過正規化,畫圖前要乘回去。

另外要注意影像座標系的 y 軸向下為正,原點在左上角,跟數學課的座標系相反。

IoU 怎麼算

IoU(Intersection over Union,交併比)是判斷兩個框重疊程度的標準指標,也是評估偵測結果對錯的依據。

IoU = 交集面積 ÷ 聯集面積

實際算一次。框 A 是 (0, 0, 10, 10),框 B 是 (5, 5, 15, 15),都用 xyxy 格式:

項目 計算 結果
交集區域 x 從 5 到 10、y 從 5 到 10 5 × 5 = 25
A 面積 10 × 10 100
B 面積 10 × 10 100
聯集面積 100 + 100 − 25 175
IoU 25 ÷ 175 0.143

值域 0 到 1,0 代表完全不重疊,1 代表完全重合。評估時常用 0.5 當作「算對」的門檻。

標註品質的實務要點

框要貼緊物件的可見範圍。 太鬆會讓模型學到背景,太緊會切掉邊緣特徵。

被遮擋的物件要有一致的規則:只框看得見的部分,還是連推測的完整輪廓一起框,整個資料集必須統一,否則模型學到的是矛盾的訊號。

邊界框的先天限制是它裝不下形狀。 一條斜放的長桿子,它的邊界框裡大部分是背景。需要精確形狀時要改用實例分割(instance segmentation)或旋轉框(oriented bounding box),後者在遙測影像與文件版面分析上很常用。

情境判斷

Q1(判斷題): 如果模型只說照片裡有狗,卻沒說狗在哪,算邊界框偵測嗎? → 不算,那只是圖像分類。

Q2(判斷題): 如果兩個物體重疊得很厲害,邊界框就一定夠用嗎? → 不一定,這時可能要更細的分割或更好的後處理。

相關術語

常見問題

邊界框和 mAP 有什麼關係?

mAP 是常用評估指標,用來看不同類別和不同 IoU 門檻下的整體表現。

為什麼會有重複框?

模型可能對同一物體預測出多個候選框,所以要做 NMS。

框越大越好嗎?

不一定,太大會吃掉背景,IoU 也可能變差。