搜尋意圖: 如果你在找「邊界框偵測 是什麼」或「邊界框偵測 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 邊界框偵測是一種電腦視覺技術,用於在影像或影片中定位和識別物體,並使用矩形框標示出物體的位置。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
你想知道圖片裡的物體不只在哪一類,還要在哪個位置時,你會怎麼判斷它真正的作用?
你可以把它想成 邊界框偵測是一種電腦視覺技術,用於在影像或影片中定位和識別物體,並使用矩形框標示出物體的位置。
在 你想知道圖片裡的物體不只在哪一類,還要在哪個位置時 這種情境裡,這個概念會直接影響你怎麼設計、怎麼評估、怎麼上線。
容易混淆
邊界框 vs 圖像分類 分類只回答有沒有,邊界框還要回答物體在哪裡。
邊界框 vs 語義分割 邊界框只畫矩形,分割則要描出更精細的輪廓。
邊界框 vs 追蹤 邊界框是單張影像的定位,追蹤是跨時間維持同一物體的軌跡。
記住這句就好
先看它要解決的是什麼問題,再看它是不是最合適的方法。
實際案例
案例 1:行車影像 系統先框出車、人、腳踏車,才能再做距離或風險判斷。
案例 2:賣場盤點 貨架上哪一格缺貨,可以先靠邊界框標出商品位置。
算法與應用
面向 重點 核心 模型要同時做分類和定位,通常會輸出類別與座標。 評估 常用 IoU、Precision、Recall、mAP 來看效果。 注意 框得準不代表一定適合後續任務,還要看速度和穩定性。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 邊界框 | 台灣與中國大陸通用譯名 |
| 边界框 | 簡體寫法 |
| Bounding Box | 英文原名 |
| bbox | 程式碼與標註檔案裡最常見的縮寫 |
| 定界框、外接矩形 | 較少見的變體 |
三種常見的座標格式
| 格式 | 四個數字代表 | 出現在哪 |
|---|---|---|
| xyxy | 左上角 x、左上角 y、右下角 x、右下角 y | PASCAL VOC、多數推論輸出 |
| xywh | 左上角 x、左上角 y、寬、高 | COCO 標註檔 |
| cxcywh | 中心點 x、中心點 y、寬、高 | YOLO 系列,且數值多半已正規化到 0 到 1 |
格式搞錯是物件偵測最常見的低級錯誤,症狀是框全部歪掉或縮在左上角。看到座標值都在 0 到 1 之間,代表已經除以影像寬高做過正規化,畫圖前要乘回去。
另外要注意影像座標系的 y 軸向下為正,原點在左上角,跟數學課的座標系相反。
IoU 怎麼算
IoU(Intersection over Union,交併比)是判斷兩個框重疊程度的標準指標,也是評估偵測結果對錯的依據。
IoU = 交集面積 ÷ 聯集面積
實際算一次。框 A 是 (0, 0, 10, 10),框 B 是 (5, 5, 15, 15),都用 xyxy 格式:
項目 計算 結果 交集區域 x 從 5 到 10、y 從 5 到 10 5 × 5 = 25 A 面積 10 × 10 100 B 面積 10 × 10 100 聯集面積 100 + 100 − 25 175 IoU 25 ÷ 175 0.143 值域 0 到 1,0 代表完全不重疊,1 代表完全重合。評估時常用 0.5 當作「算對」的門檻。
標註品質的實務要點
框要貼緊物件的可見範圍。 太鬆會讓模型學到背景,太緊會切掉邊緣特徵。
被遮擋的物件要有一致的規則:只框看得見的部分,還是連推測的完整輪廓一起框,整個資料集必須統一,否則模型學到的是矛盾的訊號。
邊界框的先天限制是它裝不下形狀。 一條斜放的長桿子,它的邊界框裡大部分是背景。需要精確形狀時要改用實例分割(instance segmentation)或旋轉框(oriented bounding box),後者在遙測影像與文件版面分析上很常用。
情境判斷
Q1(判斷題): 如果模型只說照片裡有狗,卻沒說狗在哪,算邊界框偵測嗎? → 不算,那只是圖像分類。
Q2(判斷題): 如果兩個物體重疊得很厲害,邊界框就一定夠用嗎? → 不一定,這時可能要更細的分割或更好的後處理。
常見問題
邊界框和 mAP 有什麼關係?
mAP 是常用評估指標,用來看不同類別和不同 IoU 門檻下的整體表現。
為什麼會有重複框?
模型可能對同一物體預測出多個候選框,所以要做 NMS。
框越大越好嗎?
不一定,太大會吃掉背景,IoU 也可能變差。