你只看一次 是什麼?

YOLO:你只看一次 的完整解釋

YOLO (You Only Look Once) 是一種即時物件偵測演算法,它將物件偵測視為一個迴歸問題,直接從完整圖像預測邊界框和類別機率。

容易混淆

YOLO vs 兩階段物件偵測 兩階段方法先找候選區域再分類,YOLO 則是一次完成偵測和分類。

YOLO vs 圖像分類 圖像分類只回答「這張圖是什麼」,YOLO 還要回答「它在哪裡」。

YOLO vs 非極大值抑制 NMS 不是偵測模型本體,它是用來去掉重疊重複框的後處理。

最關鍵的區別:YOLO 是又快又直接的偵測法,不只是看圖分類。

記住這句就好

一次看完一張圖,直接找出物件。

實際案例

工廠產線檢查 攝影機每秒都在拍,系統要即時找出瑕疵品或掉落物,YOLO 很適合做高速度偵測。

道路監控 交通系統要快速找出車輛、行人和事故狀況,YOLO 的速度通常比重型兩階段模型更有優勢。

算法與應用

YOLO 的核心精神是把偵測當成一次性的回歸問題。

它通常會搭配邊界框預測、物件信心分數和非極大值抑制,一起完成最後輸出。

在實務上,速度、精準率、模型大小三者常要一起平衡,沒有任何版本能在所有場景都最強。

YOLO 為什麼快:一次看完整張圖

YOLO 是 You Only Look Once 的縮寫,這個名字是相對於它出現之前的做法取的。

之前的兩階段做法(R-CNN 這一路)。 先產生上千個可能有物體的候選框,再對每一個框各跑一次分類器。準確但慢,因為同一張圖被重複處理很多次。

YOLO 的一階段做法。 把整張圖切成網格,一次前向傳播就同時輸出所有格子的框位置、框的信心分數與類別機率。整張圖只過一次網路。

這個設計讓它從「秒級」進到「即時」,也讓它成為工廠檢測、交通監控、自駕感知這類需要每秒處理數十幀場合的預設選擇。

代價是早期版本對小物體與密集重疊物體的表現較弱,因為每個網格能負責的物體數量有限。後續版本用多尺度預測與錨框(anchor)設計改善了這個問題,較新的版本則走向無錨框(anchor-free)。

物件偵測要看的三個數字

指標 意思 注意事項
mAP 平均精度均值,準不準 一定要問是 mAP@0.5 還是 mAP@[.5:.95]
FPS 每秒處理幾幀 一定要問是哪張顯卡、什麼解析度、有沒有量化
參數量 / FLOPs 模型多大、多少運算 決定能不能塞進邊緣裝置

這三個永遠是取捨關係。同一代 YOLO 通常會出 n / s / m / l / x 幾種大小,就是讓你在準度與速度之間選。

選型的判斷:先確定你的硬體與延遲要求,那決定了模型大小的上限;再在那個上限內選 mAP 最高的。反過來先挑準度最高的再想怎麼跑,通常會做白工。

還有一件實務上更重要的事:多數場景下,換更大的模型帶來的提升,遠不如把自己的資料標好、把資料增強設對。YOLO 系列對訓練資料品質相當敏感。

情境判斷

Q1(直覺題): 你要在監視器上即時找出闖入的人,YOLO 合適嗎?

→ 合適,因為它特別重視速度和即時性。

Q2(判斷題): 如果你的場景裡物件非常小、非常密,而且寧可慢一點也要更高精度,YOLO 一定最適合嗎?

→ 不一定。這時要看版本、解析度和替代模型,可能還要改用更重的偵測器。

相關術語

常見問題

YOLO 版本之間差很多嗎?

差很多,不同版本在骨幹網路、訓練策略和部署方式上都可能有明顯差異。

YOLO 的信心分數是什麼?

它是模型對某個框裡有物件的把握程度,通常也會結合分類分數和框的位置品質。

YOLO 能不能抓小物件?

可以,但通常要更高解析度、多尺度特徵或版本調整,才會比較穩。

YOLO 可以做分割嗎?

有些 YOLO 變體可以延伸到分割任務,但那已經不只是基本偵測輸出了。