實例分割 是什麼?

Instance Segmentation:實例分割 的完整解釋

在影像中同時偵測物件並為每個獨立個體生成精確像素級遮罩,區分同類中的不同個體。

實例分割(Instance Segmentation)是電腦視覺領域中整合層次最高的感知任務,要求模型在同一張影像中同時完成三件事:定位每個物件(bounding box)、辨識物件類別(classification),以及為每個物件個體生成像素級的二元遮罩(binary mask)。這使得實例分割比物件偵測更精確,也比語意分割更具有個體區分能力。

要理解實例分割,必須先釐清它與相關任務的差異。語意分割(Semantic Segmentation)將影像中每個像素標記為某個類別(例如「人」「車」「天空」),但無法區分同一類別中的不同個體:兩個靠在一起的人會被標記為同一個「人」區域。全景分割(Panoptic Segmentation)進一步結合了語意分割與實例分割,同時處理可數物件(things,如人、車)與不可數背景(stuff,如草地、天空)。實例分割則專注於可數物件,確保每個個體擁有自己獨立的遮罩標識,即使兩個物件在像素上完全重疊也能被分開。

發展歷程上,實例分割的里程碑是 Facebook AI Research 於 2017 年提出的 Mask R-CNN。Mask R-CNN 在 Faster R-CNN 的物件偵測架構上額外增加了一個並行分支,針對每個 RoI(Region of Interest)預測對應的二元遮罩。這個設計簡潔有效,成為此後多年的基準架構。後繼研究致力於提升速度與精度:YOLACT(You Only Look At CoefficienTs)採用「原型遮罩 + 線性組合」的方式實現實時推論;SOLOv2 使用動態卷積核按位置與大小生成遮罩,取消了錨點框的需求;CondInst 以條件卷積生成個體專屬濾波器,進一步提升速度。

技術實作上,主流實例分割系統通常包含以下模組。骨幹網路(backbone)負責提取多尺度特徵,常見選擇為 ResNet 或 Vision Transformer;特徵金字塔網路(FPN,Feature Pyramid Network)整合不同尺度的特徵圖,使模型能同時處理大小不一的物件;區域提案網路(RPN)或錨點自由(anchor-free)機制生成候選物件位置;遮罩頭(mask head)對每個候選區域輸出 28×28 或更高解析度的二元遮罩,最終縮放至原始物件大小。

評估指標方面,實例分割使用 COCO mAP(mean Average Precision)作為標準,具體計算時考量 IoU(Intersection over Union)門檻值從 0.5 到 0.95 的平均結果,分別對應 AP50、AP75 及整體 AP。遮罩 IoU 與框 IoU 的計算方式相同,但以像素遮罩代替矩形框進行比較。

在 iPAS AI 應用規劃師考試中,實例分割出現在多模態與視覺語言模型類別,考題通常要求考生區分語意分割、實例分割與全景分割的差異,識別 Mask R-CNN 的架構特點,以及了解實例分割在哪些實際應用場景中必不可少。

應用場景廣泛且深具意義。自動駕駛系統需要對行人、車輛、障礙物進行精確的實例分割,以便規劃安全路徑;醫療影像分析中,病理切片上的細胞核計數、腫瘤邊界標定都依賴實例分割;工業品質檢測需要區分流水線上每個瑕疵個體;農業智慧化場景中,作物計數與病蟲害區域定位也有賴於此技術;此外在擴增實境(AR)場景中,實例分割能讓虛擬物件準確覆蓋並追蹤真實世界中的個體。

目前的挑戰與研究方向包括:解決物件密集重疊時的遮罩品質下降問題、在嵌入式裝置上實現高效推論(輕量化架構研究)、以及結合大型視覺語言模型(如 SAM,Segment Anything Model)實現開放詞彙的實例分割:即無需預定義類別清單即可分割任意指定物件。

常見問題