實例分割(Instance Segmentation)是什麼?

在影像中同時偵測物件並為每個獨立個體生成精確像素級遮罩,區分同類中的不同個體。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Instance Segmentation
主題標籤
電腦視覺、影像分割、物件偵測
考點定位
非 iPAS 核心術語
最後更新
2026/07/30
實例分割(Instance Segmentation)是什麼? 電腦視覺影像分割
術語快查

搜尋意圖: 如果你在找「實例分割 是什麼」或「實例分割 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 在影像中同時偵測物件並為每個獨立個體生成精確像素級遮罩,區分同類中的不同個體。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

在影像中同時偵測物件並為每個獨立個體生成精確像素級遮罩,區分同類中的不同個體。

實例分割(Instance Segmentation)是電腦視覺領域中整合層次最高的感知任務,要求模型在同一張影像中同時完成三件事:定位每個物件(bounding box)、辨識物件類別(classification),以及為每個物件個體生成像素級的二元遮罩(binary mask)。這使得實例分割比物件偵測更精確,也比語意分割更具有個體區分能力。

要理解實例分割,必須先釐清它與相關任務的差異。語意分割(Semantic Segmentation)將影像中每個像素標記為某個類別(例如「人」「車」「天空」),但無法區分同一類別中的不同個體:兩個靠在一起的人會被標記為同一個「人」區域。全景分割(Panoptic Segmentation)進一步結合了語意分割與實例分割,同時處理可數物件(things,如人、車)與不可數背景(stuff,如草地、天空)。實例分割則專注於可數物件,確保每個個體擁有自己獨立的遮罩標識,即使兩個物件在像素上完全重疊也能被分開。

發展歷程上,實例分割的里程碑是 Facebook AI Research 於 2017 年提出的 Mask R-CNN。Mask R-CNN 在 Faster R-CNN 的物件偵測架構上額外增加了一個並行分支,針對每個 RoI(Region of Interest)預測對應的二元遮罩。這個設計簡潔有效,成為此後多年的基準架構。後繼研究致力於提升速度與精度:YOLACT(You Only Look At CoefficienTs)採用「原型遮罩 + 線性組合」的方式實現實時推論;SOLOv2 使用動態卷積核按位置與大小生成遮罩,取消了錨點框的需求;CondInst 以條件卷積生成個體專屬濾波器,進一步提升速度。

技術實作上,主流實例分割系統通常包含以下模組。骨幹網路(backbone)負責提取多尺度特徵,常見選擇為 ResNet 或 Vision Transformer;特徵金字塔網路(FPN,Feature Pyramid Network)整合不同尺度的特徵圖,使模型能同時處理大小不一的物件;區域提案網路(RPN)或錨點自由(anchor-free)機制生成候選物件位置;遮罩頭(mask head)對每個候選區域輸出 28×28 或更高解析度的二元遮罩,最終縮放至原始物件大小。

評估指標方面,實例分割使用 COCO mAP(mean Average Precision)作為標準,具體計算時考量 IoU(Intersection over Union)門檻值從 0.5 到 0.95 的平均結果,分別對應 AP50、AP75 及整體 AP。遮罩 IoU 與框 IoU 的計算方式相同,但以像素遮罩代替矩形框進行比較。

在 iPAS AI 應用規劃師考試中,實例分割出現在多模態與視覺語言模型類別,考題通常要求考生區分語意分割、實例分割與全景分割的差異,識別 Mask R-CNN 的架構特點,以及了解實例分割在哪些實際應用場景中必不可少。

應用場景廣泛且深具意義。自動駕駛系統需要對行人、車輛、障礙物進行精確的實例分割,以便規劃安全路徑;醫療影像分析中,病理切片上的細胞核計數、腫瘤邊界標定都依賴實例分割;工業品質檢測需要區分流水線上每個瑕疵個體;農業智慧化場景中,作物計數與病蟲害區域定位也有賴於此技術;此外在擴增實境(AR)場景中,實例分割能讓虛擬物件準確覆蓋並追蹤真實世界中的個體。

目前的挑戰與研究方向包括:解決物件密集重疊時的遮罩品質下降問題、在嵌入式裝置上實現高效推論(輕量化架構研究)、以及結合大型視覺語言模型(如 SAM,Segment Anything Model)實現開放詞彙的實例分割:即無需預定義類別清單即可分割任意指定物件。

常見問題

實例分割和語意分割有什麼核心差異?

語意分割的輸出是一張與輸入影像等大的標籤圖,每個像素被賦予一個類別標籤(如「人」「車」「道路」),但同一類別的不同個體共用同一個標籤,無法被區分開來。實例分割則更進一步,不僅標記像素的類別,還為每個獨立的物件個體生成一個獨立的遮罩 ID,即使兩個人站得很近、像素互相觸碰,系統仍能明確區分「這是第一個人的像素」和「這是第二個人的像素」。從輸出格式來說,語意分割輸出單一的類別圖;實例分割輸出一組(類別標籤、邊界框、二元遮罩)的三元組集合,每個物件個體各有一組。這個差異使得實例分割在需要計數或追蹤個體的場景(如細胞計數、人群分析)中不可或缺。

Mask R-CNN 是如何實現實例分割的?

Mask R-CNN 在 Faster R-CNN 的兩階段物件偵測架構上增加了第三個並行分支。Faster R-CNN 已經能夠輸出每個物件的類別標籤和邊界框;Mask R-CNN 在此基礎上,對每個 RoI(感興趣區域)額外執行一個全卷積網路(FCN),預測一個 28×28 的二元遮罩,指示哪些像素屬於該物件。為了讓遮罩分支的輸入特徵與空間位置精確對齊,Mask R-CNN 引入了 RoIAlign 操作(取代 Faster R-CNN 的 RoIPool),透過雙線性插值保留精確的空間對應關係,顯著提升了遮罩邊界的精準度。訓練時,遮罩損失、分類損失與邊界框迴歸損失三者同時最佳化,使整個網路能夠端對端地學習。

實例分割在 iPAS 考試中的常見考點有哪些?

iPAS AI 應用規劃師中級考試中,實例分割的考題主要圍繞以下幾個面向。第一是概念區辨:能清楚說明物件偵測、語意分割、實例分割、全景分割四種任務的差異與輸出形式,這是最常見的選擇題考點。第二是代表性模型辨識:Mask R-CNN 是必考架構,考生應了解其在 Faster R-CNN 基礎上新增遮罩分支的設計,以及 RoIAlign 的作用。第三是應用場景對應:題目會給出一個具體場景(如自動駕駛中的行人分析、醫療影像中的細胞計數),要求考生選出最適合的視覺任務類型。考生若能同時掌握評估指標(COCO mAP、遮罩 IoU)與主要挑戰(密集物件、即時推論需求),則能應對更進階的分析題型。