目標定位(Grounding)是什麼?

在圖像中定位自然語言描述的物體,通過將文本表達與圖像中的視覺區域進行對應,實現視覺語言理解。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Grounding
主題標籤
電腦視覺、多模態AI、神經網路
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
目標定位(Grounding)是什麼? 電腦視覺多模態AI
術語快查

搜尋意圖: 如果你在找「目標定位 是什麼」或「目標定位 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 在圖像中定位自然語言描述的物體,通過將文本表達與圖像中的視覺區域進行對應,實現視覺語言理解。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

在圖像中定位自然語言描述的物體,通過將文本表達與圖像中的視覺區域進行對應,實現視覺語言理解。

核心概念

目標定位的核心是建立文本描述和圖像中物體位置的對應關係。不同於物體檢測(檢測預定義類別的物體)或分割(分割指定類別的物體),目標定位處理任意自然語言描述,提供更靈活的視覺查詢方式。

目標定位涉及幾個關鍵要素:首先,文本編碼器必須理解自然語言的細微含義(如「最大的紅色球」與「紅色的球」的區別)。其次,視覺編碼器必須提取空間信息豐富的特徵,保留物體的邊界和位置線索。最後,跨模態融合機制必須將文本語義和視覺特徵關聯起來,使模型能「看到」描述所指的物體。

目標定位與視覺問答(VQA)的區別在於:VQA輸出答案文本(如「球的顏色」→「紅色」),而目標定位輸出空間坐標。目標定位與圖像分類的區別在於:分類輸出類別標籤,定位輸出精確邊界框。

運作原理

目標定位的典型運作流程如下:

首先是特徵提取。圖像被輸入到視覺骨幹網絡(如Swin Transformer或ViT),生成多尺度特徵金字塔(FPN)。特徵保留了豐富的空間信息,維度通常為H'×W'×C(高度×寬度×通道)。文本描述被輸入到預訓練語言模型(如BERT或RoBERTa),生成詞級別的嵌入向量和句級別的全局特徵。

接著是跨模態融合。文本特徵和視覺特徵在共同的嵌入空間中進行融合。一種常見的方法是利用跨模態注意力:文本的全局特徵作為查詢,視覺特徵圖中的每個位置都可被關注。計算注意力權重後,得到融合後的視覺特徵,這些特徵已被文本語義加權。

然後進行邊界框回歸。使用融合後的特徵,通過幾個卷積層或Transformer層進行特徵變換,最後通過一個回歸頭預測邊界框的座標(如左上角和右下角的(x,y)座標,或中心座標和寬高)。

另一種方法是分割為中間步驟:先進行物體分割或關鍵點偵測,然後從分割遮罩或關鍵點擬合邊界框。這通常更精確,但計算量更大。

損失函數通常包含邊界框迴歸損失(如L1損失、GIoU損失)和分類置信度損失(判斷是否有物體在該位置)。

訓練資料包含圖像、自然語言描述和對應的邊界框標籤。代表性資料集包括ReferIt、RefCOCO等。

推理時,輸入圖像和自然語言查詢,模型輸出邊界框或分割遮罩。

現代目標定位模型(如GLiP、OWL-ViT)還結合了開放詞彙檢測的思想,支持檢測任意類別描述的物體。這些模型通過大規模弱監督資料(如圖文對)進行預訓練,學習更廣泛的視覺語言對應。

實際應用

目標定位在多個領域有重要應用。

在互動式圖像編輯中,用戶用自然語言描述要編輯的物體(「左上角的人臉」、「紅色的車」),目標定位定位該物體,然後編輯工具對該區域進行修改。這比傳統的手工選取更直觀高效。

在視覺對話中,用戶與AI進行多輪對話,涉及對圖像中物體的引用。目標定位使AI能理解用戶的指代,準確回答關於特定物體的問題。

在細粒度檢索中,用戶可以用詳細描述搜索圖像(「綠色衣服的女性」),目標定位幫助系統不僅檢索相關圖像,還定位該物體的位置。

在輔助技術中,目標定位幫助視障人士理解複雜圖像。用戶用語言描述物體位置(「告訴我右下角有什麼」),系統定位並識別。

在遠程協作中,一人可用自然語言指導遠程攝像頭的操作者(「放大左上角的文件」),目標定位指導操作。

在數據標註中,目標定位可用於自動為大量圖像標註物體邊界框,加速標註流程。

常見誤區

誤區一:目標定位只是物體檢測加文本匹配。實際上,目標定位需要深層的文本理解和視覺語言對齐。簡單的關鍵詞匹配無法處理複雜描述(「不是紅色的球」、「最大的球」)。

誤區二:任何視覺編碼器和文本編碼器組合都能實現目標定位。實際上,編碼器必須設計為保留空間信息(視覺)和精細語義(文本)。簡單的分類編碼器無法提供空間細節。

誤區三:目標定位準確度與物體檢測相同。實際上,目標定位通常更困難,因為描述的多樣性和模糊性大於固定類別。即使對人類來說,「棕色的東西」可能指狗或木頭。

誤區四:大規模模型總是更好。實際上,在目標定位上,好的特徵設計和訓練策略往往比模型大小更重要。一些較小但設計精良的模型可能優於巨大但通用的模型。

與相關技術的比較

  • 目標定位 vs 物體檢測:檢測識別預定義類別的物體,定位識別自然語言描述的物體。定位更靈活,檢測更精確。兩者可結合,先檢測粗略位置,再用定位精煉。

  • 目標定位 vs 分割:都需要精確的空間定位。定位通常輸出邊界框,分割輸出像素級遮罵。定位更快,分割更精確。

  • 目標定位 vs VQA:VQA輸出文本答案,定位輸出空間座標。VQA可能涉及推理,定位專注定位。

  • 目標定位 vs 視覺檢索:檢索找到相似圖像,定位在給定圖像中找到物體。定位是影像內任務,檢索是影像間任務。

  • 目標定位 vs 開放詞彙檢測:開放詞彙檢測泛化到任意類別標籤,定位泛化到任意自然語言描述。兩者目標相似但實現不同。

常見問題

如何使目標定位理解複雜的自然語言描述,如「不是紅色的最大球」?

複雜描述的理解涉及幾個層面。首先,文本編碼器(如BERT)必須理解語言結構,包括否定、比較級等。其次,視覺編碼器必須提供足夠的視覺細節,以區分不同顏色和大小的球。第三,跨模態融合機制必須將文本語義傳遞到視覺特徵中。例如,對於「不是紅色的」,模型應該低估圖像中紅色區域的注意力權重;對於「最大的」,應該增強大尺度視覺特徵。這通常通過大規模訓資料和精心設計的目標函數實現。現代模型(如GLiP)使用自然語言監督和弱標籤,在大規模圖文對資料集上訓練,學習複雜的語言-視覺對應。在訓練中,模型看到多樣的描述和邊界框配對,逐漸學習複雜語言的視覺含義。

目標定位模型如何在訓練資料不足時泛化到未見過的物體類別?

這涉及遷移學習和開放詞彙學習。一個策略是在大規模圖文對資料集(如4億對的LAION)上進行預訓練,學習視覺語言對齐。預訓練後,模型在有邊界框標籤的較小資料集(如RefCOCO)上微調。預訓練的視覺語言對齐使得模型能夠理解任意類別的文本描述,即使訓練資料中沒有見過該類別。例如,模型可能沒在狐狸上訓練,但因為理解了動物的視覺特徵和「狐狸」的語義,仍能定位狐狸。另一個策略是使用大型語言模型進行提示工程,利用LLM的知識進行零樣本定位。現代方法如OWL-ViT就是這樣結合ViT和文本編碼器的開放詞彙檢測框架。

為什麼目標定位需要多尺度特徵而不是單一尺度特徵?

物體在圖像中的大小變化很大,從小的蒼蠅到大的建築物。單一尺度的特徵圖無法同時有效表示各種大小的物體。小物體需要高分辨率特徵(保留細節),大物體可以用低分辨率特徵(提供上下文)。多尺度特徵金字塔(FPN)提供不同分辨率的特徵,使定位模型能在合適的尺度上定位各種大小的物體。此外,多尺度特徵提供了更豐富的上下文,幫助模型更好地理解物體與周圍環境的關係。例如,定位「桌子上的蘋果」時,高分辨率特徵捕捉蘋果的細節,低分辨率特徵提供桌子和空間上下文。因此,高效的多尺度特徵提取和融合是現代目標定位模型的標準設計。