深度估計(Depth Estimation)是什麼?

從2D影像推斷場景的3D深度資訊,用於3D重建、機器人導航、AR應用和自動駕駛。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Depth Estimation
主題標籤
電腦視覺、深度學習、神經網路
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
深度估計(Depth Estimation)是什麼? 電腦視覺深度學習
術語快查

搜尋意圖: 如果你在找「深度估計 是什麼」或「深度估計 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 從2D影像推斷場景的3D深度資訊,用於3D重建、機器人導航、AR應用和自動駕駛。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

從2D影像推斷場景的3D深度資訊,用於3D重建、機器人導航、AR應用和自動駕駛。

核心概念

深度估計面臨一個基本挑戰:深度資訊在2D投影時丟失。透視投影將3D點 (X, Y, Z) 映射為2D像素 (x, y) = (fX/Z, fY/Z),其中Z是深度。單張2D影像無法唯一復原Z。傳統解決方案是立體視覺(Stereo Vision),利用雙眼視差復原深度;現代方案是單眼深度估計,通過學習幾何和語義線索推斷深度。

深度估計輸出是深度圖(Depth Map),其值為每像素到相機的距離。深度圖分辨率與輸入影像相同,是密集的3D復原結果。深度圖可轉換為點雲(Point Cloud)或網格(Mesh),支撐後續的3D處理。

深度估計分為多視深度估計(利用多幀約束)和單眼深度估計(利用單幀)。多視方法精度高但需要控制相機運動;單眼方法實用性強,現已成為主流。

運作原理

  • 立體視覺方法基於視差原理。左右相機看同一物體,物體在兩幀影像中的水平位置不同(視差)。視差與深度成反比:Z = (f * baseline) / disparity,其中f是焦距,baseline是雙眼距離。立體匹配演算法搜尋左影像中的像素在右影像中的對應位置,計算視差。傳統方法如SSD(Sum of Squared Differences)進行局部相似度計算;現代方法如GCNet用深度學習進行代價體(Cost Volume)優化。

  • 單眼深度估計採用監督或自監督學習。監督方法用CNN編碼器-解碼器架構,編碼器提取特徵,解碼器逐步上採樣生成深度圖。Depth Completion方法結合稀疏LiDAR和影像,補全缺失的深度點。

自監督單眼深度估計利用多幀影像的運動線索,無需深度標籤。相鄰幀間的視差關係給出自監督信號:如果深度估計正確,用估計深度和光流可從一幀重建相鄰幀。重建誤差即為損失函數。Monodepth系列就基於此原理,在無人工標籤的視頻上訓練。

Transformer架構如DPT(Dense Prediction Transformer)進一步提升精度。Transformer的全局視野幫助模型理解整體場景結構,不僅依賴局部紋理。

實際應用

  • 3D重建是深度估計的經典應用。從影像序列估計深度圖,多幀深度圖融合成統一的3D模型或點雲。SLAM和SfM(Structure from Motion)都依賴深度或視差。

  • 自動駕駛需實時深度估計障礙物距離。雷達提供稀疏深度測量,深度估計從攝像機填補缺失區域,提供稠密的環境理解,支撐碰撞檢測和路徑規劃。

  • 機器人視覺導航利用深度圖進行障礙物檢測和避障。機械臂需估計物體深度以定位抓取點;移動機器人需深度圖進行室內導航。

  • 增強實境依賴深度估計實現虛實融合。AR濾鏡需估計用戶臉部深度,才能準確疊加虛擬眼鏡、鬍子等,與真實面部對齊。

  • 醫療成像中,深度估計支撐內窺鏡導航。醫生觀察內窺鏡影像時,深度估計幫助理解內部器官的3D位置。

常見誤區

誤區一:單眼深度估計無法達到立體視覺精度。實際上,現代監督型單眼方法(用深度標籤訓練)在室內場景精度已接近立體視覺,自監督方法在動態場景也表現不俗。

誤區二:深度圖的邊界處總是不準。深度邊界確實困難(物體遮擋導致),但多層重加權的邊界處理能改善。應用中這類細節誤差往往可容忍。

誤區三:高深度估計精度自動提升下游任務。實際上,深度是中間表達,下游任務(如檢測)還受其他設計影響。深度精度改進幅度超過一定閾值後,收益遞減。

與相關技術的比較

  • 深度估計 vs 立體視覺:立體視覺通過視差復原深度,需雙攝或已知相機位姿;深度估計从單影像學習,實用但精度依賴訓練資料。

  • 深度估計 vs LiDAR:LiDAR主動測距,精度高計算快,但成本高且受光照影響小。深度估計被動依賴影像,成本低泛化強。兩者常互補使用。

  • 深度估計 vs 光流:光流估計像素運動,深度從運動反向推導3D結構。光流更基礎,深度估計利用光流等多種線索。

常見問題

為什麼單眼深度估計可能比立體視覺更精確?

傳統立體視覺受限於視差搜尋的離散性和歧義性。視差通常限制在有限範圍(如0-64像素),分辨率受此限制。紋理貧瘠區域難以匹配。現代單眼深度估計用深度學習直接迴歸連續深度值,無離散量化。訓練資料豐富時,模型學到豐富的幾何和語義線索:物體大小、位置、遮擋關係、透視變形等,綜合推斷深度。在紋理貧瘠區域也能從高層語義推斷(如已知汽車大小,可估計距離)。當訓練資料質量高、分佈廣時,單眼方法精度可超立體視覺。但單眼方法泛化到訓練域外時性能下降,而立體視覺原理簡單泛化強。

自監督單眼深度估計為什麼有效?

自監督方法利用視頻序列提供的自然監督信號。核心思想是一致性檢查:如果深度估計和光流都正確,用前幀和估計深度以及光流,應能重建當前幀。重建誤差(photometric loss)作為損失函數,無需人工標籤。這在視覺上合理:移動相機或場景中,不同部分應有一致的運動模式。自監督避免了昂貴的深度標註,能在任意視頻上訓練。缺點是遮擋和邊界處理困難,需加掩模分支。該方法已成功應用於無人車和無人機。

深度估計在自動駕駛中如何與其他感測器融合?

自動駕駛系統多感測器融合。攝像機通過深度估計或立體視覺提供稠密環境理解,優勢是成本低精度高、能捕捉紋理細節。雷達提供稀疏但精確的距離測量和速度估計,優勢是全天候(不怕光照)、抗遮擋。深度圖和雷達點雲可在多個層級融合。早期融合將兩者在特徵層結合,後期融合在決策層合併。特徵級融合需設計統一表達,點雲通常轉為深度圖或柱狀表達。多感測器融合提升了感知冗餘性和可靠性,是安全自動駕駛的基石。