影像修補(Image Inpainting)是什麼?

利用周邊像素信息自動填充或重建影像中的遺失、損壞或標記區域,用於去除物體、修復老照片等。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Image Inpainting
主題標籤
電腦視覺、影像生成、影像修復
考點定位
非 iPAS 核心術語
最後更新
2026/06/23
影像修補(Image Inpainting)是什麼? 電腦視覺影像生成
術語快查

搜尋意圖: 如果你在找「影像修補 是什麼」或「影像修補 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 利用周邊像素信息自動填充或重建影像中的遺失、損壞或標記區域,用於去除物體、修復老照片等。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

利用周邊像素信息自動填充或重建影像中的遺失、損壞或標記區域,用於去除物體、修復老照片等。

影像修補(Image Inpainting)是藝術與科技結合的任務,旨在從不完整的影像數據重建出視覺上合理且美觀的完整影像。修補不僅要填充像素值,還要維持紋理與語義的一致性。

傳統影像修補方法

  1. 擴散與偏微分方程(PDE-based)

    • Laplace 方程與調和函數:假設修補區域內像素值光滑變化。
    • 曲率驅動擴散(Curvature-Driven Diffusion):保留邊界信息的同時平滑填充。
    • 優點:理論簡潔,效率高。
    • 缺點:無法恢復複雜紋理。
  2. 紋理合成(Texture Synthesis)

    • 非參數採樣:在已知區域內尋找與邊界相似的紋理塊,複製到修補區域。
    • 優點:能保留真實紋理。
    • 缺點:手工調參複雜,語義物體(如臉)效果差。
  3. 組合方法

    • 先用 PDE 估計結構(邊界),再用紋理合成填充細節。
    • Criminisi 等人的算法結合了優先級、結構傳播與紋理匹配。

深度學習修補方法

  1. 卷積自編碼器(2016-2017)

    • 編碼器壓縮影像,解碼器生成修補區域。
    • Context Encoder:輸入帶 mask 的影像,輸出修補結果。
    • 優點:端到端可訓練,能學習高層語義。
    • 缺點:早期模型往往生成模糊結果。
  2. 對抗網路(GAN-based,2016-2020)

    • 生成器 G 生成修補內容,判別器 D 區分真偽。
    • Partial Convolution(PConv):只在已知區域進行卷積,避免修補區域的預設值影響。
    • Gated Convolution:動態學習是否使用像素,改善邊界處理。
    • 損失函數組合:L1/L2 損失(像素級)+ 對抗損失(語義級)+ 感知損失(高層特徵)+ 風格損失(紋理)。
    • 優點:生成結果視覺上逼真,紋理豐富。
  3. 擴散模型(Diffusion Models,2022 年後)

    • 逆向過程生成修補區域,條件為已知區域。
    • 優點:生成多樣性高,質量穩定,無需對抗訓練。
    • 缺點:推論速度較慢(多步迭代)。
  4. 混合方法

    • 結合傳統結構傳播與深度學習生成。
    • 使用邊界感知損失、流協一致性等約束。

評估指標

  • 知覺相似度:LPIPS(LearnedPerceptual Image Patch Similarity)衡量高層特徵相似性,比 SSIM 更符合人類感知。
  • 結構相似度(SSIM):考慮亮度、對比度、結構的加權指標。
  • 峰值信噪比(PSNR):像素級誤差度量,易受噪聲影響。
  • 人眼評估:AMT(Amazon Mechanical Turk)或專家評分,衡量視覺自然度與連貫性。
  • FID(Fréchet Inception Distance):衡量生成影像與真實影像在特徵空間的分佈相似性,適合評估多樣性與質量。

應用場景

  • 物體移除:去除照片中不需要的行人、建築物等,實現「魔法橡皮擦」。
  • 老照片修復:填補缺失或褪色區域,恢復歷史照片。
  • 水印與文字移除:在視頻或照片中自動移除品牌水印。
  • 疤痕與瑕疵修複:美容修圖應用中的皮膚修復。
  • 超解析度的前置步驟:先修補缺失的高頻信息。
  • 視頻中的物體跟蹤:移除運動目標後的背景恢復。
  • 虛擬場景生成:為新增內容(如虛擬物體 AR)填充背景。

主要挑戰

  1. 大區域修補:修補面積越大,缺乏邊界約束,越容易產生語義不一致的內容。
  2. 複雜結構邊界:邊界不規則(非矩形 mask)時,邊界對齐困難。
  3. 語義連貫性:修補內容應與周邊物體邏輯一致,純基於紋理的方法容易失敗。
  4. 多模態輸出:同一修補區域可能有多種合理的填充方式,模型通常傾向生成平均值(模糊結果)。
  5. 邊界偽影:修補邊界與已知區域的交界處常出現不連貫的痕跡。

與相關任務的區別

  • 影像修補 vs. 影像補全:前者強調視覺質量與自然度,後者可能傾向數值準確性。
  • 影像修補 vs. 超解析度:後者增加分辨率,前者填充內容。
  • 影像修補 vs. 風格遷移:前者改變內容,後者改變風格。

實務應用建議

在生產系統中部署影像修補時,應根據應用對即時性與品質的要求選擇模型:

  1. 實時應用(如相機即時濾鏡):使用輕量化 GAN 或高效擴散模型。
  2. 高品質應用(如專業修圖軟體):使用大規模預訓練模型如 LaMa、MAT。
  3. 語義修補(如物體移除):優先考慮語義感知模型,結合邊界偵測提供更精確的 mask。
  4. 邊界處理:採用漸進式修補或邊界混合技術減少邊界偽影。
  5. 使用者交互:允許使用者迭代修改 mask 或提供提示(text-guided inpainting),改善結果。

近期,擴散模型與 LLM 結合的多模態修補(如 DALL-E、Stable Diffusion inpainting)正成為趨勢,允許自然語言描述修補內容,進一步提升靈活性與質量。

常見問題

影像修補中 mask 的定義是什麼?

mask(掩碼)是與原影像尺寸相同的二值圖像,其中 0(或黑色)表示需要修補的區域,1(或白色)表示保留的已知區域。某些實現使用反向定義。修補任務就是根據已知區域(mask=1)的像素,推斷修補區域(mask=0)的內容。mask 可以是規則形狀(矩形、圓形),也可以是自由繪製的不規則形狀,自由繪製的 mask 通常需要更高級的演算法才能處理好。

為什麼修補大區域時結果常常模糊或不合理?

原因有二:首先,大區域缺乏充分的邊界約束,模型難以推斷應填充的內容,傾向於生成平均值導致模糊;其次,純基於周邊像素的修補忽視了語義信息,可能生成邏輯不一致的內容(如天空中出現建築)。改善方法包括:使用預訓練的高層語義模型、增加感知損失與風格損失的權重、或採用迭代修補(先修補邊界,再逐步擴展)。對於大區域,採用帶文本提示的條件生成(text-guided inpainting)效果更佳。

影像修補可以用於視頻嗎?

可以,稱為視頻修補(Video Inpainting)或視頻補全。挑戰是維持時間一致性:不同幀的修補結果應該形成連貫的運動,而非閃爍。方法包括:(1)逐幀修補再用光流進行時間一致性檢驗;(2)直接使用 3D 卷積或循環神經網路(RNN)同時處理多幀,強制時間平滑;(3)流引導修補,利用光流信息傳播修補結果。視頻修補的計算成本遠高於靜態影像,實時應用仍有挑戰。