卷積神經網路(Convolutional Neural Network)是什麼?

專門處理圖像的神經網路,用小窗口(卷積核)掃過圖片提取局部特徵,參數共享大幅減少計算量|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Convolutional Neural Network
主題標籤
深度學習、電腦視覺、神經網路
考點定位
中級
最後更新
2026/07/30
卷積神經網路(Convolutional Neural Network)是什麼? iPAS 深度學習電腦視覺
術語快查

搜尋意圖: 如果你在找「卷積神經網路 是什麼」、「卷積神經網路 會怎麼考」或「卷積神經網路 和相近概念差在哪」,先看這頁的定義、考點定位與延伸比較。

TL;DR: 專門處理圖像的神經網路,用小窗口(卷積核)掃過圖片提取局部特徵,參數共享大幅減少計算量

實用情境: 適合用在 iPAS 複習、面試快查與閱讀 AI 文章時快速校正概念邊界。

下一步: 先讀完定義,再往下看範例考題與延伸比較,把概念轉成可作答的判斷。

你有沒有想過,電腦怎麼從一張照片裡找出邊緣、眼睛或車輪?

你可以把卷積神經網路想成「先看局部,再慢慢拼成整體」:它用小視窗掃過圖片,抓邊緣、紋理和形狀。

它很重要,因為影像資料又大又複雜,CNN 透過局部感受野和參數共享,把圖像任務做得更有效率。

容易混淆

卷積神經網路 vs 全連接神經網路 vs 電腦視覺

卷積神經網路:處理影像的模型架構

全連接神經網路:每個神經元都和前一層大量連接,參數很多

電腦視覺:更大的領域,CNN 是其中常見工具

最關鍵的區別:CNN 是方法,電腦視覺是應用領域。

記住這句就好

先抓局部特徵,再拼出整張圖的意思。

實際案例

貓狗分類

前:把整張圖硬塞進普通神經網路,參數爆炸還不穩

後:用卷積層抓耳朵、眼睛、毛流,再做分類

工廠瑕疵檢測

前:每個像素都一樣看,效率差又難抓局部異常

後:CNN 先找刮痕、孔洞和邊界異常,再輸出是否不良

算法與應用

CNN 的核心是卷積、池化、非線性激活和特徵圖,透過層層堆疊形成更高階表示

它廣泛用在影像分類、物件偵測、影像分割,後來也被延伸到語音和序列任務

現在深度學習很強,但 CNN 仍是許多視覺模型的基本積木

中英對照與常見說法

說法 出現場合
卷積神經網路 台灣正式用語
卷积神经网络 簡體寫法
Convolutional Neural Network 英文原名
CNN 標準縮寫,注意這個縮寫也是美國有線電視新聞網的名稱
ConvNet 論文與程式碼裡常見的簡稱

三個核心組成

卷積層(convolution):用一個小的濾波器在影像上滑動做內積,抓出邊緣、紋理這類局部特徵。同一個濾波器在整張圖共用同一組權重,這叫權重共享,是 CNN 參數量遠小於全連接網路的原因。

池化層(pooling):把區域內的值取最大或平均,降低解析度、擴大感受野、並提供一點位移容忍度。

全連接層:最後把特徵攤平接分類頭。近年很多架構改用全域平均池化取代它,參數更少也更不容易過度擬合。

疊起來之後會出現一個層級結構:淺層學邊緣與顏色,中層學紋理與零件,深層學物件層級的概念。 這個由簡到繁的結構不是人設計的,是訓練自己長出來的。

兩個內建假設

CNN 的效果來自兩個寫進架構裡的假設:

局部性:有意義的圖案是局部的,判斷一個像素屬於什麼,主要看它附近的像素。

平移不變性:一隻貓移到畫面另一邊還是一隻貓,所以同一組濾波器在整張圖都適用。

這兩個假設叫做歸納偏置(inductive bias)。它們讓 CNN 在資料量不大的時候就能學得好,因為模型不需要從零學會這些常識。相對地,視覺 Transformer 幾乎沒有這些假設,資料少時容易過擬合,資料極多時反而因為不受假設限制而能學到更多。

幾個關鍵演進

架構 貢獻
LeNet 最早的實用 CNN,用於手寫數字辨識
AlexNet 2012 年 ImageNet 大幅領先,帶起深度學習浪潮
VGG 證明用小卷積核疊深比用大卷積核有效
ResNet 殘差連接解決深層網路難訓練的問題,讓網路能疊到上百層
EfficientNet 系統性地平衡深度、寬度、解析度三個維度

殘差連接是其中影響最深遠的一個。 它讓梯度可以跳過中間層直接往回傳,解決了「網路疊得越深反而越差」的退化問題。這個設計後來被 Transformer 沿用,現在幾乎所有深層架構都有它。

情境判斷

Q1(直覺題): 你想做圖片分類,CNN 通常是合理選擇嗎?

→ 是,因為它天生適合抓圖像的局部與空間關係。

Q2(判斷題): 只要是神經網路,就一定是 CNN 嗎?

→ 不是。CNN 只是神經網路的一種架構,還有 RNN、Transformer 等其他類型。

iPAS 考題

Q:CNN 在 iPAS 常怎麼考?

→ 通常會考卷積核、特徵提取、參數共享、池化與影像分類應用。

Q:為什麼這題常考?

→ 因為它是電腦視覺的核心模型,也最能看出你有沒有理解局部特徵與參數效率。

常見問題

卷積是不是只用在圖片?

不是,也能用在音訊、文字和其他結構化資料上。

池化一定要用嗎?

不一定,但它常用來縮小特徵圖和提升平移穩定性。

CNN 還重要嗎?

很重要,尤其在很多視覺前處理和嵌入式場景中仍然常見。

範例考題

某物流公司想導入 AI 以提升營運效率,評估不同資料型態與模型架構。下列哪一種應用情境最適合採用卷積神經網路(Convolutional Neural Network, CNN)作為主要模型架構?

  • A. 依據包裹每日掃描紀錄的時間序列,預測下週各倉庫的進貨量波動
  • B. 根據客服對話逐句內容的先後順序,判斷客訴是否可能升級為申訴案件
  • C. 根據倉庫監視器影像,自動辨識貨架是否缺貨並標示缺貨區域位置 ✓ 正確答案
  • D. 依據車隊 GPS 路徑點的連續軌跡,預測下一段可能行駛路線

解析:

CNN 的核心優勢是處理具有空間結構的資料,特別是影像。從倉庫監視器影像辨識貨架缺貨並標示位置,是典型的影像辨識/物件偵測任務,最適合使用 CNN。