卷積神經網路 是什麼?

Convolutional Neural Network:卷積神經網路 的完整解釋

專門處理圖像的神經網路,用小窗口(卷積核)掃過圖片提取局部特徵,參數共享大幅減少計算量

容易混淆

卷積神經網路 vs 全連接神經網路 vs 電腦視覺

卷積神經網路:處理影像的模型架構

全連接神經網路:每個神經元都和前一層大量連接,參數很多

電腦視覺:更大的領域,CNN 是其中常見工具

最關鍵的區別:CNN 是方法,電腦視覺是應用領域。

記住這句就好

先抓局部特徵,再拼出整張圖的意思。

實際案例

貓狗分類

前:把整張圖硬塞進普通神經網路,參數爆炸還不穩

後:用卷積層抓耳朵、眼睛、毛流,再做分類

工廠瑕疵檢測

前:每個像素都一樣看,效率差又難抓局部異常

後:CNN 先找刮痕、孔洞和邊界異常,再輸出是否不良

算法與應用

CNN 的核心是卷積、池化、非線性激活和特徵圖,透過層層堆疊形成更高階表示

它廣泛用在影像分類、物件偵測、影像分割,後來也被延伸到語音和序列任務

現在深度學習很強,但 CNN 仍是許多視覺模型的基本積木

中英對照與常見說法

說法 出現場合
卷積神經網路 台灣正式用語
卷积神经网络 簡體寫法
Convolutional Neural Network 英文原名
CNN 標準縮寫,注意這個縮寫也是美國有線電視新聞網的名稱
ConvNet 論文與程式碼裡常見的簡稱

三個核心組成

卷積層(convolution):用一個小的濾波器在影像上滑動做內積,抓出邊緣、紋理這類局部特徵。同一個濾波器在整張圖共用同一組權重,這叫權重共享,是 CNN 參數量遠小於全連接網路的原因。

池化層(pooling):把區域內的值取最大或平均,降低解析度、擴大感受野、並提供一點位移容忍度。

全連接層:最後把特徵攤平接分類頭。近年很多架構改用全域平均池化取代它,參數更少也更不容易過度擬合。

疊起來之後會出現一個層級結構:淺層學邊緣與顏色,中層學紋理與零件,深層學物件層級的概念。 這個由簡到繁的結構不是人設計的,是訓練自己長出來的。

兩個內建假設

CNN 的效果來自兩個寫進架構裡的假設:

局部性:有意義的圖案是局部的,判斷一個像素屬於什麼,主要看它附近的像素。

平移不變性:一隻貓移到畫面另一邊還是一隻貓,所以同一組濾波器在整張圖都適用。

這兩個假設叫做歸納偏置(inductive bias)。它們讓 CNN 在資料量不大的時候就能學得好,因為模型不需要從零學會這些常識。相對地,視覺 Transformer 幾乎沒有這些假設,資料少時容易過擬合,資料極多時反而因為不受假設限制而能學到更多。

幾個關鍵演進

架構 貢獻
LeNet 最早的實用 CNN,用於手寫數字辨識
AlexNet 2012 年 ImageNet 大幅領先,帶起深度學習浪潮
VGG 證明用小卷積核疊深比用大卷積核有效
ResNet 殘差連接解決深層網路難訓練的問題,讓網路能疊到上百層
EfficientNet 系統性地平衡深度、寬度、解析度三個維度

殘差連接是其中影響最深遠的一個。 它讓梯度可以跳過中間層直接往回傳,解決了「網路疊得越深反而越差」的退化問題。這個設計後來被 Transformer 沿用,現在幾乎所有深層架構都有它。

情境判斷

Q1(直覺題): 你想做圖片分類,CNN 通常是合理選擇嗎?

→ 是,因為它天生適合抓圖像的局部與空間關係。

Q2(判斷題): 只要是神經網路,就一定是 CNN 嗎?

→ 不是。CNN 只是神經網路的一種架構,還有 RNN、Transformer 等其他類型。

卷積神經網路 在 iPAS 考試中的重點

根據歷年統計,卷積神經網路 相關題目 平均佔 AI 技術類考題 3%, 屬於未分類考範圍。

常見出題方向:類神經網路架構(40%)、電腦視覺演算法(35%)、深度學習原理與應用(25%)。

相關術語

常見問題

卷積是不是只用在圖片?

不是,也能用在音訊、文字和其他結構化資料上。

池化一定要用嗎?

不一定,但它常用來縮小特徵圖和提升平移穩定性。

CNN 還重要嗎?

很重要,尤其在很多視覺前處理和嵌入式場景中仍然常見。

資料來源

← 回到 卷積神經網路 快查頁

測驗你對 卷積神經網路 的理解

透過模擬考系統檢驗學習成果

開始測驗