卷積神經網路 是什麼?
Convolutional Neural Network:卷積神經網路 的完整解釋
專門處理圖像的神經網路,用小窗口(卷積核)掃過圖片提取局部特徵,參數共享大幅減少計算量
容易混淆
卷積神經網路 vs 全連接神經網路 vs 電腦視覺
卷積神經網路:處理影像的模型架構
全連接神經網路:每個神經元都和前一層大量連接,參數很多
電腦視覺:更大的領域,CNN 是其中常見工具
最關鍵的區別:CNN 是方法,電腦視覺是應用領域。
記住這句就好
先抓局部特徵,再拼出整張圖的意思。
實際案例
貓狗分類
前:把整張圖硬塞進普通神經網路,參數爆炸還不穩
後:用卷積層抓耳朵、眼睛、毛流,再做分類
工廠瑕疵檢測
前:每個像素都一樣看,效率差又難抓局部異常
後:CNN 先找刮痕、孔洞和邊界異常,再輸出是否不良
算法與應用
CNN 的核心是卷積、池化、非線性激活和特徵圖,透過層層堆疊形成更高階表示
它廣泛用在影像分類、物件偵測、影像分割,後來也被延伸到語音和序列任務
現在深度學習很強,但 CNN 仍是許多視覺模型的基本積木
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 卷積神經網路 | 台灣正式用語 |
| 卷积神经网络 | 簡體寫法 |
| Convolutional Neural Network | 英文原名 |
| CNN | 標準縮寫,注意這個縮寫也是美國有線電視新聞網的名稱 |
| ConvNet | 論文與程式碼裡常見的簡稱 |
三個核心組成
卷積層(convolution):用一個小的濾波器在影像上滑動做內積,抓出邊緣、紋理這類局部特徵。同一個濾波器在整張圖共用同一組權重,這叫權重共享,是 CNN 參數量遠小於全連接網路的原因。
池化層(pooling):把區域內的值取最大或平均,降低解析度、擴大感受野、並提供一點位移容忍度。
全連接層:最後把特徵攤平接分類頭。近年很多架構改用全域平均池化取代它,參數更少也更不容易過度擬合。
疊起來之後會出現一個層級結構:淺層學邊緣與顏色,中層學紋理與零件,深層學物件層級的概念。 這個由簡到繁的結構不是人設計的,是訓練自己長出來的。
兩個內建假設
CNN 的效果來自兩個寫進架構裡的假設:
局部性:有意義的圖案是局部的,判斷一個像素屬於什麼,主要看它附近的像素。
平移不變性:一隻貓移到畫面另一邊還是一隻貓,所以同一組濾波器在整張圖都適用。
這兩個假設叫做歸納偏置(inductive bias)。它們讓 CNN 在資料量不大的時候就能學得好,因為模型不需要從零學會這些常識。相對地,視覺 Transformer 幾乎沒有這些假設,資料少時容易過擬合,資料極多時反而因為不受假設限制而能學到更多。
幾個關鍵演進
| 架構 | 貢獻 |
|---|---|
| LeNet | 最早的實用 CNN,用於手寫數字辨識 |
| AlexNet | 2012 年 ImageNet 大幅領先,帶起深度學習浪潮 |
| VGG | 證明用小卷積核疊深比用大卷積核有效 |
| ResNet | 殘差連接解決深層網路難訓練的問題,讓網路能疊到上百層 |
| EfficientNet | 系統性地平衡深度、寬度、解析度三個維度 |
殘差連接是其中影響最深遠的一個。 它讓梯度可以跳過中間層直接往回傳,解決了「網路疊得越深反而越差」的退化問題。這個設計後來被 Transformer 沿用,現在幾乎所有深層架構都有它。
情境判斷
Q1(直覺題): 你想做圖片分類,CNN 通常是合理選擇嗎?
→ 是,因為它天生適合抓圖像的局部與空間關係。
Q2(判斷題): 只要是神經網路,就一定是 CNN 嗎?
→ 不是。CNN 只是神經網路的一種架構,還有 RNN、Transformer 等其他類型。
卷積神經網路 在 iPAS 考試中的重點
根據歷年統計,卷積神經網路 相關題目 平均佔 AI 技術類考題 3%, 屬於未分類考範圍。
常見出題方向:類神經網路架構(40%)、電腦視覺演算法(35%)、深度學習原理與應用(25%)。
相關術語
常見問題
卷積是不是只用在圖片?
不是,也能用在音訊、文字和其他結構化資料上。
池化一定要用嗎?
不一定,但它常用來縮小特徵圖和提升平移穩定性。
CNN 還重要嗎?
很重要,尤其在很多視覺前處理和嵌入式場景中仍然常見。
資料來源
- iPAS AI 應用規劃師評鑑內容範圍參考(115.02) ,經濟部產業人才能力鑑定