解析:
CNN 的核心優勢是處理具有空間結構的資料,特別是影像。從倉庫監視器影像辨識貨架缺貨並標示位置,是典型的影像辨識/物件偵測任務,最適合使用 CNN。
專門處理圖像的神經網路,用小窗口(卷積核)掃過圖片提取局部特徵,參數共享大幅減少計算量|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。
搜尋意圖: 如果你在找「卷積神經網路 是什麼」、「卷積神經網路 會怎麼考」或「卷積神經網路 和相近概念差在哪」,先看這頁的定義、考點定位與延伸比較。
TL;DR: 專門處理圖像的神經網路,用小窗口(卷積核)掃過圖片提取局部特徵,參數共享大幅減少計算量
實用情境: 適合用在 iPAS 複習、面試快查與閱讀 AI 文章時快速校正概念邊界。
下一步: 先讀完定義,再往下看範例考題與延伸比較,把概念轉成可作答的判斷。
你有沒有想過,電腦怎麼從一張照片裡找出邊緣、眼睛或車輪?
你可以把卷積神經網路想成「先看局部,再慢慢拼成整體」:它用小視窗掃過圖片,抓邊緣、紋理和形狀。
它很重要,因為影像資料又大又複雜,CNN 透過局部感受野和參數共享,把圖像任務做得更有效率。
卷積神經網路 vs 全連接神經網路 vs 電腦視覺
卷積神經網路:處理影像的模型架構
全連接神經網路:每個神經元都和前一層大量連接,參數很多
電腦視覺:更大的領域,CNN 是其中常見工具
最關鍵的區別:CNN 是方法,電腦視覺是應用領域。
先抓局部特徵,再拼出整張圖的意思。
貓狗分類
前:把整張圖硬塞進普通神經網路,參數爆炸還不穩
後:用卷積層抓耳朵、眼睛、毛流,再做分類
工廠瑕疵檢測
前:每個像素都一樣看,效率差又難抓局部異常
後:CNN 先找刮痕、孔洞和邊界異常,再輸出是否不良
CNN 的核心是卷積、池化、非線性激活和特徵圖,透過層層堆疊形成更高階表示
它廣泛用在影像分類、物件偵測、影像分割,後來也被延伸到語音和序列任務
現在深度學習很強,但 CNN 仍是許多視覺模型的基本積木
| 說法 | 出現場合 |
|---|---|
| 卷積神經網路 | 台灣正式用語 |
| 卷积神经网络 | 簡體寫法 |
| Convolutional Neural Network | 英文原名 |
| CNN | 標準縮寫,注意這個縮寫也是美國有線電視新聞網的名稱 |
| ConvNet | 論文與程式碼裡常見的簡稱 |
卷積層(convolution):用一個小的濾波器在影像上滑動做內積,抓出邊緣、紋理這類局部特徵。同一個濾波器在整張圖共用同一組權重,這叫權重共享,是 CNN 參數量遠小於全連接網路的原因。
池化層(pooling):把區域內的值取最大或平均,降低解析度、擴大感受野、並提供一點位移容忍度。
全連接層:最後把特徵攤平接分類頭。近年很多架構改用全域平均池化取代它,參數更少也更不容易過度擬合。
疊起來之後會出現一個層級結構:淺層學邊緣與顏色,中層學紋理與零件,深層學物件層級的概念。 這個由簡到繁的結構不是人設計的,是訓練自己長出來的。
CNN 的效果來自兩個寫進架構裡的假設:
局部性:有意義的圖案是局部的,判斷一個像素屬於什麼,主要看它附近的像素。
平移不變性:一隻貓移到畫面另一邊還是一隻貓,所以同一組濾波器在整張圖都適用。
這兩個假設叫做歸納偏置(inductive bias)。它們讓 CNN 在資料量不大的時候就能學得好,因為模型不需要從零學會這些常識。相對地,視覺 Transformer 幾乎沒有這些假設,資料少時容易過擬合,資料極多時反而因為不受假設限制而能學到更多。
| 架構 | 貢獻 |
|---|---|
| LeNet | 最早的實用 CNN,用於手寫數字辨識 |
| AlexNet | 2012 年 ImageNet 大幅領先,帶起深度學習浪潮 |
| VGG | 證明用小卷積核疊深比用大卷積核有效 |
| ResNet | 殘差連接解決深層網路難訓練的問題,讓網路能疊到上百層 |
| EfficientNet | 系統性地平衡深度、寬度、解析度三個維度 |
殘差連接是其中影響最深遠的一個。 它讓梯度可以跳過中間層直接往回傳,解決了「網路疊得越深反而越差」的退化問題。這個設計後來被 Transformer 沿用,現在幾乎所有深層架構都有它。
Q1(直覺題): 你想做圖片分類,CNN 通常是合理選擇嗎?
→ 是,因為它天生適合抓圖像的局部與空間關係。
Q2(判斷題): 只要是神經網路,就一定是 CNN 嗎?
→ 不是。CNN 只是神經網路的一種架構,還有 RNN、Transformer 等其他類型。
Q:CNN 在 iPAS 常怎麼考?
→ 通常會考卷積核、特徵提取、參數共享、池化與影像分類應用。
Q:為什麼這題常考?
→ 因為它是電腦視覺的核心模型,也最能看出你有沒有理解局部特徵與參數效率。
不是,也能用在音訊、文字和其他結構化資料上。
不一定,但它常用來縮小特徵圖和提升平移穩定性。
很重要,尤其在很多視覺前處理和嵌入式場景中仍然常見。
某物流公司想導入 AI 以提升營運效率,評估不同資料型態與模型架構。下列哪一種應用情境最適合採用卷積神經網路(Convolutional Neural Network, CNN)作為主要模型架構?
解析:
CNN 的核心優勢是處理具有空間結構的資料,特別是影像。從倉庫監視器影像辨識貨架缺貨並標示位置,是典型的影像辨識/物件偵測任務,最適合使用 CNN。
想測試你對 卷積神經網路 的掌握程度? 開始模擬考