核函數(Kernel Function)是什麼?

在支援向量機等演算法中,將低維資料映射到高維特徵空間的函數,使原本線性不可分的問題變得可分。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Kernel Function
主題標籤
支援向量機、SVM、機器學習
考點定位
非 iPAS 核心術語
最後更新
2026/07/30
核函數(Kernel Function)是什麼? 支援向量機SVM
術語快查

搜尋意圖: 如果你在找「核函數 是什麼」或「核函數 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 在支援向量機等演算法中,將低維資料映射到高維特徵空間的函數,使原本線性不可分的問題變得可分。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

在支援向量機等演算法中,將低維資料映射到高維特徵空間的函數,使原本線性不可分的問題變得可分。

核函數的誕生源於一個基本問題:許多現實世界的分類或迴歸任務在原始特徵空間中無法用直線(或超平面)分開,但如果將資料映射到更高維度的空間,往往就能找到分割超平面。問題是,如果直接計算高維映射,計算成本會隨維度指數級增長,甚至在無限維空間中根本無法顯式計算。核技巧的精妙之處在於:許多演算法(尤其是 SVM)實際上只需要計算樣本之間的內積,而不需要知道每個樣本的具體座標。核函數 K(x, y) = φ(x)·φ(y) 直接計算映射後的內積,繞過了顯式計算高維座標的步驟。

最常用的核函數有四種類型。線性核(Linear Kernel)K(x, y) = x·y 其實就是原始內積,對應不做任何映射,適用於資料本身就線性可分的情況,計算成本最低。多項式核(Polynomial Kernel)K(x, y) = (γx·y + r)^d 能建模特徵之間的交互效應,d 是多項式次數,d=2 時能捕捉所有二次交互特徵(x1·x2、x1²、x2² 等)。徑向基函數核(RBF Kernel,又稱高斯核)K(x, y) = exp(-γ||x-y||²) 是最廣泛使用的核,對應無限維特徵空間的映射,γ 參數控制「影響範圍」,γ 大時每個訓練樣本只影響鄰近的預測,γ 小時影響範圍廣。Sigmoid 核 K(x, y) = tanh(γx·y + r) 與神經網路的激活函數形式相似,但在 SVM 中使用較少。

核函數需要滿足 Mercer 定理(Mercer's Theorem):核矩陣(Gram Matrix)必須是正定矩陣,才能保證對應到某個高維特徵空間的合法內積運算。這個數學條件確保核函數定義的「相似度」具有幾何上的一致性,也保證 SVM 的凸優化問題有唯一解。

在 SVM 的訓練過程中,核函數的選擇直接決定決策邊界的形狀。線性核產生線性決策邊界;RBF 核能產生任意形狀的非線性邊界,理論上能近似任何決策邊界(只要訓練樣本足夠且 γ 適當)。選擇核函數時,通常先嘗試線性核(特別是特徵維度高、樣本量大的 NLP 任務),再嘗試 RBF 核(大多數低維非線性任務的預設選擇),並用交叉驗證調整超參數(C 懲罰係數與 γ)。

在 AI 領域的現代應用中,核方法雖然在深度學習時代不再是主流,但在若干場景仍有重要地位。小樣本情況(訓練資料少於數千筆)下,SVM + RBF 核往往比深度神經網路更穩健,因為 SVM 的優化問題有全局最優解,不會陷入局部極小值。核方法在生物資訊學(蛋白質序列分類)、訊號處理、金融時間序列異常偵測等領域持續被使用。此外,核的思想也滲透到現代深度學習理論:Neural Tangent Kernel(NTK)研究發現,無限寬度神經網路的訓練動態等價於一種核迴歸,這條理論連接幫助研究者更深入理解深度學習的泛化機制。

iPAS 考試中核函數的考點集中在:識別各種核函數的數學形式與對應的特徵空間特性、RBF 核的超參數 γ 如何影響決策邊界的複雜度(γ 大 = 過擬合風險高、γ 小 = 欠擬合風險高)、核技巧的意義(避免顯式計算高維映射)、以及在給定情境(如資料分布呈同心圓形狀)中選擇最適合的核函數。

即使在深度學習主導的今天,核函數的概念依然在理解模型相似度計算、向量空間映射等核心問題上提供重要的理論框架,是 AI 從業者理解機器學習基礎原理不可跳過的知識模組。核方法的思想也啟發了現代 Transformer 注意力機制的設計,兩者在衡量元素間相似度的本質上有深刻的共通之處。 核函數(Kernel Function)是支援向量機(SVM)和高斯過程等算法的核心組件,透過「核技巧」(Kernel Trick)解決線性模型無法處理非線性資料的問題。

核技巧的精妙之處在於:它允許算法在高維特徵空間中計算內積,而無需顯式地計算每個樣本在高維空間中的座標。這意味著模型可以在理論上無限維的特徵空間中執行,而實際計算成本只取決於訓練樣本數量,而非特徵維度。

常見核函數各有適用場景。多項式核(Polynomial Kernel)適合處理圖像分類等特徵間存在乘法交互作用的問題;RBF 核(Radial Basis Function,又稱高斯核)是最廣泛使用的核函數,對連續光滑的決策邊界效果尤佳,只有一個超參數 γ 控制決策邊界的複雜度;Sigmoid 核在行為上類似神經網路的啟動函數,但在 SVM 中較少使用。

在核方法的理論框架(Mercer 定理)下,有效的核函數必須對應某個特徵空間中的內積,即對應的 Gram 矩陣必須是半正定矩陣。這個性質保證了優化問題的凸性,使得 SVM 訓練能找到全局最優解。

近年來,核方法也與深度學習有了新的交集。神經切線核(Neural Tangent Kernel, NTK)理論揭示了無限寬神經網路與核方法之間的等價性,為理解深度學習的泛化機制提供了新視角。

常見問題

為什麼需要核函數?直接增加特徵維度不行嗎?

直接增加特徵維度(如手動計算所有二次交叉特徵)在理論上可行,但實際上計算成本極高。假設原始特徵有 p 個維度,計算所有二次交叉項就需要 O(p²) 個新特徵,三次就是 O(p³),更高次數快速變得不可行。對 RBF 核對應的無限維映射而言,顯式計算根本不可能。核技巧的價值在於:SVM 只需要計算樣本對之間的內積,而不需要知道每個樣本在高維空間的確切座標。核函數直接輸出這個內積值,讓計算複雜度從特徵維度轉移到樣本數量,使得高維甚至無限維的特徵映射在計算上變得可行。

RBF 核的 γ 參數怎麼選,過大或過小會有什麼問題?

γ 控制 RBF 核的「影響範圍」:γ 大表示核函數衰減快,每個訓練樣本只對距離非常近的測試點有影響,決策邊界複雜、彎曲,容易過擬合訓練資料但在測試集泛化差。γ 小表示衰減慢,每個訓練樣本的影響延伸到很遠的地方,決策邊界平滑,可能欠擬合。選擇 γ 的標準做法是交叉驗證(Cross-Validation):在對數尺度(如 10^-4 到 10^4)上格點搜索,搭配 SVM 的 C 懲罰參數一起調整,找到驗證集準確率最高的組合。sklearn 的 GridSearchCV 可以自動化這個流程。

在 iPAS 考試中,核函數考題怎麼判斷要選哪個核?

iPAS 考題判斷核函數選擇,通常依據資料分布的描述或圖形。若資料點可以用直線分開,選線性核;若資料呈非線性分布(圓形、XOR 型、複雜邊界),選 RBF 核;若題目強調特徵交互效應或多項式關係,選多項式核。常見陷阱題型是描述「資料從核心向外呈環狀分布」(同心圓):這種情況線性核完全無法分割,RBF 核可以輕鬆處理。另一類考題是給出 γ 值的不同情境,要求判斷決策邊界的複雜度:大 γ = 複雜邊界(過擬合傾向)、小 γ = 平滑邊界(欠擬合傾向)。