核函數 是什麼?
Kernel Function:核函數 的完整解釋
在支援向量機等演算法中,將低維資料映射到高維特徵空間的函數,使原本線性不可分的問題變得可分。
核函數的誕生源於一個基本問題:許多現實世界的分類或迴歸任務在原始特徵空間中無法用直線(或超平面)分開,但如果將資料映射到更高維度的空間,往往就能找到分割超平面。問題是,如果直接計算高維映射,計算成本會隨維度指數級增長,甚至在無限維空間中根本無法顯式計算。核技巧的精妙之處在於:許多演算法(尤其是 SVM)實際上只需要計算樣本之間的內積,而不需要知道每個樣本的具體座標。核函數 K(x, y) = φ(x)·φ(y) 直接計算映射後的內積,繞過了顯式計算高維座標的步驟。
最常用的核函數有四種類型。線性核(Linear Kernel)K(x, y) = x·y 其實就是原始內積,對應不做任何映射,適用於資料本身就線性可分的情況,計算成本最低。多項式核(Polynomial Kernel)K(x, y) = (γx·y + r)^d 能建模特徵之間的交互效應,d 是多項式次數,d=2 時能捕捉所有二次交互特徵(x1·x2、x1²、x2² 等)。徑向基函數核(RBF Kernel,又稱高斯核)K(x, y) = exp(-γ||x-y||²) 是最廣泛使用的核,對應無限維特徵空間的映射,γ 參數控制「影響範圍」,γ 大時每個訓練樣本只影響鄰近的預測,γ 小時影響範圍廣。Sigmoid 核 K(x, y) = tanh(γx·y + r) 與神經網路的激活函數形式相似,但在 SVM 中使用較少。
核函數需要滿足 Mercer 定理(Mercer's Theorem):核矩陣(Gram Matrix)必須是正定矩陣,才能保證對應到某個高維特徵空間的合法內積運算。這個數學條件確保核函數定義的「相似度」具有幾何上的一致性,也保證 SVM 的凸優化問題有唯一解。
在 SVM 的訓練過程中,核函數的選擇直接決定決策邊界的形狀。線性核產生線性決策邊界;RBF 核能產生任意形狀的非線性邊界,理論上能近似任何決策邊界(只要訓練樣本足夠且 γ 適當)。選擇核函數時,通常先嘗試線性核(特別是特徵維度高、樣本量大的 NLP 任務),再嘗試 RBF 核(大多數低維非線性任務的預設選擇),並用交叉驗證調整超參數(C 懲罰係數與 γ)。
在 AI 領域的現代應用中,核方法雖然在深度學習時代不再是主流,但在若干場景仍有重要地位。小樣本情況(訓練資料少於數千筆)下,SVM + RBF 核往往比深度神經網路更穩健,因為 SVM 的優化問題有全局最優解,不會陷入局部極小值。核方法在生物資訊學(蛋白質序列分類)、訊號處理、金融時間序列異常偵測等領域持續被使用。此外,核的思想也滲透到現代深度學習理論:Neural Tangent Kernel(NTK)研究發現,無限寬度神經網路的訓練動態等價於一種核迴歸,這條理論連接幫助研究者更深入理解深度學習的泛化機制。
iPAS 考試中核函數的考點集中在:識別各種核函數的數學形式與對應的特徵空間特性、RBF 核的超參數 γ 如何影響決策邊界的複雜度(γ 大 = 過擬合風險高、γ 小 = 欠擬合風險高)、核技巧的意義(避免顯式計算高維映射)、以及在給定情境(如資料分布呈同心圓形狀)中選擇最適合的核函數。
即使在深度學習主導的今天,核函數的概念依然在理解模型相似度計算、向量空間映射等核心問題上提供重要的理論框架,是 AI 從業者理解機器學習基礎原理不可跳過的知識模組。核方法的思想也啟發了現代 Transformer 注意力機制的設計,兩者在衡量元素間相似度的本質上有深刻的共通之處。 核函數(Kernel Function)是支援向量機(SVM)和高斯過程等算法的核心組件,透過「核技巧」(Kernel Trick)解決線性模型無法處理非線性資料的問題。
核技巧的精妙之處在於:它允許算法在高維特徵空間中計算內積,而無需顯式地計算每個樣本在高維空間中的座標。這意味著模型可以在理論上無限維的特徵空間中執行,而實際計算成本只取決於訓練樣本數量,而非特徵維度。
常見核函數各有適用場景。多項式核(Polynomial Kernel)適合處理圖像分類等特徵間存在乘法交互作用的問題;RBF 核(Radial Basis Function,又稱高斯核)是最廣泛使用的核函數,對連續光滑的決策邊界效果尤佳,只有一個超參數 γ 控制決策邊界的複雜度;Sigmoid 核在行為上類似神經網路的啟動函數,但在 SVM 中較少使用。
在核方法的理論框架(Mercer 定理)下,有效的核函數必須對應某個特徵空間中的內積,即對應的 Gram 矩陣必須是半正定矩陣。這個性質保證了優化問題的凸性,使得 SVM 訓練能找到全局最優解。
近年來,核方法也與深度學習有了新的交集。神經切線核(Neural Tangent Kernel, NTK)理論揭示了無限寬神經網路與核方法之間的等價性,為理解深度學習的泛化機制提供了新視角。