超參數 是什麼?

Hyperparameter:超參數 的完整解釋

超參數是機器學習模型訓練前,由人為設定且影響模型學習效果的參數,例如學習率或網路層數

容易混淆

超參數 vs 模型參數 模型參數是訓練過程中學出來的 超參數是人先設定的 最關鍵的區別是學出來,還是先選好

超參數 vs 超參數調校 超參數是那個設定本身 超參數調校是找最適合設定的過程 最關鍵的區別是值,還是找值的方法

記住這句就好

先設定規則,模型才開始學。

實際案例

學習率選擇 學習率太大會震盪,太小會很慢,這就是超參數會直接影響訓練品質的典型例子。

樹模型深度 決策樹或梯度提升法的樹深,會影響模型複雜度和過擬合風險。

算法與應用

超參數決定學習方式,不是直接學到的內容。 它們常要靠驗證資料集和搜尋方法來找,而不是憑直覺一次定死。

中英對照與常見說法

說法 出現場合
超參數 台灣正式用語
超参数 簡體寫法
Hyperparameter 英文原名
超參量 少見變體

跟參數的差別

參數(parameter) 超參數(hyperparameter)
誰決定 訓練過程自動學出來 訓練前由人或搜尋演算法設定
例子 神經網路的權重與偏差、迴歸係數 學習率、批次大小、層數、正則化強度、樹的深度
訓練中會變嗎 不會(排程器改變的是排程規則本身也是超參數的一部分)
存在哪 模型檔案裡 設定檔或實驗紀錄裡

一句話的區別:參數是模型學到的,超參數是人設定的

常見的超參數分類

模型架構類:層數、每層寬度、注意力頭數、卷積核大小。這類影響模型容量。

最佳化類:學習率、批次大小、最佳化器種類、動量、學習率排程。這類影響能不能訓得起來,其中學習率影響最大。

正則化類:權重衰減係數、dropout 比例、資料增強強度、提早停止的耐心值。這類影響過擬合程度。

資料類:切分比例、取樣策略、序列長度、類別權重。

搜尋方法與正確的驗證方式

方法 特性
網格搜尋(grid search) 全部組合都試,維度一多就爆炸
隨機搜尋(random search) 相同預算下通常優於網格搜尋,因為多數超參數不重要,隨機能在重要維度上取到更多不同值
貝氏最佳化 用過去的結果建代理模型決定下一個試哪裡,適合單次訓練很貴的情況
Hyperband / ASHA 早期就砍掉表現差的組合,把資源集中給有希望的,適合能中途評估的訓練

搜尋一定要用驗證集,不能用測試集。 拿測試集調超參數,測試集就不再是沒看過的資料,最終回報的分數會偏樂觀。正確流程是訓練集訓練、驗證集選超參數、測試集只在最後跑一次。

資料量小的時候用交叉驗證。 單一驗證集的分數雜訊大,可能只是切分運氣好。

搜尋範圍要用對的尺度。 學習率這類跨數量級的超參數要在對數尺度上取樣(0.0001 到 0.1),線性取樣會把絕大多數樣本浪費在同一個數量級裡。

情境判斷

Q1: 學習率、批次大小、樹深,哪一種比較像超參數? → 這些都屬於超參數,因為它們是人先設定的訓練條件。

Q2: 模型訓練完後自己得到的權重,算不算超參數? → 不算,那是模型參數,不是超參數。

超參數 在 iPAS 考試中的重點

根據歷年統計,超參數 相關題目 平均佔 AI 技術類考題 2%, 屬於未分類考範圍。

常見出題方向:模型訓練與優化原理(40%)、超參數調校的演算法與方法(35%)、超參數對模型效能的影響分析(25%)。

相關術語

常見問題

常見超參數有哪些?

學習率、批次大小、層數、樹深、正則化強度都很常見。

超參數為什麼重要?

因為它會直接影響模型能不能學好、會不會過擬合。

超參數是固定不變的嗎?

不是,通常要根據資料和任務調整。

資料來源

← 回到 超參數 快查頁

測驗你對 超參數 的理解

透過模擬考系統檢驗學習成果

開始測驗