搜尋意圖: 如果你在找「超參數 是什麼」、「超參數 會怎麼考」或「超參數 和相近概念差在哪」,先看這頁的定義、考點定位與延伸比較。
TL;DR: 超參數是機器學習模型訓練前,由人為設定且影響模型學習效果的參數,例如學習率或網路層數
實用情境: 適合用在 iPAS 複習、面試快查與閱讀 AI 文章時快速校正概念邊界。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
你有沒有調過模型,才發現有些設定不是學出來的,是你自己先決定的?
你可以把超參數想成訓練前先定好的規則。 像學習率、批次大小、樹深這些值,不是模型自己學,而是人先設定,會直接影響學習結果。
你可以把它想成一個把抽象概念拉回日常判斷的提示,先知道它解決什麼問題,再看技術細節。
容易混淆
超參數 vs 模型參數 模型參數是訓練過程中學出來的 超參數是人先設定的 最關鍵的區別是學出來,還是先選好
超參數 vs 超參數調校 超參數是那個設定本身 超參數調校是找最適合設定的過程 最關鍵的區別是值,還是找值的方法
記住這句就好
先設定規則,模型才開始學。
實際案例
學習率選擇 學習率太大會震盪,太小會很慢,這就是超參數會直接影響訓練品質的典型例子。
樹模型深度 決策樹或梯度提升法的樹深,會影響模型複雜度和過擬合風險。
算法與應用
超參數決定學習方式,不是直接學到的內容。 它們常要靠驗證資料集和搜尋方法來找,而不是憑直覺一次定死。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 超參數 | 台灣正式用語 |
| 超参数 | 簡體寫法 |
| Hyperparameter | 英文原名 |
| 超參量 | 少見變體 |
跟參數的差別
| 參數(parameter) | 超參數(hyperparameter) | |
|---|---|---|
| 誰決定 | 訓練過程自動學出來 | 訓練前由人或搜尋演算法設定 |
| 例子 | 神經網路的權重與偏差、迴歸係數 | 學習率、批次大小、層數、正則化強度、樹的深度 |
| 訓練中會變嗎 | 會 | 不會(排程器改變的是排程規則本身也是超參數的一部分) |
| 存在哪 | 模型檔案裡 | 設定檔或實驗紀錄裡 |
一句話的區別:參數是模型學到的,超參數是人設定的。
常見的超參數分類
模型架構類:層數、每層寬度、注意力頭數、卷積核大小。這類影響模型容量。
最佳化類:學習率、批次大小、最佳化器種類、動量、學習率排程。這類影響能不能訓得起來,其中學習率影響最大。
正則化類:權重衰減係數、dropout 比例、資料增強強度、提早停止的耐心值。這類影響過擬合程度。
資料類:切分比例、取樣策略、序列長度、類別權重。
搜尋方法與正確的驗證方式
| 方法 | 特性 |
|---|---|
| 網格搜尋(grid search) | 全部組合都試,維度一多就爆炸 |
| 隨機搜尋(random search) | 相同預算下通常優於網格搜尋,因為多數超參數不重要,隨機能在重要維度上取到更多不同值 |
| 貝氏最佳化 | 用過去的結果建代理模型決定下一個試哪裡,適合單次訓練很貴的情況 |
| Hyperband / ASHA | 早期就砍掉表現差的組合,把資源集中給有希望的,適合能中途評估的訓練 |
搜尋一定要用驗證集,不能用測試集。 拿測試集調超參數,測試集就不再是沒看過的資料,最終回報的分數會偏樂觀。正確流程是訓練集訓練、驗證集選超參數、測試集只在最後跑一次。
資料量小的時候用交叉驗證。 單一驗證集的分數雜訊大,可能只是切分運氣好。
搜尋範圍要用對的尺度。 學習率這類跨數量級的超參數要在對數尺度上取樣(0.0001 到 0.1),線性取樣會把絕大多數樣本浪費在同一個數量級裡。
情境判斷
Q1: 學習率、批次大小、樹深,哪一種比較像超參數? → 這些都屬於超參數,因為它們是人先設定的訓練條件。
Q2: 模型訓練完後自己得到的權重,算不算超參數? → 不算,那是模型參數,不是超參數。
iPAS 考題
出題方向:常考超參數與模型參數的差異,以及常見超參數的影響。 題目: 下列哪一項最符合「超參數」的概念? → 答案: 學習率。它是在訓練前由人設定,不是模型自己學出來的。
常見問題
常見超參數有哪些?
學習率、批次大小、層數、樹深、正則化強度都很常見。
超參數為什麼重要?
因為它會直接影響模型能不能學好、會不會過擬合。
超參數是固定不變的嗎?
不是,通常要根據資料和任務調整。