超參數(Hyperparameter)是什麼?

超參數是機器學習模型訓練前,由人為設定且影響模型學習效果的參數,例如學習率或網路層數|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Hyperparameter
主題標籤
模型訓練、最佳化、機器學習
考點定位
中級
最後更新
2026/07/29
超參數(Hyperparameter)是什麼? iPAS 模型訓練最佳化
術語快查

搜尋意圖: 如果你在找「超參數 是什麼」、「超參數 會怎麼考」或「超參數 和相近概念差在哪」,先看這頁的定義、考點定位與延伸比較。

TL;DR: 超參數是機器學習模型訓練前,由人為設定且影響模型學習效果的參數,例如學習率或網路層數

實用情境: 適合用在 iPAS 複習、面試快查與閱讀 AI 文章時快速校正概念邊界。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

你有沒有調過模型,才發現有些設定不是學出來的,是你自己先決定的?

你可以把超參數想成訓練前先定好的規則。 像學習率、批次大小、樹深這些值,不是模型自己學,而是人先設定,會直接影響學習結果。

你可以把它想成一個把抽象概念拉回日常判斷的提示,先知道它解決什麼問題,再看技術細節。

容易混淆

超參數 vs 模型參數 模型參數是訓練過程中學出來的 超參數是人先設定的 最關鍵的區別是學出來,還是先選好

超參數 vs 超參數調校 超參數是那個設定本身 超參數調校是找最適合設定的過程 最關鍵的區別是值,還是找值的方法

記住這句就好

先設定規則,模型才開始學。

實際案例

學習率選擇 學習率太大會震盪,太小會很慢,這就是超參數會直接影響訓練品質的典型例子。

樹模型深度 決策樹或梯度提升法的樹深,會影響模型複雜度和過擬合風險。

算法與應用

超參數決定學習方式,不是直接學到的內容。 它們常要靠驗證資料集和搜尋方法來找,而不是憑直覺一次定死。

中英對照與常見說法

說法 出現場合
超參數 台灣正式用語
超参数 簡體寫法
Hyperparameter 英文原名
超參量 少見變體

跟參數的差別

參數(parameter) 超參數(hyperparameter)
誰決定 訓練過程自動學出來 訓練前由人或搜尋演算法設定
例子 神經網路的權重與偏差、迴歸係數 學習率、批次大小、層數、正則化強度、樹的深度
訓練中會變嗎 不會(排程器改變的是排程規則本身也是超參數的一部分)
存在哪 模型檔案裡 設定檔或實驗紀錄裡

一句話的區別:參數是模型學到的,超參數是人設定的

常見的超參數分類

模型架構類:層數、每層寬度、注意力頭數、卷積核大小。這類影響模型容量。

最佳化類:學習率、批次大小、最佳化器種類、動量、學習率排程。這類影響能不能訓得起來,其中學習率影響最大。

正則化類:權重衰減係數、dropout 比例、資料增強強度、提早停止的耐心值。這類影響過擬合程度。

資料類:切分比例、取樣策略、序列長度、類別權重。

搜尋方法與正確的驗證方式

方法 特性
網格搜尋(grid search) 全部組合都試,維度一多就爆炸
隨機搜尋(random search) 相同預算下通常優於網格搜尋,因為多數超參數不重要,隨機能在重要維度上取到更多不同值
貝氏最佳化 用過去的結果建代理模型決定下一個試哪裡,適合單次訓練很貴的情況
Hyperband / ASHA 早期就砍掉表現差的組合,把資源集中給有希望的,適合能中途評估的訓練

搜尋一定要用驗證集,不能用測試集。 拿測試集調超參數,測試集就不再是沒看過的資料,最終回報的分數會偏樂觀。正確流程是訓練集訓練、驗證集選超參數、測試集只在最後跑一次。

資料量小的時候用交叉驗證。 單一驗證集的分數雜訊大,可能只是切分運氣好。

搜尋範圍要用對的尺度。 學習率這類跨數量級的超參數要在對數尺度上取樣(0.0001 到 0.1),線性取樣會把絕大多數樣本浪費在同一個數量級裡。

情境判斷

Q1: 學習率、批次大小、樹深,哪一種比較像超參數? → 這些都屬於超參數,因為它們是人先設定的訓練條件。

Q2: 模型訓練完後自己得到的權重,算不算超參數? → 不算,那是模型參數,不是超參數。

iPAS 考題

出題方向:常考超參數與模型參數的差異,以及常見超參數的影響。 題目: 下列哪一項最符合「超參數」的概念? → 答案: 學習率。它是在訓練前由人設定,不是模型自己學出來的。

常見問題

常見超參數有哪些?

學習率、批次大小、層數、樹深、正則化強度都很常見。

超參數為什麼重要?

因為它會直接影響模型能不能學好、會不會過擬合。

超參數是固定不變的嗎?

不是,通常要根據資料和任務調整。