均方誤差 是什麼?
Mean Squared Error:均方誤差 的完整解釋
均方誤差是一種常用的迴歸模型評估指標,它計算預測值與真實值之間差異的平方平均值,能有效衡量模型預測的準確性,並對較大的誤差給予更高的懲罰。
容易混淆
均方誤差 vs 平均絕對誤差
均方誤差:平方後平均,大誤差會被加重。 平均絕對誤差:直接平均絕對值,對離群值比較溫和。 最關鍵的區別:MSE 會更在乎大錯。
均方誤差 vs 均方根誤差
均方誤差:單位是平方後的結果。 均方根誤差:把 MSE 開根號,回到原始尺度。 最關鍵的區別:RMSE 比 MSE 更容易直接理解。
記住這句就好
錯越大,扣分越重,因為它把誤差平方了。
實際案例
溫度預測
如果模型把氣溫預測錯 1 度和錯 5 度一起算,MSE 會明顯懲罰那個錯 5 度的預測,讓模型更怕大偏差。
需求預測
補貨系統最怕一兩天預測差太多,MSE 會逼模型把那些尖峰需求也顧到,避免一次估錯就大缺貨。
算法與應用
MSE 常和高斯噪聲假設一起出現,因為平方誤差在數學上很好處理。 它對離群值敏感,所以如果資料裡有極端點,訓練會被拉得比較重。 訓練深度回歸模型時,MSE 幾乎是最常見的起點。
公式與計算
MSE 是預測值與真實值差距的平方平均:
MSE = (1/n) × Σ (y_i − ŷ_i)²y 是真實值,ŷ 是預測值,n 是樣本數。先取差、再平方、再平均。
實際算一次,四筆預測:
| 真實值 y | 預測值 ŷ | 誤差 | 誤差平方 |
|---|---|---|---|
| 10 | 12 | −2 | 4 |
| 20 | 18 | 2 | 4 |
| 30 | 33 | −3 | 9 |
| 40 | 35 | 5 | 25 |
誤差平方總和是 42,除以 4 筆,MSE = 10.5。
注意最後一筆:誤差 5 貢獻了 25,佔總和的六成。平方讓大誤差的權重被放大,這是 MSE 最重要的性質。
MSE、RMSE、MAE 差在哪,怎麼選
| 指標 | 算法 | 單位 | 對大誤差 |
|---|---|---|---|
| MSE | 誤差平方的平均 | 原單位的平方 | 懲罰最重 |
| RMSE | MSE 開根號 | 與原始資料相同 | 懲罰重 |
| MAE | 誤差絕對值的平均 | 與原始資料相同 | 一視同仁 |
選擇的判斷很直接。
你最怕偶爾錯得很離譜,例如預測交貨時間、醫療劑量,選 MSE 或 RMSE,讓模型優先把大錯壓下來。
資料裡本來就有離群值,而且你不想被它們牽著走,選 MAE,它對離群值穩健得多。
要跟別人解釋數字,選 RMSE,因為它的單位跟原始資料一樣。房價預測的 MSE 是「萬元的平方」,沒人聽得懂;RMSE 是「平均差幾萬元」,一句話就講完。
另外 MSE 在數學上處處可微而且是凸函數,這是它長年當回歸預設損失函數的原因,不只是因為好解釋。
情境判斷
Q1(情境題): 如果你的資料常有幾筆超大錯誤,MSE 合適嗎?
→ 要小心。MSE 會把大錯放得很大,可能讓模型過度追那些極端值,這時 MAE 或 Huber loss 可能更穩。
Q2(情境題): 如果你就是想讓模型更怕大失誤,該選哪個指標?
→ MSE 很適合,因為平方懲罰會讓大誤差明顯變重。
相關術語
常見問題
MSE 的值越小代表什麼?
代表預測和真實值的平均平方差越小,模型通常更準。
MSE 為什麼常拿來訓練模型?
因為它可微分、好最佳化,而且對大誤差懲罰明確。
MSE 適合所有回歸問題嗎?
不一定。若資料離群值很多,MSE 可能太敏感,這時要考慮其他損失。