偏差 是什麼?
Bias:偏差 的完整解釋
偏差是模型對特定族群或特徵產生系統性錯誤傾向,源自訓練資料不平衡或演算法設計缺陷
容易混淆
偏差 vs 方差? 偏差:系統性地往某方向錯 方差:對不同資料很不穩定 最關鍵的區別:偏差看方向一致,方差看穩不穩
偏差 vs 誤差? 偏差:有時也會指公平性偏見 誤差:泛指預測和真值的差距 最關鍵的區別:在模型評估和公平議題裡,偏差的語意不完全一樣
偏差 vs 過擬合? 偏差:常和欠擬合有關 過擬合:模型把訓練資料記太熟 最關鍵的區別:偏差高常是學不夠,過擬合則是記太多
記住這句就好
每次都往同一邊錯,多半就是偏差高
實際案例
貸款審核 模型對某些族群總是偏嚴格,這可能是資料分布或特徵設計造成的偏差
影像辨識 如果訓練資料幾乎都來自白天,模型一到夜間就一直判錯,也是一種系統性偏差
三種 bias 不要搞混
Bias 是 AI 領域最容易誤解的字之一,因為它在三個不同層次上各有一個意思,中文翻譯也不一樣。
| 場合 | 英文 | 中文 | 指的是什麼 |
|---|---|---|---|
| 統計與模型評估 | bias | 偏差 | 模型的系統性誤差,跟變異數(variance)成對出現 |
| 公平性與倫理 | bias | 偏見 | 模型對特定族群產生不公平的結果 |
| 神經網路結構 | bias term | 偏置項 | 每個神經元加的那個常數,跟權重一起被訓練 |
第一種,統計偏差。 出現在偏差與變異數權衡(bias-variance tradeoff)裡。偏差高代表模型太簡單、抓不住資料的真實規律,也就是欠擬合。用線性模型去配一條明顯彎曲的關係,就是典型的高偏差。
第二種,演算法偏見。 這是資料或流程造成的不公平。招募模型因為歷史資料裡某性別錄取率較低,就學會壓低該性別的分數,這叫偏見,不是統計上的偏差。處理方式也完全不同,前者要換模型,後者要檢查資料來源、標註流程與評估切面。
第三種,偏置項。 純粹是數學上的一個可學習常數,讓函數不必通過原點。它跟前兩種完全沒有關係,只是剛好同名。
讀文獻或跟人討論時,先確認講的是哪一種。這三個東西的成因、量測方式與解法沒有一項相同。
偏差 在 iPAS 考試中的重點
根據歷年統計,偏差 相關題目 平均佔 AI 技術類考題 2%, 屬於未分類考範圍。
常見出題方向:模型過擬合與欠擬合(40%)、統計學習理論基礎(35%)、模型誤差分析與改善(25%)。
相關術語
常見問題
偏差一定是壞事嗎?
不一定。某些情境下適度偏差能換來更穩定的模型。
要怎麼降低偏差?
通常要從更多資料、更好的特徵或更有表達力的模型下手。
公平性偏差和統計偏差一樣嗎?
不完全一樣,前者更關心不同群體是否受到不公正對待。
資料來源
- iPAS AI 應用規劃師評鑑內容範圍參考(115.02) ,經濟部產業人才能力鑑定