AI 公平性 是什麼?

AI Fairness:AI 公平性 的完整解釋

確保 AI 系統對不同群體(如性別、種族、年齡)的決策結果不存在不合理歧視或偏差的原則與實踐。

AI 公平性的挑戰根源在於機器學習模型依賴歷史資料訓練,而歷史資料往往反映了現實社會中既有的不平等。即使工程師刻意排除「種族」「性別」等敏感屬性,模型仍可能透過與這些屬性高度相關的代理變數(如郵遞區號、學歷、姓名)間接習得偏見,這種現象被稱為「代理歧視」(Proxy Discrimination)。

公平性的多種數學定義

公平性並無唯一的數學定義,不同場景需要選擇適合的公平性指標,且這些定義之間往往存在不可兼得的矛盾(「公平性不可能定理」):

  1. 人口統計均等(Demographic Parity / Statistical Parity):不同群體獲得正面結果的比例相同。例如,貸款核准率在男性與女性群體中應相等。適用於歷史資料本身就有偏見、不能作為「真實標準」的場景。

  2. 機會均等(Equal Opportunity):在真正的正樣本中(如符合貸款條件者),不同群體的真正正例率(True Positive Rate / Recall)相同。強調系統不應更容易「錯過」某個群體的合格申請者。

  3. 均等赔率(Equalized Odds):在真正正樣本和真正負樣本中,不同群體的真正正例率和假正例率都相同。比機會均等更嚴格。

  4. 校準公平性(Calibration Fairness):模型的預測機率在所有群體中都準確反映真實機率,即對不同群體不應高估或低估風險。

公平性不可能定理

Chouldechova(2017)等研究者從數學上證明:在一般情況下(不同群體的真實犯罪/違約率不同),人口統計均等、機會均等、均等賠率、校準公平性這幾個指標不可能同時滿足。這意味著公平性指標的選擇本質上是一個價值判斷問題,而非純技術問題,必須根據具體應用的倫理原則和法律要求來決定。

偏見的來源

  • 歷史偏見(Historical Bias):訓練資料反映了過去的歧視性決策,如招聘資料中的性別不平等。
  • 樣本偏見(Sampling Bias):某些群體在訓練資料中代表性不足(Under-representation),導致模型對這些群體效果更差。
  • 標籤偏見(Label Bias):標注者的主觀偏見被引入標籤,如人工智慧輔助量刑工具中對特定族裔的標籤評估偏差。
  • 特徵偏見(Feature Engineering Bias):特徵選擇本身強化了某些群體的劣勢,如以「工作經歷年數」不利於曾中斷職涯的照顧者。

常見的公平性工具

  • AI Fairness 360(IBM):提供多種公平性指標計算與偏見緩解演算法的 Python 工具包。
  • Fairlearn(Microsoft):提供公平性評估儀表板與多種公平性約束最佳化方法。
  • What-If Tool(Google):視覺化工具,支援探索不同決策閾值對公平性的影響。

法律與監管脈絡

EU AI Act(2024 年生效)將高風險 AI 系統(包括招聘、信用評分、教育評估、執法工具)列為受規範對象,要求進行公平性評估與偏見測試,並確保人工監督機制。台灣的 AI 基本法草案與個人資料保護法修正案也在逐步強化對 AI 歧視風險的規範。

台灣與亞太的在地脈絡

台灣的 AI 公平性關注焦點與歐美有所不同。除了性別與族裔,語言偏誤是重要議題:使用英文語料預訓練的 AI 系統對台灣繁體中文用語、台灣文化脈絡的理解往往不足,在醫療、法律、教育等需要在地知識的場景可能產生不公平的差異化效果。此外,台灣多元族群(閩南、客家、原住民族等)與多語言環境,也使語音辨識、NLP 等工具的語言公平性成為值得關注的問題。企業部署 AI 時應在本地語言和文化場景下進行差異化效能評估,而非只依賴英文基準。

常見問題