資料最小化 是什麼?

Data Minimization:資料最小化 的完整解釋

只收集、處理和保存完成特定目的所必要之最少個人資料的隱私設計原則。

資料最小化(Data Minimization)是當代資料治理、隱私工程與 AI 倫理領域的核心原則之一,直接體現了「對個人隱私影響最小化」的設計哲學。隨著 AI 系統對大量資料的依賴日益加深,如何在確保模型效能的同時遵循資料最小化原則,已成為負責任 AI 開發中不可迴避的課題。

一、法律框架與定義

資料最小化原則在國際隱私法規中有明確的法律地位。歐盟《通用資料保護條例》(GDPR)第五條第一款(c)項明確規定:個人資料應「就其處理目的而言適當、相關且限於必要」(adequate, relevant and limited to what is necessary in relation to the purposes for which they are processed)。台灣《個人資料保護法》(個資法)第五條也有類似精神,要求個人資料的蒐集應有特定目的,且蒐集的資料不得逾越必要範圍。

資料最小化原則包含三個層面的要求。充分性(Adequacy):蒐集的資料應足以完成其聲稱的目的,不能因「最小化」而蒐集不足夠的資訊導致無法完成服務;相關性(Relevance):每項蒐集的資料欄位都應與聲稱的目的直接相關,不相關的欄位不應蒐集;必要性(Necessity):即使一份資料與目的相關,如果目的可以不蒐集它就能達成,則不應蒐集。三者共同構成資料最小化的完整要求。

二、資料最小化的實踐層面

資料最小化在實際系統設計中有多種實踐形式。資料欄位層面:在系統設計階段,應審查每個資料欄位的收集必要性,移除可有可無的「備用」欄位。例如電子商務平台收集送貨地址是必要的,但同時強制蒐集「出生年月日」用於未聲稱的廣告目的則違反最小化原則。資料保存時間層面:最小化不只針對資料的「種類」,也針對資料的「保存時間」:不再需要的資料應及時刪除(Retention Limitation),無限期保存歷史資料違反此原則。資料精度層面:在某些場景,降低資料精度也是最小化的手段:例如位置服務若只需城市層級的位置,就不應要求精確到公尺的 GPS 座標;年齡驗證若只需確認使用者成年,就不應要求確切出生日期。

三、AI 系統中的資料最小化挑戰

AI 系統對資料最小化原則帶來獨特的挑戰。深度學習模型通常需要大量訓練資料才能達到高性能,這與「只收集必要資料」的原則存在本質張力。此外,AI 系統的「必要性」往往難以事前確定:工程師在模型設計初期可能無法確切知道哪些特徵對模型有用,有時傾向於廣泛收集後再通過特徵選擇篩選,但這個「先廣收再篩選」的做法在 GDPR 框架下面臨合規挑戰。

應對這一挑戰的技術手段包括以下幾類。聯邦學習(Federated Learning):模型訓練在資料所在的本地設備完成,中央伺服器只接收梯度更新而非原始資料,資料不需集中儲存。差分隱私(Differential Privacy):在資料或模型輸出中加入精確計算的隨機雜訊,使得攻擊者無法從輸出反推個別樣本的原始值,同時保持統計意義上的資料分析能力。資料合成(Synthetic Data Generation):使用生成對抗網路或統計模型產生與原始資料有相似分佈但不含真實個人資訊的合成資料集,用於模型訓練和測試,從根本上避免直接使用個人資料。資料匿名化與假名化:透過去識別化(De-identification)手段移除或替換可識別個人的資訊,降低資料敏感程度。

四、隱私設計(Privacy by Design)框架中的角色

資料最小化是 Ann Cavoukian 提出的「隱私設計」七大原則中的第三原則「端對端安全:完整的生命週期保護」的組成部分,也與第六原則「尊重使用者隱私:保持使用者中心」密切相關。隱私設計的核心理念是將隱私保護納入系統架構的設計階段,而非在系統建成後作為補丁加入。

五、iPAS 考試中的出現場景

在 iPAS AI 應用規劃師考試中,資料最小化通常出現在 AI 倫理、資料治理與個人資料保護的情境題中。考生需要理解資料最小化原則的定義,識別違反此原則的常見場景(如超量蒐集、無限期保存),以及技術手段如何幫助 AI 系統更好地遵循此原則,這是中級考試中 AI 倫理與法規遵循能力的重要評量點。

常見問題