搜尋意圖: 如果你在找「資料最小化 是什麼」或「資料最小化 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 只收集、處理和保存完成特定目的所必要之最少個人資料的隱私設計原則。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
只收集、處理和保存完成特定目的所必要之最少個人資料的隱私設計原則。
資料最小化(Data Minimization)是當代資料治理、隱私工程與 AI 倫理領域的核心原則之一,直接體現了「對個人隱私影響最小化」的設計哲學。隨著 AI 系統對大量資料的依賴日益加深,如何在確保模型效能的同時遵循資料最小化原則,已成為負責任 AI 開發中不可迴避的課題。
一、法律框架與定義
資料最小化原則在國際隱私法規中有明確的法律地位。歐盟《通用資料保護條例》(GDPR)第五條第一款(c)項明確規定:個人資料應「就其處理目的而言適當、相關且限於必要」(adequate, relevant and limited to what is necessary in relation to the purposes for which they are processed)。台灣《個人資料保護法》(個資法)第五條也有類似精神,要求個人資料的蒐集應有特定目的,且蒐集的資料不得逾越必要範圍。
資料最小化原則包含三個層面的要求。充分性(Adequacy):蒐集的資料應足以完成其聲稱的目的,不能因「最小化」而蒐集不足夠的資訊導致無法完成服務;相關性(Relevance):每項蒐集的資料欄位都應與聲稱的目的直接相關,不相關的欄位不應蒐集;必要性(Necessity):即使一份資料與目的相關,如果目的可以不蒐集它就能達成,則不應蒐集。三者共同構成資料最小化的完整要求。
二、資料最小化的實踐層面
資料最小化在實際系統設計中有多種實踐形式。資料欄位層面:在系統設計階段,應審查每個資料欄位的收集必要性,移除可有可無的「備用」欄位。例如電子商務平台收集送貨地址是必要的,但同時強制蒐集「出生年月日」用於未聲稱的廣告目的則違反最小化原則。資料保存時間層面:最小化不只針對資料的「種類」,也針對資料的「保存時間」:不再需要的資料應及時刪除(Retention Limitation),無限期保存歷史資料違反此原則。資料精度層面:在某些場景,降低資料精度也是最小化的手段:例如位置服務若只需城市層級的位置,就不應要求精確到公尺的 GPS 座標;年齡驗證若只需確認使用者成年,就不應要求確切出生日期。
三、AI 系統中的資料最小化挑戰
AI 系統對資料最小化原則帶來獨特的挑戰。深度學習模型通常需要大量訓練資料才能達到高性能,這與「只收集必要資料」的原則存在本質張力。此外,AI 系統的「必要性」往往難以事前確定:工程師在模型設計初期可能無法確切知道哪些特徵對模型有用,有時傾向於廣泛收集後再通過特徵選擇篩選,但這個「先廣收再篩選」的做法在 GDPR 框架下面臨合規挑戰。
應對這一挑戰的技術手段包括以下幾類。聯邦學習(Federated Learning):模型訓練在資料所在的本地設備完成,中央伺服器只接收梯度更新而非原始資料,資料不需集中儲存。差分隱私(Differential Privacy):在資料或模型輸出中加入精確計算的隨機雜訊,使得攻擊者無法從輸出反推個別樣本的原始值,同時保持統計意義上的資料分析能力。資料合成(Synthetic Data Generation):使用生成對抗網路或統計模型產生與原始資料有相似分佈但不含真實個人資訊的合成資料集,用於模型訓練和測試,從根本上避免直接使用個人資料。資料匿名化與假名化:透過去識別化(De-identification)手段移除或替換可識別個人的資訊,降低資料敏感程度。
四、隱私設計(Privacy by Design)框架中的角色
資料最小化是 Ann Cavoukian 提出的「隱私設計」七大原則中的第三原則「端對端安全:完整的生命週期保護」的組成部分,也與第六原則「尊重使用者隱私:保持使用者中心」密切相關。隱私設計的核心理念是將隱私保護納入系統架構的設計階段,而非在系統建成後作為補丁加入。
五、iPAS 考試中的出現場景
在 iPAS AI 應用規劃師考試中,資料最小化通常出現在 AI 倫理、資料治理與個人資料保護的情境題中。考生需要理解資料最小化原則的定義,識別違反此原則的常見場景(如超量蒐集、無限期保存),以及技術手段如何幫助 AI 系統更好地遵循此原則,這是中級考試中 AI 倫理與法規遵循能力的重要評量點。
常見問題
AI 模型訓練需要大量資料,如何同時遵守資料最小化原則?
大規模資料需求與資料最小化原則之間的張力是 AI 開發的核心倫理挑戰。實務上有幾種技術路徑可以緩解這一矛盾。聯邦學習讓模型在使用者設備端本地訓練,避免集中儲存個人資料。差分隱私在訓練過程加入精確雜訊,使模型不會記住個別訓練樣本。合成資料生成技術可產生統計特性相似但不含真實個人資訊的資料集。此外,目的限定原則要求組織在設計初期就明確訓練目的,只收集對模型真正有幫助的特徵,並在特徵工程後刪除原始資料,而非永久保存所有蒐集的原始資訊。
違反資料最小化原則會面臨什麼後果?
在歐盟 GDPR 框架下,違反資料最小化原則屬於違反資料處理基本原則(第五條),可被處以高達全球年營業額 4% 或 2000 萬歐元(取高者)的罰款,這是 GDPR 中最高等級的罰款。歷史上已有多起因違反資料最小化的重大罰款案例,包括 Google 因過度蒐集廣告個人化所需資料而受到法國資料保護機構(CNIL)開罰。在台灣,違反個資法可能面臨行政罰款及刑事責任。除法律風險外,超量蒐集資料也增加了資料洩露時的損害規模,一旦發生資安事件,受影響的使用者範圍和資料敏感程度都會更大。
「去識別化」資料是否還需要遵循資料最小化原則?
這是資料治理中的一個重要細節問題。若資料已達到真正的「匿名化」標準(即在現有技術條件下無法再識別到個人),則在 GDPR 定義下就不再算作個人資料,資料最小化等 GDPR 原則不再強制適用。然而,真正達到匿名化標準非常困難:許多看似匿名的資料可以透過關聯攻擊(Linkage Attack)重新識別。GDPR 對假名化(Pseudonymization)資料(如用代號替換姓名)明確指出仍屬於個人資料,仍需遵循資料最小化原則。因此,去識別化並非自動免除資料最小化義務,組織需要評估其去識別化是否達到真正的匿名標準。