iPAS 考題解析
資料科學團隊在模型訓練前,需對數值特徵進行正規化(Normalization)或標準化(Standardization)。為確保模型評估結果具真實性並避免資料洩漏(Data Leakage),下列何者為最適當的作法?
考試範圍定位
- 考試等級
- 初級能力鑑定
- 考試科目
- 人工智慧基礎概論
- 知識主題
- 資料處理與分析概念
- 能力指標
- 資料整理與分析流程(L11202)
本題屬於 iPAS AI 應用規劃師初級能力鑑定「人工智慧基礎概論」科目中的「資料處理與分析概念」範疇, 對應的能力指標為「資料整理與分析流程」,涵蓋資料收集、清理、特徵工程、資料標準化等核心知識點。 考生在準備這個範疇時,需要掌握相關的理論基礎與實務應用。
題目與選項
資料科學團隊在模型訓練前,需對數值特徵進行正規化(Normalization)或標準化(Standardization)。為確保模型評估結果具真實性並避免資料洩漏(Data Leakage),下列何者為最適當的作法?
- A. 於資料分割前,先對完整資料集計算統計量並進行標準化處理
- B. 先分割訓練資料(Training Data)和測試資料(Test Data),並各自獨立計算統計量後進行標準化
- C. 先分割訓練資料(Training Data)和測試資料(Test Data),僅以訓練資料計算統計量,再套用至測試資料 ✓ 正確答案
- D. 僅對訓練資料(Training Data)進行標準化處理,測試資料(Test Data)保持原始數值
詳細解析
正確答案:C. 先分割訓練資料(Training Data)和測試資料(Test Data),僅以訓練資料計算統計量,再套用至測試資料
為避免資料洩漏,應先分割資料,再僅使用訓練資料計算標準化的統計量(如均值、標準差),然後將相同的統計量套用到測試資料上。這樣測試資料的評估才能真實反映模型的泛化能力。
各選項逐一解析
理解每個選項為什麼對或錯,是真正掌握這個知識點的關鍵。以下逐一分析每個選項的含義與判斷依據。
A. 於資料分割前,先對完整資料集計算統計量並進行標準化處理 (不正確)
分割前對完整資料集計算統計量會導致測試資料的資訊洩漏到訓練過程中。
B. 先分割訓練資料(Training Data)和測試資料(Test Data),並各自獨立計算統計量後進行標準化 (不正確)
各自獨立計算統計量會使訓練和測試使用不同的轉換標準,不合適。
C. 先分割訓練資料(Training Data)和測試資料(Test Data),僅以訓練資料計算統計量,再套用至測試資料 (正確)
僅用訓練資料計算統計量再套用至測試資料,可避免資料洩漏(正確答案)。
D. 僅對訓練資料(Training Data)進行標準化處理,測試資料(Test Data)保持原始數值 (不正確)
測試資料保持原始數值會導致訓練和測試資料尺度不一致,影響模型表現。
本題涉及的 AI 術語
深入理解以下術語,有助於掌握本題背後的核心概念,也能幫助你在遇到相似題目時更快判斷正確答案。
中等題備考建議
- ▶ 本題屬於中等難度,需要理解概念之間的關聯與應用情境,不能只靠死背定義。
- ▶ 中等難度的題目常考「為什麼」和「怎麼用」,建議整理各技術的優缺點比較表。
- ▶ 練習時注意錯誤選項的陷阱設計,很多時候錯誤選項只有一兩個字的差異,需要仔細辨別。
- ▶ 建議用「費曼學習法」,嘗試向別人解釋這道題的解題思路,能講清楚就代表真正理解了。
同主題考題練習
以下題目與本題屬於相同的考試範疇,建議一併練習以加強對該主題的掌握程度。
iPAS AI 應用規劃師認證簡介
iPAS AI 應用規劃師能力鑑定是經濟部產業發展署推動的國家級 AI 證照制度, 分為「初級」與「中級」兩個等級。初級考試包含「人工智慧基礎概論」和「生成式 AI 應用與規劃」兩個科目, 著重基本概念的理解與應用。中級考試涵蓋「AI 技術應用與規劃」「大數據處理分析與應用」「機器學習技術與應用」三個科目, 要求考生具備更深入的技術知識與實務能力。 本題來自初級考試範圍,適合正在準備初級認證的考生練習。
開始準備 iPAS 考試
本題來自 115 年 AI 應用規劃師初級考試。 想通過 iPAS 認證?從完整題庫練習開始,搭配術語詞典與備考攻略,系統化提升你的 AI 知識。