iPAS 考題解析
某電商公司欲利用顧客行為資料建立消費預測模型,其中「會員等級」欄位包含「一般、白金、黑卡」三種類別。若模型採用梯度提升樹(Gradient Boosting Tree)演算法,資料科學家在進行特徵編碼時應特別注意下列何種情況?
考試範圍定位
- 考試等級
- 中級能力鑑定
- 考試科目
- 大數據處理分析與應用
- 知識主題
- 大數據在人工智慧之應用
- 能力指標
- 大數據在鑑別式 AI 中的應用(L22402)
本題屬於 iPAS AI 應用規劃師中級能力鑑定「大數據處理分析與應用」科目中的「大數據在人工智慧之應用」範疇, 對應的能力指標為「大數據在鑑別式 AI 中的應用」,涵蓋大數據應用於預測、分類等鑑別式任務等核心知識點。 考生在準備這個範疇時,需要掌握相關的理論基礎與實務應用。
題目與選項
某電商公司欲利用顧客行為資料建立消費預測模型,其中「會員等級」欄位包含「一般、白金、黑卡」三種類別。若模型採用梯度提升樹(Gradient Boosting Tree)演算法,資料科學家在進行特徵編碼時應特別注意下列何種情況?
- A. 應優先採用獨熱編碼(One-Hot Encoding),以減少類別之間的相依性與記憶體使用量
- B. 直接使用標籤編碼(Label Encoding)可能使模型誤判類別間存在順序關係,導致特徵重要性偏誤 ✓ 正確答案
- C. 使用目標編碼(Target Encoding)會自動消除過擬合(Overfitting)風險
- D. 若類別數量較少,建議先使用主成份分析(Principal Component Analysis, PCA)進行降維
詳細解析
正確答案:B. 直接使用標籤編碼(Label Encoding)可能使模型誤判類別間存在順序關係,導致特徵重要性偏誤
對於「一般、白金、黑卡」這種名義類別,Label Encoding若以0、1、2表示,梯度提升樹可能誤以為存在0<1<2的順序關係,造成特徵重要性偏誤。若類別確實有序(如消費等級),則Label Encoding合理。
各選項逐一解析
理解每個選項為什麼對或錯,是真正掌握這個知識點的關鍵。以下逐一分析每個選項的含義與判斷依據。
A. 應優先採用獨熱編碼(One-Hot Encoding),以減少類別之間的相依性與記憶體使用量 (不正確)
One-Hot Encoding雖避免假序順,但對梯度提升樹而言類別數少時並非必要,且會增加維度。
B. 直接使用標籤編碼(Label Encoding)可能使模型誤判類別間存在順序關係,導致特徵重要性偏誤 (正確)
Label Encoding的假序順問題對無序類別確實可能造成特徵重要性偏誤,此為正確風險說明。
C. 使用目標編碼(Target Encoding)會自動消除過擬合(Overfitting)風險 (不正確)
目標編碼(Target Encoding)可能引入資料洩漏(data leakage),並非自動消除過擬合。
D. 若類別數量較少,建議先使用主成份分析(Principal Component Analysis, PCA)進行降維 (不正確)
PCA用於數值特徵降維,不適用於類別變數編碼前處理。
延伸學習
本題尚未連結特定術語,你可以從以下常見主題開始探索相關知識。
中等題備考建議
- ▶ 本題屬於中等難度,需要理解概念之間的關聯與應用情境,不能只靠死背定義。
- ▶ 中等難度的題目常考「為什麼」和「怎麼用」,建議整理各技術的優缺點比較表。
- ▶ 練習時注意錯誤選項的陷阱設計,很多時候錯誤選項只有一兩個字的差異,需要仔細辨別。
- ▶ 建議用「費曼學習法」,嘗試向別人解釋這道題的解題思路,能講清楚就代表真正理解了。
同主題考題練習
以下題目與本題屬於相同的考試範疇,建議一併練習以加強對該主題的掌握程度。
為了加速大數據環境下的 AI 模型訓練,以下哪一項為常見技術?
拉拉網路商城的老闆擬透過機器學習的方式,利用過往的產品銷售資料,預測下一季的產品銷售數量,以調整現有的庫存水位。下列哪一個類型的模型,比較適合應用在老闆期望的預測目標?
考慮資料集已經填補遺漏值,參考下圖執行結果,OLS迴歸輸出顯示:R-squared=0.898,迴歸係數:youtube=0.0455、facebook=0.1891、newspaper=-0.0006,截距=3.5561,newspaper的p值=0.914(不顯著)。 程式碼架構: X = df[['youtube','facebook','newspaper']] y = df['sales'] reg = 空格1 print(reg.coef_) X2 = sm.add_constant(X) model_sm = 空格2 print(model_sm.summary()) 各陳述: A: 空格1完整語法 reg = LinearRegression().fit(y, X) B: 空格1完整語法 reg = LinearRegression().fit(X, y) C: print(reg.coef_)結果為包括截距項等4個係數值 D: 空格2完整語法 sm.OLS(X2, y).fit() E: model_sm迴歸模型的所有迴歸係數在α=0.05之下具有顯著的解釋力 F: 截距項係數值為3.5561 下列哪些陳述正確?
iPAS AI 應用規劃師認證簡介
iPAS AI 應用規劃師能力鑑定是經濟部產業發展署推動的國家級 AI 證照制度, 分為「初級」與「中級」兩個等級。初級考試包含「人工智慧基礎概論」和「生成式 AI 應用與規劃」兩個科目, 著重基本概念的理解與應用。中級考試涵蓋「AI 技術應用與規劃」「大數據處理分析與應用」「機器學習技術與應用」三個科目, 要求考生具備更深入的技術知識與實務能力。 本題來自中級考試範圍,需要具備紮實的技術基礎才能正確作答。
開始準備 iPAS 考試
本題來自 114 年 AI 應用規劃師中級考試。 想通過 iPAS 認證?從完整題庫練習開始,搭配術語詞典與備考攻略,系統化提升你的 AI 知識。