特徵工程 是什麼?

Feature Engineering:特徵工程 的完整解釋

特徵工程透過創建、轉換與選擇原始資料的代表性特徵,顯著提升機器學習模型的預測效果

容易混淆

特徵工程 vs 特徵擷取 特徵工程偏向人為設計和轉換,像把生日變成年齡。 特徵擷取偏向從原始資料自動抽出表示,像把圖片轉成向量特徵。

特徵工程 vs 模型訓練 特徵工程是在準備輸入。 模型訓練是在學怎麼用這些輸入做預測,兩者前後順序不同。

記住這句就好

特徵做得好,模型才有材料可學。

實際案例

信用評分 把收入、負債比、繳款紀錄整理成更有判斷力的欄位,模型才比較能分出風險。

電商推薦 把最近點擊、瀏覽次數、品類偏好整理成特徵,推薦結果通常會比只看原始交易表更準。

算法與應用

常見做法包含數值轉換、類別編碼、時間特徵、交互特徵和缺值處理。 在傳統機器學習裡,它常直接影響模型上限,在深度學習裡,仍會影響輸入品質與訓練穩定度。

中英對照與常見手法

中文 英文 做什麼
特徵工程 feature engineering 從原始資料造出對模型有用的欄位
特徵選擇 feature selection 從既有欄位裡挑出有用的
特徵抽取 feature extraction 把原始資料轉換成新的表示
特徵縮放 feature scaling 調整數值範圍,正規化與標準化都屬於這一類
特徵重要性 feature importance 衡量每個欄位對預測的貢獻

常見的具體手法:

時間欄位拆解。 一個時間戳記可以拆成年、月、日、星期幾、是不是假日、是不是月底、距離上次購買幾天。原始的時間戳記對模型幾乎沒用,拆完之後每一個都可能是強特徵。

類別欄位編碼。 類別少用獨熱編碼,有順序用標籤編碼,類別多用目標編碼或嵌入。

數值欄位轉換。 右偏資料取對數,有意義的分界做分箱,兩個欄位相除得到比率(例如營收除以員工數)。

聚合特徵。 同一個使用者過去 7 天、30 天的次數與平均,這在推薦與風控上通常是最強的一批特徵。

為什麼深度學習沒有取代它

常聽到的說法是深度學習能自動學特徵,所以不用做特徵工程。這句話只在特定條件下成立。

影像、語音、文字上大致成立。 這些資料的原始形式(像素、波形、字元)本身就有豐富結構,卷積與注意力能自己學出層次化的表示,人工設計反而不如模型。

表格資料上完全不成立。 表格資料的欄位是人定義的、彼此關係任意、樣本數通常也不夠深度模型自己摸索。這也是梯度提升樹在表格任務上長年勝過神經網路的原因之一。

時間與領域知識永遠不會被取代。 「這個客戶距離上次下單幾天」「這台設備距離上次保養幾小時」這種特徵,模型不可能自己從欄位裡推出來,因為它不知道業務規則。

一個實務上的判斷:如果你花一天做特徵工程帶來的提升,超過換一個更大的模型,那代表資料裡還有沒被表達出來的結構,繼續做特徵比換模型划算。

特徵工程 在 iPAS 考試中的重點

根據歷年統計,特徵工程 相關題目 平均佔 AI 技術類考題 7%, 屬於高頻考範圍。

常見出題方向:特徵工程的步驟與方法(45%)、資料前處理技術辨別(35%)、特徵選取與轉換方法(20%)。

相關術語

常見問題

特徵工程一定要很會寫程式嗎?

不一定,懂資料和業務脈絡常比會不會套工具更重要。

特徵工程和資料清理是一樣的嗎?

不一樣,資料清理是修錯資料,特徵工程是把資料變得更能幫模型判斷。

特徵工程會不會過度依賴經驗?

會有這個風險,所以通常要搭配驗證集和交叉驗證檢查效果。

自動化特徵工程有沒有用?

有,但它適合先擴充候選方向,最後仍常需要人工判斷哪些特徵真的合理。

資料來源

← 回到 特徵工程 快查頁

測驗你對 特徵工程 的理解

透過模擬考系統檢驗學習成果

開始測驗