解析:
SHAP 值基於 Shapley 值的概念,計算每個輸入特徵對單一預測結果的貢獻程度。它能公平地分配各特徵對模型輸出的影響,提供個別預測的可解釋性。
機器學習讓電腦透過分析大量資料自動找出規律,無需明確程式指令即可完成預測與分類任務|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。
搜尋意圖: 如果你在找「機器學習 是什麼」、「機器學習 會怎麼考」或「機器學習 和相近概念差在哪」,先看這頁的定義、考點定位與延伸比較。
TL;DR: 機器學習讓電腦透過分析大量資料自動找出規律,無需明確程式指令即可完成預測與分類任務
實用情境: 適合用在 iPAS 複習、面試快查與閱讀 AI 文章時快速校正概念邊界。
下一步: 先讀完定義,再往下看範例考題與延伸比較,把概念轉成可作答的判斷。
你有沒有看過電腦不用人手寫規則,卻自己學會判斷? 你可以把機器學習想成,先給電腦大量資料,再讓它自己抓規律。 它其實就是讓模型從資料中學出預測或分類的方法。 當規則很難手動寫完整時,機器學習通常就很有價值。
你可以把它想成一個把抽象概念拉回日常判斷的提示,先知道它解決什麼問題,再看技術細節。
機器學習 vs 深度學習 深度學習是機器學習的一部分,通常靠多層神經網路學特徵。 一個是大傘,一個是子集合。
機器學習 vs 傳統程式設計 傳統程式設計是人先寫規則,機器學習是人先給資料。 一個靠規則,一個靠經驗。
最關鍵的區別: 先寫規則,還是先餵資料。
資料夠好,模型才學得像樣。
信用評分 銀行用歷史資料學出違約風險,讓審核更快也更一致。
商品推薦 電商看使用者點擊和購買紀錄,學出下一個可能想看的商品。
典型流程是資料收集、清理、特徵處理、模型訓練、評估和上線。 機器學習不是單一演算法,而是一整套從資料到決策的方法群。 資料品質、特徵設計和評估方式,常常比模型名字更重要。
| 說法 | 出現場合 |
|---|---|
| 機器學習 | 台灣正式用語 |
| 机器学习 | 簡體寫法 |
| Machine Learning | 英文原名 |
| ML | 標準縮寫 |
| 機械學習 | 少見的舊譯法 |
| 範式 | 資料長什麼樣 | 在學什麼 | 代表任務 |
|---|---|---|---|
| 監督式學習 | 有輸入也有正確答案 | 從輸入預測答案 | 分類、迴歸 |
| 非監督式學習 | 只有輸入,沒有答案 | 找出資料本身的結構 | 分群、降維、異常偵測 |
| 強化學習 | 沒有標準答案,只有環境給的獎勵 | 在環境裡採取行動最大化長期回報 | 遊戲、控制、推薦策略 |
中間還有半監督式學習(少量標註加大量未標註)與自監督式學習(從資料本身構造預測任務,例如遮住一部分猜回來)。現在的大型語言模型與影像基礎模型,預訓練階段用的都是自監督式學習,這是它們能吃下網路規模資料的原因。
人工智慧(AI) 是最大的傘,包含所有讓機器展現智慧行為的方法,包括早年純手寫規則的專家系統。
機器學習 是 AI 底下的一支,特色是從資料裡學規律,而不是由人把規律寫死。
深度學習 是機器學習底下的一支,用多層神經網路自動學特徵。
生成式 AI 是應用型態的分類,不是層級的一層,它多半用深度學習實作,但重點在於輸出是新內容而不是一個標籤或數字。
一句話:所有深度學習都是機器學習,所有機器學習都是 AI,但反過來都不成立。
定義問題與成功指標、收集資料、探索與清理、切分訓練與驗證與測試集、特徵處理、訓練、評估、調參、部署、監控。
最容易出錯的兩步是第一步與第四步。
第一步,把商業問題翻譯成機器學習問題翻錯,後面做得再漂亮也沒用。「提高營收」不是機器學習問題,「預測哪些客戶下個月會流失」才是。
第四步,切分方式錯誤造成資料洩漏。時間序列資料必須依時間切,不能隨機切,否則等於用未來預測過去。同一個使用者的多筆資料必須整組分到同一邊,否則模型在測試集上看到的是它訓練時已經認識的人。
Q1(直覺題): 當規則很難手寫完,該考慮哪一類方法?
Q2(判斷題): 機器學習一定比手寫規則好嗎?
Q:機器學習和深度學習的關係是什麼? 深度學習是機器學習的子集,兩者是包含關係。
Q:什麼情況適合使用機器學習? 當資料很多、規則難以手寫,或問題需要從經驗中學習時很適合。
通常資料越多越好,但也要看問題難度和資料品質。
不是,它很依賴資料和目標,資料差時效果也會差。
先懂資料、特徵、模型和評估的關係,再去看各種演算法。
SHAP(SHapley Additive exPlanations)值常用於分析機器學習模型的輸出行為。下列何者最符合 SHAP 值所提供的資訊?
解析:
SHAP 值基於 Shapley 值的概念,計算每個輸入特徵對單一預測結果的貢獻程度。它能公平地分配各特徵對模型輸出的影響,提供個別預測的可解釋性。
某企業將機器學習模型部署於線上推薦系統。模型在測試階段表現良好,但上線數月後,點擊率與預測準確度逐漸下降。經分析發現,近期使用者行為模式與模型訓練期間的資料特徵出現顯著變化。此現象最可能屬於下列何者?
解析:
使用者行為模式隨時間改變,導致訓練資料的統計特徵不再反映當前情況,這是典型的資料漂移(Data Drift)現象,會影響模型推論效果。
想測試你對 機器學習 的掌握程度? 開始模擬考