機器學習 是什麼?
Machine Learning:機器學習 的完整解釋
機器學習讓電腦透過分析大量資料自動找出規律,無需明確程式指令即可完成預測與分類任務
容易混淆
機器學習 vs 深度學習 深度學習是機器學習的一部分,通常靠多層神經網路學特徵。 一個是大傘,一個是子集合。
機器學習 vs 傳統程式設計 傳統程式設計是人先寫規則,機器學習是人先給資料。 一個靠規則,一個靠經驗。
最關鍵的區別: 先寫規則,還是先餵資料。
記住這句就好
資料夠好,模型才學得像樣。
實際案例
信用評分 銀行用歷史資料學出違約風險,讓審核更快也更一致。
商品推薦 電商看使用者點擊和購買紀錄,學出下一個可能想看的商品。
算法與應用
典型流程是資料收集、清理、特徵處理、模型訓練、評估和上線。 機器學習不是單一演算法,而是一整套從資料到決策的方法群。 資料品質、特徵設計和評估方式,常常比模型名字更重要。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 機器學習 | 台灣正式用語 |
| 机器学习 | 簡體寫法 |
| Machine Learning | 英文原名 |
| ML | 標準縮寫 |
| 機械學習 | 少見的舊譯法 |
三大學習範式
| 範式 | 資料長什麼樣 | 在學什麼 | 代表任務 |
|---|---|---|---|
| 監督式學習 | 有輸入也有正確答案 | 從輸入預測答案 | 分類、迴歸 |
| 非監督式學習 | 只有輸入,沒有答案 | 找出資料本身的結構 | 分群、降維、異常偵測 |
| 強化學習 | 沒有標準答案,只有環境給的獎勵 | 在環境裡採取行動最大化長期回報 | 遊戲、控制、推薦策略 |
中間還有半監督式學習(少量標註加大量未標註)與自監督式學習(從資料本身構造預測任務,例如遮住一部分猜回來)。現在的大型語言模型與影像基礎模型,預訓練階段用的都是自監督式學習,這是它們能吃下網路規模資料的原因。
人工智慧、機器學習、深度學習的包含關係
人工智慧(AI) 是最大的傘,包含所有讓機器展現智慧行為的方法,包括早年純手寫規則的專家系統。
機器學習 是 AI 底下的一支,特色是從資料裡學規律,而不是由人把規律寫死。
深度學習 是機器學習底下的一支,用多層神經網路自動學特徵。
生成式 AI 是應用型態的分類,不是層級的一層,它多半用深度學習實作,但重點在於輸出是新內容而不是一個標籤或數字。
一句話:所有深度學習都是機器學習,所有機器學習都是 AI,但反過來都不成立。
完整流程與最容易出錯的地方
定義問題與成功指標、收集資料、探索與清理、切分訓練與驗證與測試集、特徵處理、訓練、評估、調參、部署、監控。
最容易出錯的兩步是第一步與第四步。
第一步,把商業問題翻譯成機器學習問題翻錯,後面做得再漂亮也沒用。「提高營收」不是機器學習問題,「預測哪些客戶下個月會流失」才是。
第四步,切分方式錯誤造成資料洩漏。時間序列資料必須依時間切,不能隨機切,否則等於用未來預測過去。同一個使用者的多筆資料必須整組分到同一邊,否則模型在測試集上看到的是它訓練時已經認識的人。
情境判斷
Q1(直覺題): 當規則很難手寫完,該考慮哪一類方法?
→ 機器學習,因為它能從資料裡自己找規律。
Q2(判斷題): 機器學習一定比手寫規則好嗎?
→ 不一定,簡單明確的問題,傳統規則反而可能更快更穩。
機器學習 在 iPAS 考試中的重點
根據歷年統計,機器學習 相關題目 平均佔 AI 技術類考題 8%, 屬於高頻考範圍。
常見出題方向:機器學習基本原理與目的(40%)、模型訓練與泛化機制(40%)、過擬合與欠擬合辨別(20%)。
相關術語
常見問題
機器學習一定要很多資料嗎?
通常資料越多越好,但也要看問題難度和資料品質。
機器學習是不是什麼都能做?
不是,它很依賴資料和目標,資料差時效果也會差。
學機器學習最先該懂什麼?
先懂資料、特徵、模型和評估的關係,再去看各種演算法。
資料來源
- iPAS AI 應用規劃師評鑑內容範圍參考(115.02) ,經濟部產業人才能力鑑定