非監督式學習 是什麼?
Unsupervised Learning:非監督式學習 的完整解釋
非監督式學習是機器學習方法,讓模型在沒有標籤的輸入資料中,自行探索隱藏的結構與模式
容易混淆
非監督式學習 vs 監督式學習 非監督式學習沒有答案標籤 監督式學習有答案標籤 最關鍵的區別:有沒有標準答案
非監督式學習 vs 分群 非監督式學習是大範圍方法 分群只是其中一種任務 最關鍵的區別:整體方法和子任務
非監督式學習 vs 自動分類 非監督式學習不會直接給你正確類別 它先找相似性和結構 最關鍵的區別:找結構不等於直接貼標籤
記住這句就好
沒答案時,先讓資料自己說出規律。
實際案例
客戶分群 把大量消費紀錄分成幾群,再針對不同群做不同行銷
異常偵測 先學正常資料長什麼樣,再找出很不一樣的點
算法與應用
| 分群 | 找出相似樣本群 | 像 K-means | | 異常偵測 | 找出偏離常態的資料 | 像 Isolation Forest | | 降維 | 把高維資料壓成較低維 | 像 PCA | | 關聯規則 | 找出常一起出現的項目 | 像購物籃分析 |
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 非監督式學習 | 台灣正式用語 |
| 无监督学习 | 簡體寫法 |
| Unsupervised Learning | 英文原名 |
| 無監督學習、非監督學習 | 常見變體,意思相同 |
主要任務類型
| 任務 | 在做什麼 | 代表方法 |
|---|---|---|
| 分群(clustering) | 把相似的資料分成幾組 | K-means、階層式分群、DBSCAN |
| 降維(dimensionality reduction) | 用較少的維度保留主要資訊 | PCA、t-SNE、UMAP、自編碼器 |
| 異常偵測(anomaly detection) | 找出跟多數資料不一樣的點 | Isolation Forest、One-Class SVM |
| 關聯規則探勘 | 找出「買了 A 的人也常買 B」 | Apriori、FP-Growth |
| 密度估計 | 建模資料的機率分布 | 高斯混合模型 |
沒有標準答案,怎麼知道做得好不好
這是非監督式學習最麻煩的地方:沒有正確答案就沒有準確率可以算。
內部指標只看資料本身。輪廓係數(silhouette score)衡量每個點跟自己這群的距離相對於跟最近鄰群的距離;Davies-Bouldin 指數衡量群內緊密度與群間分離度。它們能幫忙選群數,但高分不等於分群有意義。
外部指標需要部分標註當參考,例如調整後蘭德指數(ARI)。有一小批標註時值得用。
下游任務評估往往最實際:把分群結果或降維後的特徵餵給下游任務,看下游表現有沒有變好。
最後仍需要人看。 分群結果能不能對應到業務上說得通的族群,只有懂業務的人判斷得出來。演算法可以把客戶分成五群,但「這五群各是什麼樣的人」得由人來命名。
常見誤解
不是「不用標註所以比較省」。 省下的是標註成本,但增加了驗證與解讀成本,總成本不一定低。
分群數量通常要自己決定。 K-means 必須先給 K。手肘法與輪廓分數可以輔助,但沒有客觀正確的答案。DBSCAN 不用給群數,但要給密度參數,一樣是人工選擇。
自監督式學習不等於非監督式學習。 自監督式從資料本身造出標籤(遮住一段猜回來),訓練過程仍然是監督式的形式,只是標籤不用人標。現在的大型模型預訓練屬於這一類,習慣上會跟傳統的非監督式方法分開講。
情境判斷
Q1(直覺題):資料完全沒有標籤,先想看大概分成幾類,適合用它嗎? → 適合,這就是非監督式學習很典型的起點。
Q2(判斷題):如果你已經有很多可靠標籤,還一定要用非監督式學習嗎? → 不一定,有標籤時監督式學習通常更直接。
非監督式學習 在 iPAS 考試中的重點
根據歷年統計,非監督式學習 相關題目 平均佔 AI 技術類考題 7%, 屬於高頻考範圍。
常見出題方向:各類學習範式的定義與比較(45%)、適用場景判斷(35%)、演算法優缺點分析(20%)。
相關術語
常見問題
非監督式學習是不是比較不準?
不能這樣比,因為它通常沒有唯一標準答案,重點是結構有沒有用。
它只能做分群嗎?
不是,異常偵測、降維和關聯規則也都屬於它。
結果一定代表真實世界的類別嗎?
不一定,模型只是找相似性,還要回到場景裡驗證。
資料來源
- iPAS AI 應用規劃師評鑑內容範圍參考(115.02) ,經濟部產業人才能力鑑定