非監督式學習 是什麼?

Unsupervised Learning:非監督式學習 的完整解釋

非監督式學習是機器學習方法,讓模型在沒有標籤的輸入資料中,自行探索隱藏的結構與模式

容易混淆

非監督式學習 vs 監督式學習 非監督式學習沒有答案標籤 監督式學習有答案標籤 最關鍵的區別:有沒有標準答案

非監督式學習 vs 分群 非監督式學習是大範圍方法 分群只是其中一種任務 最關鍵的區別:整體方法和子任務

非監督式學習 vs 自動分類 非監督式學習不會直接給你正確類別 它先找相似性和結構 最關鍵的區別:找結構不等於直接貼標籤

記住這句就好

沒答案時,先讓資料自己說出規律。

實際案例

客戶分群 把大量消費紀錄分成幾群,再針對不同群做不同行銷

異常偵測 先學正常資料長什麼樣,再找出很不一樣的點

算法與應用

| 分群 | 找出相似樣本群 | 像 K-means | | 異常偵測 | 找出偏離常態的資料 | 像 Isolation Forest | | 降維 | 把高維資料壓成較低維 | 像 PCA | | 關聯規則 | 找出常一起出現的項目 | 像購物籃分析 |

中英對照與常見說法

說法 出現場合
非監督式學習 台灣正式用語
无监督学习 簡體寫法
Unsupervised Learning 英文原名
無監督學習、非監督學習 常見變體,意思相同

主要任務類型

任務 在做什麼 代表方法
分群(clustering) 把相似的資料分成幾組 K-means、階層式分群、DBSCAN
降維(dimensionality reduction) 用較少的維度保留主要資訊 PCA、t-SNE、UMAP、自編碼器
異常偵測(anomaly detection) 找出跟多數資料不一樣的點 Isolation Forest、One-Class SVM
關聯規則探勘 找出「買了 A 的人也常買 B」 Apriori、FP-Growth
密度估計 建模資料的機率分布 高斯混合模型

沒有標準答案,怎麼知道做得好不好

這是非監督式學習最麻煩的地方:沒有正確答案就沒有準確率可以算。

內部指標只看資料本身。輪廓係數(silhouette score)衡量每個點跟自己這群的距離相對於跟最近鄰群的距離;Davies-Bouldin 指數衡量群內緊密度與群間分離度。它們能幫忙選群數,但高分不等於分群有意義。

外部指標需要部分標註當參考,例如調整後蘭德指數(ARI)。有一小批標註時值得用。

下游任務評估往往最實際:把分群結果或降維後的特徵餵給下游任務,看下游表現有沒有變好。

最後仍需要人看。 分群結果能不能對應到業務上說得通的族群,只有懂業務的人判斷得出來。演算法可以把客戶分成五群,但「這五群各是什麼樣的人」得由人來命名。

常見誤解

不是「不用標註所以比較省」。 省下的是標註成本,但增加了驗證與解讀成本,總成本不一定低。

分群數量通常要自己決定。 K-means 必須先給 K。手肘法與輪廓分數可以輔助,但沒有客觀正確的答案。DBSCAN 不用給群數,但要給密度參數,一樣是人工選擇。

自監督式學習不等於非監督式學習。 自監督式從資料本身造出標籤(遮住一段猜回來),訓練過程仍然是監督式的形式,只是標籤不用人標。現在的大型模型預訓練屬於這一類,習慣上會跟傳統的非監督式方法分開講。

情境判斷

Q1(直覺題):資料完全沒有標籤,先想看大概分成幾類,適合用它嗎? → 適合,這就是非監督式學習很典型的起點。

Q2(判斷題):如果你已經有很多可靠標籤,還一定要用非監督式學習嗎? → 不一定,有標籤時監督式學習通常更直接。

非監督式學習 在 iPAS 考試中的重點

根據歷年統計,非監督式學習 相關題目 平均佔 AI 技術類考題 7%, 屬於高頻考範圍。

常見出題方向:各類學習範式的定義與比較(45%)、適用場景判斷(35%)、演算法優缺點分析(20%)。

相關術語

常見問題

非監督式學習是不是比較不準?

不能這樣比,因為它通常沒有唯一標準答案,重點是結構有沒有用。

它只能做分群嗎?

不是,異常偵測、降維和關聯規則也都屬於它。

結果一定代表真實世界的類別嗎?

不一定,模型只是找相似性,還要回到場景裡驗證。

資料來源

← 回到 非監督式學習 快查頁

測驗你對 非監督式學習 的理解

透過模擬考系統檢驗學習成果

開始測驗