階層式分群 是什麼?
Hierarchical Clustering:階層式分群 的完整解釋
階層式分群(Hierarchical Clustering)是一類無監督學習演算法,透過逐步合併最相似的群組(凝聚法)或分裂群組(分裂法)來建立樹狀結構的群組層次,不需預先指定群數。
核心概念
階層式分群(Hierarchical Clustering)建立的不是單一的群組分配,而是一個完整的群組層次結構,以樹狀圖(Dendrogram)視覺化呈現。樹狀圖的每個葉節點代表一個樣本,每個內部節點代表一次合併(或分裂)操作,縱軸高度代表合併時的距離(或不相似度)。
核心特性:
- 不需預設群數:與 k-Means 不同,使用者可在建立完整樹狀圖後,通過「剪樹」(在特定高度截斷 Dendrogram)來決定最終群數
- 確定性:相同資料、相同連結準則,結果完全一致(無隨機初始化問題)
- 可解釋性高:樹狀圖直觀呈現資料的層次結構,適合探索性分析和視覺化報告
- 計算複雜度高:標準凝聚法為 O(n³),改良版(如 SLINK)可降至 O(n² log n),但仍難以應用於百萬級資料集
運作原理
凝聚法(Agglomerative Hierarchical Clustering)步驟:
- 初始化:每個樣本獨立為一個群組,計算所有樣本對的距離矩陣(n×n)
- 迭代:找出距離最小的兩個群組,合併為一個新群組
- 更新距離矩陣:計算新群組與其他所有群組的距離
- 重複步驟 2-3,直到所有樣本合為一群
- 可視化:記錄每次合併的距離,繪製 Dendrogram
連結準則(Linkage Criterion) 是影響分群結果的核心參數,定義兩個群組之間「距離」的計算方式:
- 單連結(Single Linkage):兩群組中最近的兩點距離。容易產生「鏈狀效應」(Chaining Effect),使群組形成長條形,對雜訊敏感。
- 完全連結(Complete Linkage):兩群組中最遠的兩點距離。傾向形成緊湊、大小相近的球形群組。
- 平均連結(Average Linkage / UPGMA):兩群組所有點對的平均距離。折衷方案,較穩健。
- Ward 連結:合併後群組內方差增量最小化。傾向形成大小均等的緊湊群組,效果通常最好,但需要歐氏距離。
如何決定群數:
- 視覺化 Dendrogram,在「長垂直線」(合併距離突然增大)處截斷
- 計算不同群數下的輪廓係數(Silhouette Score),選最大值
- 領域知識驅動(如市場區隔研究中預期有幾種客群)
實際應用
基因體學與生物資訊學:基因表現資料分析中,階層式分群是最早被廣泛應用的場景之一。熱力圖(Heatmap)搭配雙向階層式分群(同時對樣本和基因做 Hierarchical Clustering)已成為生物資訊視覺化的標準格式,幫助研究者識別基因共表現群和樣本亞型。
客戶分群與市場區隔:在客戶資料量較小(如 B2B 的幾百個企業客戶)且需要探索性分析的場景,階層式分群的 Dendrogram 能直觀呈現客戶的層次關係,幫助行銷人員理解市場結構,再決定切割為幾個目標客群。
文件與文字分析:以詞向量或 TF-IDF 表示文件後,用階層式分群建立文件的主題層次結構,適合構建知識庫的目錄樹或新聞分類系統的初始分類框架。
異常偵測前處理:在工業製造品質控制中,階層式分群可用於識別正常產品的群組結構,遠離所有正常群組的孤立樣本即為異常候選,這種基於群組的異常偵測方法直觀且可解釋性強。
常見誤區
誤區一:選什麼連結準則無所謂
連結準則對分群結果影響極大。以圓形環狀資料為例,單連結可正確識別環形結構,但完全連結和 Ward 連結會給出完全不同的分群。沒有普適最優的連結準則:資料形狀、大小均衡性、對雜訊的容忍度都影響選擇。實務建議:Ward 連結是大多數通用場景的合理起點,但應視覺化 Dendrogram 並試驗不同連結準則。
誤區二:階層式分群適合大規模資料
標準凝聚法的時間複雜度為 O(n³),空間複雜度為 O(n²)。對 10,000 個樣本已需數分鐘,對 100,000 個樣本幾乎不可行。大規模資料應優先考慮 k-Means、DBSCAN,或先用 Mini-Batch k-Means 粗略分群後,再對代表性質心做階層式分群。
誤區三:Dendrogram 的截斷點一定清晰
並非所有資料集都有明顯的「截斷高度」,若資料本身沒有自然的群組結構,Dendrogram 不會顯示明顯的分層。此時強行截斷得到的群組可能沒有實際意義,應搭配輪廓係數或業務驗證來確認群組的合理性。
與相關技術的比較
| 演算法 | 需預設群數 | 資料規模 | 群組形狀 | 可解釋性 |
|---|---|---|---|---|
| 階層式分群 | 否 | 小(<10K) | 取決於連結準則 | 高(Dendrogram) |
| k-Means | 是 | 大 | 球形、均等大小 | 中 |
| DBSCAN | 否 | 中大 | 任意形狀 | 中 |
| Gaussian Mixture Model | 是 | 中 | 橢圓形 | 中 |
| OPTICS | 否 | 中大 | 任意形狀、不等密度 | 高(可達性圖) |
選擇分群演算法時,若資料量小、需要探索性分析且需視覺化層次結構,階層式分群是常用選擇;若資料量大且群數已知,k-Means 效率更高;若群組形狀不規則且有雜訊點,DBSCAN 更合適。