階層式分群 是什麼?

Hierarchical Clustering:階層式分群 的完整解釋

階層式分群(Hierarchical Clustering)是一類無監督學習演算法,透過逐步合併最相似的群組(凝聚法)或分裂群組(分裂法)來建立樹狀結構的群組層次,不需預先指定群數。

核心概念

階層式分群(Hierarchical Clustering)建立的不是單一的群組分配,而是一個完整的群組層次結構,以樹狀圖(Dendrogram)視覺化呈現。樹狀圖的每個葉節點代表一個樣本,每個內部節點代表一次合併(或分裂)操作,縱軸高度代表合併時的距離(或不相似度)。

核心特性:

  1. 不需預設群數:與 k-Means 不同,使用者可在建立完整樹狀圖後,通過「剪樹」(在特定高度截斷 Dendrogram)來決定最終群數
  2. 確定性:相同資料、相同連結準則,結果完全一致(無隨機初始化問題)
  3. 可解釋性高:樹狀圖直觀呈現資料的層次結構,適合探索性分析和視覺化報告
  4. 計算複雜度高:標準凝聚法為 O(n³),改良版(如 SLINK)可降至 O(n² log n),但仍難以應用於百萬級資料集

運作原理

凝聚法(Agglomerative Hierarchical Clustering)步驟:

  1. 初始化:每個樣本獨立為一個群組,計算所有樣本對的距離矩陣(n×n)
  2. 迭代:找出距離最小的兩個群組,合併為一個新群組
  3. 更新距離矩陣:計算新群組與其他所有群組的距離
  4. 重複步驟 2-3,直到所有樣本合為一群
  5. 可視化:記錄每次合併的距離,繪製 Dendrogram

連結準則(Linkage Criterion) 是影響分群結果的核心參數,定義兩個群組之間「距離」的計算方式:

  • 單連結(Single Linkage):兩群組中最近的兩點距離。容易產生「鏈狀效應」(Chaining Effect),使群組形成長條形,對雜訊敏感。
  • 完全連結(Complete Linkage):兩群組中最遠的兩點距離。傾向形成緊湊、大小相近的球形群組。
  • 平均連結(Average Linkage / UPGMA):兩群組所有點對的平均距離。折衷方案,較穩健。
  • Ward 連結:合併後群組內方差增量最小化。傾向形成大小均等的緊湊群組,效果通常最好,但需要歐氏距離。

如何決定群數:

  1. 視覺化 Dendrogram,在「長垂直線」(合併距離突然增大)處截斷
  2. 計算不同群數下的輪廓係數(Silhouette Score),選最大值
  3. 領域知識驅動(如市場區隔研究中預期有幾種客群)

實際應用

基因體學與生物資訊學:基因表現資料分析中,階層式分群是最早被廣泛應用的場景之一。熱力圖(Heatmap)搭配雙向階層式分群(同時對樣本和基因做 Hierarchical Clustering)已成為生物資訊視覺化的標準格式,幫助研究者識別基因共表現群和樣本亞型。

客戶分群與市場區隔:在客戶資料量較小(如 B2B 的幾百個企業客戶)且需要探索性分析的場景,階層式分群的 Dendrogram 能直觀呈現客戶的層次關係,幫助行銷人員理解市場結構,再決定切割為幾個目標客群。

文件與文字分析:以詞向量或 TF-IDF 表示文件後,用階層式分群建立文件的主題層次結構,適合構建知識庫的目錄樹或新聞分類系統的初始分類框架。

異常偵測前處理:在工業製造品質控制中,階層式分群可用於識別正常產品的群組結構,遠離所有正常群組的孤立樣本即為異常候選,這種基於群組的異常偵測方法直觀且可解釋性強。

常見誤區

誤區一:選什麼連結準則無所謂

連結準則對分群結果影響極大。以圓形環狀資料為例,單連結可正確識別環形結構,但完全連結和 Ward 連結會給出完全不同的分群。沒有普適最優的連結準則:資料形狀、大小均衡性、對雜訊的容忍度都影響選擇。實務建議:Ward 連結是大多數通用場景的合理起點,但應視覺化 Dendrogram 並試驗不同連結準則。

誤區二:階層式分群適合大規模資料

標準凝聚法的時間複雜度為 O(n³),空間複雜度為 O(n²)。對 10,000 個樣本已需數分鐘,對 100,000 個樣本幾乎不可行。大規模資料應優先考慮 k-Means、DBSCAN,或先用 Mini-Batch k-Means 粗略分群後,再對代表性質心做階層式分群。

誤區三:Dendrogram 的截斷點一定清晰

並非所有資料集都有明顯的「截斷高度」,若資料本身沒有自然的群組結構,Dendrogram 不會顯示明顯的分層。此時強行截斷得到的群組可能沒有實際意義,應搭配輪廓係數或業務驗證來確認群組的合理性。

與相關技術的比較

演算法 需預設群數 資料規模 群組形狀 可解釋性
階層式分群 小(<10K) 取決於連結準則 高(Dendrogram)
k-Means 球形、均等大小
DBSCAN 中大 任意形狀
Gaussian Mixture Model 橢圓形
OPTICS 中大 任意形狀、不等密度 高(可達性圖)

選擇分群演算法時,若資料量小、需要探索性分析且需視覺化層次結構,階層式分群是常用選擇;若資料量大且群數已知,k-Means 效率更高;若群組形狀不規則且有雜訊點,DBSCAN 更合適。

常見問題