解釋方差比 是什麼?

Explained Variance Ratio:解釋方差比 的完整解釋

降維後每個主成分解釋原始資料總變異量的比例,用於評估降維結果保留了多少資訊。

Explained Variance Ratio(解釋方差比,又稱解釋變異比例)是主成分分析(Principal Component Analysis, PCA)的核心評估指標,幫助研究者和工程師理解降維操作的資訊保留程度。

數學定義

在 PCA 中,原始 d 維資料的協方差矩陣(Covariance Matrix)的特徵值分解得到 d 個特徵值 λ₁ ≥ λ₂ ≥ ... ≥ λd 及對應的特徵向量。每個特徵值代表對應主成分的方差(變異量)。

第 i 個主成分的解釋方差比定義為:

Explained Variance Ratio(i) = λᵢ / Σⱼ λⱼ

即第 i 個特徵值佔所有特徵值總和的比例。

累積解釋方差比(Cumulative Explained Variance Ratio)為前 k 個成分的解釋方差比之和:

Cumulative EVR(k) = Σᵢ₌₁ᵏ λᵢ / Σⱼ λⱼ

選擇主成分數量的策略

門檻法(Threshold Method):選取能解釋一定比例(如 90%、95%、99%)總變異量的最少主成分數。這是最常用的方法,具體門檻取決於應用場景對資訊損失的容忍度。

碎石圖法(Scree Plot):繪製各主成分的解釋方差比或特徵值折線圖,在曲線出現「手肘」(elbow)的地方截斷,保留曲線明顯下降的主成分。

Kaiser 準則:在相關係數矩陣的 PCA 中,保留特徵值大於 1 的成分(代表該成分解釋的方差超過任何單一原始變數)。

在不同降維技術中的應用

PCA(主成分分析):Explained Variance Ratio 是 PCA 的原生指標,scikit-learn 的 PCA 實作直接提供 explained_variance_ratio_ 屬性。

Truncated SVD / LSA:用於稀疏矩陣(如文字的 TF-IDF 矩陣),解釋方差比的概念同樣適用,計算方式為奇異值平方的比例。

Factor Analysis(因子分析):每個因子的解釋方差比有類似含義,但因子分析假設存在潛在隱藏因子,與 PCA 在數學基礎上有所不同。

t-SNE / UMAP:這兩種非線性降維方法不保留全域方差結構,無法定義有意義的 Explained Variance Ratio,通常透過重建誤差(reconstruction error)或 Trustworthiness 指標評估。

實務應用場景

  • 特徵工程前處理:在高維資料(如影像像素、基因表達資料)上應用 PCA,選取能解釋 95% 方差的主成分,顯著減少訓練時間同時保留主要資訊。
  • 視覺化:將高維資料降至 2 或 3 個主成分做視覺化,通常會報告這 2-3 個成分的累積解釋方差比,讓讀者了解視覺化損失了多少資訊。
  • 多重共線性處理:在迴歸分析中,若特徵間高度相關,先用 PCA 降維並保留主要主成分(Principal Component Regression),降低多重共線性影響。
  • 人臉辨識(Eigenfaces):早期人臉辨識系統用 PCA 將人臉影像降維,解釋方差比幫助決定保留多少「特徵臉」。

解讀注意事項

Explained Variance Ratio 高不等於降維結果對下游任務(如分類、迴歸)有益。保留 95% 的方差不代表保留了 95% 的分類相關資訊,有時用於區分類別的特徵方差較小(如微小但關鍵的色調差異),反而可能被截掉。因此在有監督學習場景中,應同時以下游任務的指標(如分類準確率)評估降維效果,而不僅依賴解釋方差比。

常見問題