解釋方差比 是什麼?
Explained Variance Ratio:解釋方差比 的完整解釋
降維後每個主成分解釋原始資料總變異量的比例,用於評估降維結果保留了多少資訊。
Explained Variance Ratio(解釋方差比,又稱解釋變異比例)是主成分分析(Principal Component Analysis, PCA)的核心評估指標,幫助研究者和工程師理解降維操作的資訊保留程度。
數學定義
在 PCA 中,原始 d 維資料的協方差矩陣(Covariance Matrix)的特徵值分解得到 d 個特徵值 λ₁ ≥ λ₂ ≥ ... ≥ λd 及對應的特徵向量。每個特徵值代表對應主成分的方差(變異量)。
第 i 個主成分的解釋方差比定義為:
Explained Variance Ratio(i) = λᵢ / Σⱼ λⱼ
即第 i 個特徵值佔所有特徵值總和的比例。
累積解釋方差比(Cumulative Explained Variance Ratio)為前 k 個成分的解釋方差比之和:
Cumulative EVR(k) = Σᵢ₌₁ᵏ λᵢ / Σⱼ λⱼ
選擇主成分數量的策略
門檻法(Threshold Method):選取能解釋一定比例(如 90%、95%、99%)總變異量的最少主成分數。這是最常用的方法,具體門檻取決於應用場景對資訊損失的容忍度。
碎石圖法(Scree Plot):繪製各主成分的解釋方差比或特徵值折線圖,在曲線出現「手肘」(elbow)的地方截斷,保留曲線明顯下降的主成分。
Kaiser 準則:在相關係數矩陣的 PCA 中,保留特徵值大於 1 的成分(代表該成分解釋的方差超過任何單一原始變數)。
在不同降維技術中的應用
PCA(主成分分析):Explained Variance Ratio 是 PCA 的原生指標,scikit-learn 的 PCA 實作直接提供 explained_variance_ratio_ 屬性。
Truncated SVD / LSA:用於稀疏矩陣(如文字的 TF-IDF 矩陣),解釋方差比的概念同樣適用,計算方式為奇異值平方的比例。
Factor Analysis(因子分析):每個因子的解釋方差比有類似含義,但因子分析假設存在潛在隱藏因子,與 PCA 在數學基礎上有所不同。
t-SNE / UMAP:這兩種非線性降維方法不保留全域方差結構,無法定義有意義的 Explained Variance Ratio,通常透過重建誤差(reconstruction error)或 Trustworthiness 指標評估。
實務應用場景
- 特徵工程前處理:在高維資料(如影像像素、基因表達資料)上應用 PCA,選取能解釋 95% 方差的主成分,顯著減少訓練時間同時保留主要資訊。
- 視覺化:將高維資料降至 2 或 3 個主成分做視覺化,通常會報告這 2-3 個成分的累積解釋方差比,讓讀者了解視覺化損失了多少資訊。
- 多重共線性處理:在迴歸分析中,若特徵間高度相關,先用 PCA 降維並保留主要主成分(Principal Component Regression),降低多重共線性影響。
- 人臉辨識(Eigenfaces):早期人臉辨識系統用 PCA 將人臉影像降維,解釋方差比幫助決定保留多少「特徵臉」。
解讀注意事項
Explained Variance Ratio 高不等於降維結果對下游任務(如分類、迴歸)有益。保留 95% 的方差不代表保留了 95% 的分類相關資訊,有時用於區分類別的特徵方差較小(如微小但關鍵的色調差異),反而可能被截掉。因此在有監督學習場景中,應同時以下游任務的指標(如分類準確率)評估降維效果,而不僅依賴解釋方差比。