解釋方差比(Explained Variance Ratio)是什麼?

降維後每個主成分解釋原始資料總變異量的比例,用於評估降維結果保留了多少資訊。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Explained Variance Ratio
主題標籤
Explained Variance Ratio、解釋方差比、PCA
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
解釋方差比(Explained Variance Ratio)是什麼? Explained Variance Ratio解釋方差比
術語快查

搜尋意圖: 如果你在找「解釋方差比 是什麼」或「解釋方差比 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 降維後每個主成分解釋原始資料總變異量的比例,用於評估降維結果保留了多少資訊。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

降維後每個主成分解釋原始資料總變異量的比例,用於評估降維結果保留了多少資訊。

Explained Variance Ratio(解釋方差比,又稱解釋變異比例)是主成分分析(Principal Component Analysis, PCA)的核心評估指標,幫助研究者和工程師理解降維操作的資訊保留程度。

數學定義

在 PCA 中,原始 d 維資料的協方差矩陣(Covariance Matrix)的特徵值分解得到 d 個特徵值 λ₁ ≥ λ₂ ≥ ... ≥ λd 及對應的特徵向量。每個特徵值代表對應主成分的方差(變異量)。

第 i 個主成分的解釋方差比定義為:

Explained Variance Ratio(i) = λᵢ / Σⱼ λⱼ

即第 i 個特徵值佔所有特徵值總和的比例。

累積解釋方差比(Cumulative Explained Variance Ratio)為前 k 個成分的解釋方差比之和:

Cumulative EVR(k) = Σᵢ₌₁ᵏ λᵢ / Σⱼ λⱼ

選擇主成分數量的策略

門檻法(Threshold Method):選取能解釋一定比例(如 90%、95%、99%)總變異量的最少主成分數。這是最常用的方法,具體門檻取決於應用場景對資訊損失的容忍度。

碎石圖法(Scree Plot):繪製各主成分的解釋方差比或特徵值折線圖,在曲線出現「手肘」(elbow)的地方截斷,保留曲線明顯下降的主成分。

Kaiser 準則:在相關係數矩陣的 PCA 中,保留特徵值大於 1 的成分(代表該成分解釋的方差超過任何單一原始變數)。

在不同降維技術中的應用

PCA(主成分分析):Explained Variance Ratio 是 PCA 的原生指標,scikit-learn 的 PCA 實作直接提供 explained_variance_ratio_ 屬性。

Truncated SVD / LSA:用於稀疏矩陣(如文字的 TF-IDF 矩陣),解釋方差比的概念同樣適用,計算方式為奇異值平方的比例。

Factor Analysis(因子分析):每個因子的解釋方差比有類似含義,但因子分析假設存在潛在隱藏因子,與 PCA 在數學基礎上有所不同。

t-SNE / UMAP:這兩種非線性降維方法不保留全域方差結構,無法定義有意義的 Explained Variance Ratio,通常透過重建誤差(reconstruction error)或 Trustworthiness 指標評估。

實務應用場景

  • 特徵工程前處理:在高維資料(如影像像素、基因表達資料)上應用 PCA,選取能解釋 95% 方差的主成分,顯著減少訓練時間同時保留主要資訊。
  • 視覺化:將高維資料降至 2 或 3 個主成分做視覺化,通常會報告這 2-3 個成分的累積解釋方差比,讓讀者了解視覺化損失了多少資訊。
  • 多重共線性處理:在迴歸分析中,若特徵間高度相關,先用 PCA 降維並保留主要主成分(Principal Component Regression),降低多重共線性影響。
  • 人臉辨識(Eigenfaces):早期人臉辨識系統用 PCA 將人臉影像降維,解釋方差比幫助決定保留多少「特徵臉」。

解讀注意事項

Explained Variance Ratio 高不等於降維結果對下游任務(如分類、迴歸)有益。保留 95% 的方差不代表保留了 95% 的分類相關資訊,有時用於區分類別的特徵方差較小(如微小但關鍵的色調差異),反而可能被截掉。因此在有監督學習場景中,應同時以下游任務的指標(如分類準確率)評估降維效果,而不僅依賴解釋方差比。

常見問題

選擇保留多少主成分時,解釋方差比要達到多少才夠?

沒有通用的標準門檻,取決於應用場景。在資料探索性分析中,選擇能解釋 70-80% 變異量的主成分,通常足以發現主要結構。在機器學習特徵工程中,保留能解釋 90-95% 的主成分是常見做法,兼顧資訊保留與維度壓縮。在基因體學、神經影像等高噪音領域,即使保留 60-70% 的方差也可能已經去除了大量噪音,反而有助於提升模型泛化能力。若下游任務對精度要求高,可以系統地測試不同主成分數量下的任務指標,選取模型表現開始趨於平緩的那個點。建議同時繪製碎石圖和累積解釋方差比曲線,兩者結合判斷,不要只依賴單一門檻值。

為什麼視覺化時通常取前兩個主成分?這樣做有什麼限制?

取前兩個主成分(PC1 和 PC2)是因為人眼最容易理解二維散點圖,且 PCA 保證前兩個成分是解釋方差最多的兩個方向,若資料存在明顯的低維結構,這兩個成分通常能捕捉最重要的模式。限制在於:第一,若資料需要更高維度才能表達,二維視覺化可能嚴重失真,不同類別可能在二維中重疊,但在更高維空間其實是可分的;第二,PCA 是線性降維,無法捕捉非線性結構,這時 t-SNE 或 UMAP 可能提供更好的視覺化效果;第三,解釋方差比低的視覺化可信度較低,應在圖表中標明 PC1 和 PC2 分別解釋了多少方差,讓讀者判斷這個視覺化代表性如何。

Explained Variance Ratio 與 R² 有什麼關係?

兩者概念相近但應用場景不同。迴歸分析中的 R²(決定係數)衡量一個迴歸模型能解釋目標變數變異量的比例,反映模型對因變數的解釋能力。PCA 中的 Explained Variance Ratio 則衡量主成分能解釋原始多維資料總變異量的比例,沒有明確的「目標變數」,是無監督的。在 Principal Component Regression(PCR)中兩者都會出現:先用 PCA 的 Explained Variance Ratio 選取主成分,再用選定的主成分做迴歸並計算 R²。兩者的數學形式相似(均為 SSR/SST 形式),但解讀對象不同:Explained Variance Ratio 描述降維對多維輸入的保留程度,R² 描述模型對單一輸出的預測能力。