共變異矩陣 是什麼?

Covariance Matrix:共變異矩陣 的完整解釋

描述多個隨機變數兩兩之間線性相關程度與各自變異數的對稱方陣。

共變異矩陣(Covariance Matrix),在統計學和機器學習中也常稱為協方差矩陣,是多變量分析的基礎數學工具。對於一個 d 維隨機向量 X = (X_1, X_2, ..., X_d),其共變異矩陣 Σ(Sigma)是一個 d × d 的對稱半正定矩陣,定義為:

Σ_{ij} = Cov(X_i, X_j) = E[(X_i - μ_i)(X_j - μ_j)]

其中 μ_i 是 X_i 的期望值。

矩陣結構解讀

  • 對角線元素 Σ_{ii} = Var(X_i):第 i 個變數自身的變異數,衡量該變數的離散程度。
  • 非對角線元素 Σ_{ij}(i ≠ j):第 i 和第 j 個變數之間的共變異數,衡量兩個變數線性協同變化的趨勢。Cov > 0 表示同向變化,Cov < 0 表示反向變化,Cov = 0 表示線性無關(注意:線性無關不代表統計獨立)。
  • 對稱性:Cov(X_i, X_j) = Cov(X_j, X_i),因此共變異矩陣一定是對稱矩陣。
  • 半正定性:對於任意非零向量 v,v^T Σ v ≥ 0,這源自變異數非負的基本性質。

與相關矩陣的關係

共變異矩陣的值受各變數的量綱影響(若 X_1 以公尺為單位,改為公分後共變異數會變大),不同量綱的變數之間的共變異數難以直接比較。相關矩陣(Correlation Matrix)是將共變異矩陣標準化後的版本,其元素為 Pearson 相關係數 ρ_{ij} = Σ_{ij} / (σ_i × σ_j),值域為 [-1, 1],不受量綱影響。

機器學習中的應用

  1. 主成分分析(PCA):PCA 的核心步驟是對標準化後的資料計算共變異矩陣,然後進行特徵分解(eigendecomposition),取最大特徵值對應的特徵向量作為主成分方向。PCA 的幾何意義是:找出資料方差最大的方向,共變異矩陣完整編碼了資料在各方向上的方差資訊。

  2. 高斯判別分析(GDA)與線性判別分析(LDA):這類模型假設各類別的特徵服從多變量常態分布,共變異矩陣是模型的關鍵參數,決定了分類邊界的形狀。

  3. 多變量常態分布(Multivariate Normal Distribution):N(μ, Σ) 唯一由均值向量 μ 和共變異矩陣 Σ 決定,許多貝葉斯模型、卡爾曼濾波等均以此為基礎。

  4. 馬哈拉諾比斯距離(Mahalanobis Distance):考慮特徵間相關性的距離度量,定義為 D(x) = √((x-μ)^T Σ^{-1} (x-μ)),在異常值偵測和分類中有重要應用。

  5. 高斯過程(Gaussian Process):用於回歸和貝葉斯優化(Bayesian Optimization),其核函數決定了觀測點之間的共變異結構。

計算與估計

在實際資料中,真實的共變異矩陣 Σ 是未知的,需要從樣本估計。樣本共變異矩陣 S 是 Σ 的無偏估計:

S = (1/(n-1)) × Σ_i (x_i - x̄)(x_i - x̄)^T

高維資料的挑戰(p >> n 問題) 當特徵維度 p 遠大於樣本數 n 時,樣本共變異矩陣可能是奇異矩陣(singular),無法求逆,導致許多依賴 Σ^{-1} 的方法(如 LDA、馬哈拉諾比斯距離)失效。常見解決方案包含:Shrinkage 估計(如 Ledoit-Wolf 估計)、正則化(如在對角線加 λI),或先用 PCA 降維再估計共變異矩陣。

常見問題