搜尋意圖: 如果你在找「共變異矩陣 是什麼」或「共變異矩陣 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 描述多個隨機變數兩兩之間線性相關程度與各自變異數的對稱方陣。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
描述多個隨機變數兩兩之間線性相關程度與各自變異數的對稱方陣。
共變異矩陣(Covariance Matrix),在統計學和機器學習中也常稱為協方差矩陣,是多變量分析的基礎數學工具。對於一個 d 維隨機向量 X = (X_1, X_2, ..., X_d),其共變異矩陣 Σ(Sigma)是一個 d × d 的對稱半正定矩陣,定義為:
Σ_{ij} = Cov(X_i, X_j) = E[(X_i - μ_i)(X_j - μ_j)]
其中 μ_i 是 X_i 的期望值。
矩陣結構解讀
- 對角線元素 Σ_{ii} = Var(X_i):第 i 個變數自身的變異數,衡量該變數的離散程度。
- 非對角線元素 Σ_{ij}(i ≠ j):第 i 和第 j 個變數之間的共變異數,衡量兩個變數線性協同變化的趨勢。Cov > 0 表示同向變化,Cov < 0 表示反向變化,Cov = 0 表示線性無關(注意:線性無關不代表統計獨立)。
- 對稱性:Cov(X_i, X_j) = Cov(X_j, X_i),因此共變異矩陣一定是對稱矩陣。
- 半正定性:對於任意非零向量 v,v^T Σ v ≥ 0,這源自變異數非負的基本性質。
與相關矩陣的關係
共變異矩陣的值受各變數的量綱影響(若 X_1 以公尺為單位,改為公分後共變異數會變大),不同量綱的變數之間的共變異數難以直接比較。相關矩陣(Correlation Matrix)是將共變異矩陣標準化後的版本,其元素為 Pearson 相關係數 ρ_{ij} = Σ_{ij} / (σ_i × σ_j),值域為 [-1, 1],不受量綱影響。
機器學習中的應用
主成分分析(PCA):PCA 的核心步驟是對標準化後的資料計算共變異矩陣,然後進行特徵分解(eigendecomposition),取最大特徵值對應的特徵向量作為主成分方向。PCA 的幾何意義是:找出資料方差最大的方向,共變異矩陣完整編碼了資料在各方向上的方差資訊。
高斯判別分析(GDA)與線性判別分析(LDA):這類模型假設各類別的特徵服從多變量常態分布,共變異矩陣是模型的關鍵參數,決定了分類邊界的形狀。
多變量常態分布(Multivariate Normal Distribution):N(μ, Σ) 唯一由均值向量 μ 和共變異矩陣 Σ 決定,許多貝葉斯模型、卡爾曼濾波等均以此為基礎。
馬哈拉諾比斯距離(Mahalanobis Distance):考慮特徵間相關性的距離度量,定義為 D(x) = √((x-μ)^T Σ^{-1} (x-μ)),在異常值偵測和分類中有重要應用。
高斯過程(Gaussian Process):用於回歸和貝葉斯優化(Bayesian Optimization),其核函數決定了觀測點之間的共變異結構。
計算與估計
在實際資料中,真實的共變異矩陣 Σ 是未知的,需要從樣本估計。樣本共變異矩陣 S 是 Σ 的無偏估計:
S = (1/(n-1)) × Σ_i (x_i - x̄)(x_i - x̄)^T
高維資料的挑戰(p >> n 問題) 當特徵維度 p 遠大於樣本數 n 時,樣本共變異矩陣可能是奇異矩陣(singular),無法求逆,導致許多依賴 Σ^{-1} 的方法(如 LDA、馬哈拉諾比斯距離)失效。常見解決方案包含:Shrinkage 估計(如 Ledoit-Wolf 估計)、正則化(如在對角線加 λI),或先用 PCA 降維再估計共變異矩陣。
常見問題
共變異矩陣和相關矩陣有什麼差別,什麼時候用哪個?
共變異矩陣保留了各變數原始量綱的資訊(元素值受單位影響),相關矩陣是標準化版本(元素值在 -1 到 1 之間,不受單位影響)。在 PCA 中,若各特徵的量綱差異很大(如年齡以歲計、薪資以萬元計),直接對共變異矩陣做 PCA 會讓數值範圍大的特徵主導主成分;此時應先標準化再做 PCA(等效於對相關矩陣做 PCA)。若各特徵量綱相同(如多個物理感測器的相同單位讀數),對共變異矩陣做 PCA 可保留原始方差資訊。
PCA 為什麼要用到共變異矩陣?
PCA 的目標是找到資料方差最大的方向(即主成分),而共變異矩陣正好完整描述了資料在各方向的方差分布。對共變異矩陣做特徵分解(eigendecomposition),得到的特徵向量就是主成分的方向,對應的特徵值就是該方向上的方差大小。選取最大的幾個特徵值對應的特徵向量,就能找到保留最多原始資訊(方差)的低維子空間,這正是 PCA 降維的幾何本質。
特徵之間的共變異數為 0,代表它們互相獨立嗎?
不一定。共變異數(或相關係數)衡量的只是兩個變數之間的線性關係;共變異數為 0 只代表「線性無關」(linearly uncorrelated),但兩個變數之間仍可能存在非線性關係,例如 X 與 X^2 的共變異數在 X 對稱分布時為 0,但 X 和 X^2 顯然有強烈的依賴關係。統計獨立(independence)是更強的條件,意味著所有類型的關係(線性與非線性)都不存在。對於多變量常態分布,線性無關與獨立是等價的,這是常態分布的特殊性質。