相關矩陣(Correlation Matrix)是什麼?

量化多個變數兩兩之間線性相關程度的方陣,矩陣中每個元素為對應兩變數的皮爾森相關係數。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Correlation Matrix
主題標籤
特徵工程、統計分析、EDA
考點定位
非 iPAS 核心術語
最後更新
2026/07/30
相關矩陣(Correlation Matrix)是什麼? 特徵工程統計分析
術語快查

搜尋意圖: 如果你在找「相關矩陣 是什麼」或「相關矩陣 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 量化多個變數兩兩之間線性相關程度的方陣,矩陣中每個元素為對應兩變數的皮爾森相關係數。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

量化多個變數兩兩之間線性相關程度的方陣,矩陣中每個元素為對應兩變數的皮爾森相關係數。

相關矩陣是探索性資料分析(EDA)中最重要的診斷工具之一。給定一個有 p 個特徵的資料集,相關矩陣是一個 p×p 的方陣,其中第 i 行第 j 列的元素是特徵 i 與特徵 j 的皮爾森積差相關係數(Pearson Product-Moment Correlation Coefficient)。皮爾森相關係數的計算是兩變數的協方差除以各自標準差的乘積,數學上等價於標準化後的內積,結果範圍為 -1 到 1。

相關係數的解讀有幾個關鍵原則。係數接近 +1 代表強正相關,兩個變數傾向同向變動(一個增大、另一個也增大);接近 -1 代表強負相關,兩者反向變動;接近 0 代表線性相關性弱(但注意,0 相關不代表完全獨立,只代表沒有線性關係,可能存在非線性相關)。通常 |r| > 0.7 視為強相關,0.3 到 0.7 為中等相關,|r| < 0.3 為弱相關。

在機器學習特徵工程中,相關矩陣有三大用途。第一是多重共線性診斷:若兩個特徵高度相關(|r| > 0.9),在線性模型中加入兩者可能造成係數估計不穩定(多重共線性問題),通常應只保留其中一個特徵,或將兩者合併為主成分。第二是特徵選擇:計算每個特徵與目標變數的相關性,高相關特徵(絕對值大)更可能對預測有幫助,可作為特徵重要性的初步篩選指標。第三是特徵群聚分析:透過熱圖(Heatmap)視覺化相關矩陣,可以直觀看出哪些特徵形成一個相關群組,反映它們可能共同測量同一個底層因素。

在深度學習中,相關矩陣的概念延伸到注意力機制(Attention Mechanism)。Transformer 的自注意力機制計算的 Query 和 Key 的內積矩陣,本質上是衡量序列不同位置之間的相關性,再透過 Softmax 正規化成注意力權重。雖然技術上不完全等同於統計意義上的相關矩陣,但概念上有共通之處:都是衡量元素之間的「相似度」或「關聯強度」。

相關矩陣本身只衡量線性相關性,對非線性關係不敏感。為了偵測非線性相關,可以使用斯皮爾曼等級相關係數(Spearman Rank Correlation):它計算排名(Rank)而非原始值的相關性,能捕捉單調非線性關係;或使用肯達爾 τ 係數(Kendall's Tau);或計算互資訊(Mutual Information),後者能偵測任意類型的統計依賴關係(包括非線性與非單調),但計算成本更高。

在主成分分析(PCA)中,相關矩陣(或協方差矩陣)的特徵分解是 PCA 的核心步驟。PCA 的特徵向量(Eigenvector)定義了主成分的方向,特徵值(Eigenvalue)代表各主成分解釋的方差量。分析相關矩陣的特徵值有助於判斷需要保留幾個主成分才能解釋大部分數據變異(通常以解釋累積方差 ≥ 90% 為目標)。

iPAS 考試中相關矩陣的考點包括:皮爾森相關係數的範圍與含義、相關矩陣在特徵工程中的用途(多重共線性診斷、特徵選擇)、相關性與因果關係的區別(「相關不等於因果」是重要考點)、以及皮爾森相關係數與斯皮爾曼等級相關係數的適用情境比較。

相關矩陣是資料科學家與 AI 應用規劃師在接手新資料集時必做的第一步診斷,它能快速揭示資料結構中隱藏的規律,為後續特徵工程、模型選擇和解釋性分析奠定基礎。掌握相關矩陣的正確詮釋方式,以及其局限性(線性假設、對非常態分布敏感、不能捕捉非線性關係),是高品質 AI 專案的基本素養。 相關矩陣(Correlation Matrix)是多元統計分析和機器學習特徵工程中不可缺少的診斷工具,它將多個變數之間的線性相關關係以矩陣形式呈現,使資料科學家能快速識別特徵間的依賴結構。

相關矩陣的每個元素 r(i,j) 代表第 i 個特徵與第 j 個特徵之間的皮爾遜相關係數,取值範圍為 [-1, 1]。相關係數接近 1 表示強正相關(一個增加另一個也增加),接近 -1 表示強負相關,接近 0 表示幾乎無線性關係。矩陣對角線上的值恆為 1(特徵與自身完全相關)。

在特徵選擇中,相關矩陣幫助識別高度共線性的特徵對(通常閾值設為 |r| > 0.85-0.95)。高度相關的特徵在迴歸模型中會導致多重共線性問題,使係數估計不穩定、標準誤差膨脹;即使在樹模型中,高度冗餘特徵也浪費計算資源而不增加預測力。常見處理方式是保留兩個高相關特徵中資訊量更豐富的一個,或使用 PCA 將相關特徵轉換為正交主成分。

在投資組合管理和風險建模中,資產間的相關矩陣是現代投資組合理論(MPT)的核心輸入。通過最小化投資組合方差(需要各資產相關係數),可以在給定預期回報下實現最優風險分散。

相關矩陣的可視化通常使用熱圖(Heatmap)呈現,顏色深淺代表相關強度,這能讓資料科學家一眼識別特徵叢集和異常相關模式。

常見問題

相關矩陣中發現兩個特徵高度相關,應該如何處理?

當兩個特徵的相關係數絕對值超過 0.9,通常需要處理多重共線性問題,但具體做法取決於使用的模型。在線性迴歸、邏輯斯迴歸等線性模型中,高度相關的特徵會使係數估計不穩定(標準誤差大、係數符號可能反轉),應刪除其中一個(通常保留業務意義更清晰的那個),或用 PCA 將兩者合併為一個主成分。在決策樹、Random Forest、XGBoost 等非線性模型中,多重共線性影響較小,保留兩個相關特徵不一定有害,模型會自行選擇更有預測力的一個。另一個選項是計算 VIF(方差膨脹因子),VIF > 10 通常是需要處理的閾值。

相關係數高是否代表有因果關係?

相關性不等於因果性,這是統計學中最重要的原則之一。相關矩陣只能反映變數之間的線性協變程度,無法推斷方向性或機制。經典例子:冰淇淋銷售量與溺水事件高度相關,但前者不是後者的原因,而是因為兩者都受到「夏天氣溫高」這個潛在變數驅動(混淆變數問題)。在 AI 模型中,即使兩個特徵高度相關,也不代表其中一個「導致」另一個。推斷因果關係需要設計對照實驗(如 A/B 測試)或使用因果推斷方法(如 Difference-in-Differences、工具變數法),而非僅靠相關矩陣。iPAS 考試中「相關不等於因果」常作為概念判斷題的干擾選項,需要特別注意。

皮爾森相關係數和斯皮爾曼相關係數有什麼不同,何時選哪個?

皮爾森相關係數衡量兩個連續變數之間的線性關係,假設資料服從常態分布;斯皮爾曼等級相關係數則對資料的排名計算皮爾森係數,能捕捉單調非線性關係,且對離群值更穩健。選擇原則是:若資料符合常態分布、關係接近線性,用皮爾森;若資料有明顯離群值、分布偏態、或變數之間關係是單調非線性(如指數關係),用斯皮爾曼。例如收入與幸福感的關係通常呈對數曲線(收入從低到中提升幸福感很多,高收入後效益遞減),用斯皮爾曼比皮爾森更能反映這種單調遞增但非線性的關係。在 iPAS 考試中,常以「資料含有離群值」或「分布明顯不符常態」作為選擇斯皮爾曼的判斷依據。