相關矩陣 是什麼?
Correlation Matrix:相關矩陣 的完整解釋
量化多個變數兩兩之間線性相關程度的方陣,矩陣中每個元素為對應兩變數的皮爾森相關係數。
相關矩陣是探索性資料分析(EDA)中最重要的診斷工具之一。給定一個有 p 個特徵的資料集,相關矩陣是一個 p×p 的方陣,其中第 i 行第 j 列的元素是特徵 i 與特徵 j 的皮爾森積差相關係數(Pearson Product-Moment Correlation Coefficient)。皮爾森相關係數的計算是兩變數的協方差除以各自標準差的乘積,數學上等價於標準化後的內積,結果範圍為 -1 到 1。
相關係數的解讀有幾個關鍵原則。係數接近 +1 代表強正相關,兩個變數傾向同向變動(一個增大、另一個也增大);接近 -1 代表強負相關,兩者反向變動;接近 0 代表線性相關性弱(但注意,0 相關不代表完全獨立,只代表沒有線性關係,可能存在非線性相關)。通常 |r| > 0.7 視為強相關,0.3 到 0.7 為中等相關,|r| < 0.3 為弱相關。
在機器學習特徵工程中,相關矩陣有三大用途。第一是多重共線性診斷:若兩個特徵高度相關(|r| > 0.9),在線性模型中加入兩者可能造成係數估計不穩定(多重共線性問題),通常應只保留其中一個特徵,或將兩者合併為主成分。第二是特徵選擇:計算每個特徵與目標變數的相關性,高相關特徵(絕對值大)更可能對預測有幫助,可作為特徵重要性的初步篩選指標。第三是特徵群聚分析:透過熱圖(Heatmap)視覺化相關矩陣,可以直觀看出哪些特徵形成一個相關群組,反映它們可能共同測量同一個底層因素。
在深度學習中,相關矩陣的概念延伸到注意力機制(Attention Mechanism)。Transformer 的自注意力機制計算的 Query 和 Key 的內積矩陣,本質上是衡量序列不同位置之間的相關性,再透過 Softmax 正規化成注意力權重。雖然技術上不完全等同於統計意義上的相關矩陣,但概念上有共通之處:都是衡量元素之間的「相似度」或「關聯強度」。
相關矩陣本身只衡量線性相關性,對非線性關係不敏感。為了偵測非線性相關,可以使用斯皮爾曼等級相關係數(Spearman Rank Correlation):它計算排名(Rank)而非原始值的相關性,能捕捉單調非線性關係;或使用肯達爾 τ 係數(Kendall's Tau);或計算互資訊(Mutual Information),後者能偵測任意類型的統計依賴關係(包括非線性與非單調),但計算成本更高。
在主成分分析(PCA)中,相關矩陣(或協方差矩陣)的特徵分解是 PCA 的核心步驟。PCA 的特徵向量(Eigenvector)定義了主成分的方向,特徵值(Eigenvalue)代表各主成分解釋的方差量。分析相關矩陣的特徵值有助於判斷需要保留幾個主成分才能解釋大部分數據變異(通常以解釋累積方差 ≥ 90% 為目標)。
iPAS 考試中相關矩陣的考點包括:皮爾森相關係數的範圍與含義、相關矩陣在特徵工程中的用途(多重共線性診斷、特徵選擇)、相關性與因果關係的區別(「相關不等於因果」是重要考點)、以及皮爾森相關係數與斯皮爾曼等級相關係數的適用情境比較。
相關矩陣是資料科學家與 AI 應用規劃師在接手新資料集時必做的第一步診斷,它能快速揭示資料結構中隱藏的規律,為後續特徵工程、模型選擇和解釋性分析奠定基礎。掌握相關矩陣的正確詮釋方式,以及其局限性(線性假設、對非常態分布敏感、不能捕捉非線性關係),是高品質 AI 專案的基本素養。 相關矩陣(Correlation Matrix)是多元統計分析和機器學習特徵工程中不可缺少的診斷工具,它將多個變數之間的線性相關關係以矩陣形式呈現,使資料科學家能快速識別特徵間的依賴結構。
相關矩陣的每個元素 r(i,j) 代表第 i 個特徵與第 j 個特徵之間的皮爾遜相關係數,取值範圍為 [-1, 1]。相關係數接近 1 表示強正相關(一個增加另一個也增加),接近 -1 表示強負相關,接近 0 表示幾乎無線性關係。矩陣對角線上的值恆為 1(特徵與自身完全相關)。
在特徵選擇中,相關矩陣幫助識別高度共線性的特徵對(通常閾值設為 |r| > 0.85-0.95)。高度相關的特徵在迴歸模型中會導致多重共線性問題,使係數估計不穩定、標準誤差膨脹;即使在樹模型中,高度冗餘特徵也浪費計算資源而不增加預測力。常見處理方式是保留兩個高相關特徵中資訊量更豐富的一個,或使用 PCA 將相關特徵轉換為正交主成分。
在投資組合管理和風險建模中,資產間的相關矩陣是現代投資組合理論(MPT)的核心輸入。通過最小化投資組合方差(需要各資產相關係數),可以在給定預期回報下實現最優風險分散。
相關矩陣的可視化通常使用熱圖(Heatmap)呈現,顏色深淺代表相關強度,這能讓資料科學家一眼識別特徵叢集和異常相關模式。