普通最小平方法 是什麼?
OLS:普通最小平方法 的完整解釋
透過最小化殘差平方和來估計線性回歸模型係數的統計方法。
普通最小平方法(Ordinary Least Squares,OLS)是統計學與機器學習領域中歷史最悠久、應用最廣泛的線性回歸估計方法之一。其核心概念源自 19 世紀初高斯與勒讓德各自獨立提出的數學原理,至今仍是計量經濟學、社會科學、工程分析等領域的基礎工具。
OLS 的基本思想是:給定一組觀測資料,找到一條(或多維度的超平面)使得所有觀測值與模型預測值之間的差值(稱為殘差)的平方和達到最小。數學上,若我們有 n 個觀測值,每個觀測值包含因變數 y 與自變數向量 x,OLS 便是找到係數向量 β,使得目標函式 S(β) = Σ(yᵢ - xᵢᵀβ)² 最小化。對此目標函式求導並令其為零,可得到正規方程式,其解析解為 β̂ = (XᵀX)⁻¹Xᵀy,其中 X 是設計矩陣。
要讓 OLS 估計量具備良好的統計性質,需要滿足高斯-馬可夫假設:線性關係、隨機抽樣、無完全共線性、誤差期望值為零(嚴格外生性),以及同質性(誤差的條件變異數為常數)。在這些假設成立的條件下,可以證明 OLS 估計量是 BLUE(Best Linear Unbiased Estimator),意即在所有線性無偏估計量中,OLS 的估計量擁有最小的抽樣變異數,這一結論被稱為高斯-馬可夫定理。
在 AI 與機器學習的脈絡中,OLS 是理解更複雜模型的起點。許多深度學習中的損失函式設計(如均方誤差損失 MSE Loss)本質上延續了 OLS 的最小化殘差平方和的思想。同時,當神經網路的最後一層為線性輸出層且損失為 MSE 時,若資料量足夠小,其解析解等同於 OLS 估計。
OLS 在實踐中有幾個重要的應用場景。第一,在特徵工程階段,研究者常先用 OLS 做線性基準模型,評估各特徵的統計顯著性(t 統計量與 p 值),篩選有預測力的變數。第二,OLS 的係數可直接解釋為邊際效應,例如在控制其他變數不變的條件下,某特徵增加一個單位時因變數的預期變化量,這種可解釋性在黑盒模型盛行的當下依然具有重要的輔助診斷價值。第三,OLS 殘差分析(殘差圖、Q-Q 圖、Durbin-Watson 統計量)是模型診斷的標準流程,有助於偵測異質性、自相關與非線性問題。
當高斯-馬可夫假設不成立時,OLS 估計量雖仍無偏但不再是變異數最小的估計量,此時需要考慮替代方案:若存在異質性(heteroskedasticity),可改用加權最小平方法(WLS)或使用穩健標準誤(Robust Standard Errors);若存在自相關(autocorrelation),可使用廣義最小平方法(GLS);若存在嚴重共線性,則可考慮嶺回歸(Ridge Regression)或 LASSO 等正規化方法。
IPAS 中級考試常考的 OLS 相關知識點包括:BLUE 條件的判斷、殘差的統計性質、如何從散佈圖辨識是否適合 OLS、以及 OLS 與其他估計方法的選用時機。考生須能區分「OLS 係數估計無偏」與「OLS 預測不通常優於其他方法」這兩個不同層次的主張,並理解 R² 值的含義與侷限性。
在 Python 生態系中,statsmodels 套件提供了最完整的 OLS 實作,不只輸出係數,還同時提供 t 統計量、p 值、信賴區間、R²、調整後 R²、F 統計量與 Durbin-Watson 統計量等完整的統計摘要,適合需要統計推論的場景。scikit-learn 的 LinearRegression 則以預測為導向,API 簡潔但不輸出 p 值等推論資訊,適合機器學習 Pipeline 整合。在選擇工具時,若目標是理解變數關係與顯著性,使用 statsmodels;若目標是建立預測模型並與其他 ML 方法比較,使用 scikit-learn。
總結而言,OLS 是線性模型估計的基石方法,其數學原理清晰、計算效率高、結果可解釋性強,是學習統計建模與機器學習必備的基礎概念。理解 OLS 的假設、性質與侷限,有助於在面對實際問題時做出更恰當的模型選擇。