---
title: "普通最小平方法（OLS）"
slug: ols
language: zh-TW
source: https://aiterms.tw/learning/what-is-ols
updated_at: 2026-06-22
tags: [統計方法, 線性回歸, 機器學習基礎, iPAS中級, 估計量, 計量經濟]
ipas_term: false
type: deep-dive
---

# 普通最小平方法 是什麼？

> 透過最小化殘差平方和來估計線性回歸模型係數的統計方法。

普通最小平方法（Ordinary Least Squares，OLS）是統計學與機器學習領域中歷史最悠久、應用最廣泛的線性回歸估計方法之一。其核心概念源自 19 世紀初高斯與勒讓德各自獨立提出的數學原理，至今仍是計量經濟學、社會科學、工程分析等領域的基礎工具。

OLS 的基本思想是：給定一組觀測資料，找到一條（或多維度的超平面）使得所有觀測值與模型預測值之間的差值（稱為殘差）的平方和達到最小。數學上，若我們有 n 個觀測值，每個觀測值包含因變數 y 與自變數向量 x，OLS 便是找到係數向量 β，使得目標函式 S(β) = Σ(yᵢ - xᵢᵀβ)² 最小化。對此目標函式求導並令其為零，可得到正規方程式，其解析解為 β̂ = (XᵀX)⁻¹Xᵀy，其中 X 是設計矩陣。

要讓 OLS 估計量具備良好的統計性質，需要滿足高斯-馬可夫假設：線性關係、隨機抽樣、無完全共線性、誤差期望值為零（嚴格外生性），以及同質性（誤差的條件變異數為常數）。在這些假設成立的條件下，可以證明 OLS 估計量是 BLUE（Best Linear Unbiased Estimator），意即在所有線性無偏估計量中，OLS 的估計量擁有最小的抽樣變異數，這一結論被稱為高斯-馬可夫定理。

在 AI 與機器學習的脈絡中，OLS 是理解更複雜模型的起點。許多深度學習中的損失函式設計（如均方誤差損失 MSE Loss）本質上延續了 OLS 的最小化殘差平方和的思想。同時，當神經網路的最後一層為線性輸出層且損失為 MSE 時，若資料量足夠小，其解析解等同於 OLS 估計。

OLS 在實踐中有幾個重要的應用場景。第一，在特徵工程階段，研究者常先用 OLS 做線性基準模型，評估各特徵的統計顯著性（t 統計量與 p 值），篩選有預測力的變數。第二，OLS 的係數可直接解釋為邊際效應，例如在控制其他變數不變的條件下，某特徵增加一個單位時因變數的預期變化量，這種可解釋性在黑盒模型盛行的當下依然具有重要的輔助診斷價值。第三，OLS 殘差分析（殘差圖、Q-Q 圖、Durbin-Watson 統計量）是模型診斷的標準流程，有助於偵測異質性、自相關與非線性問題。

當高斯-馬可夫假設不成立時，OLS 估計量雖仍無偏但不再是變異數最小的估計量，此時需要考慮替代方案：若存在異質性（heteroskedasticity），可改用加權最小平方法（WLS）或使用穩健標準誤（Robust Standard Errors）；若存在自相關（autocorrelation），可使用廣義最小平方法（GLS）；若存在嚴重共線性，則可考慮嶺回歸（Ridge Regression）或 LASSO 等正規化方法。

IPAS 中級考試常考的 OLS 相關知識點包括：BLUE 條件的判斷、殘差的統計性質、如何從散佈圖辨識是否適合 OLS、以及 OLS 與其他估計方法的選用時機。考生須能區分「OLS 係數估計無偏」與「OLS 預測不通常優於其他方法」這兩個不同層次的主張，並理解 R² 值的含義與侷限性。

在 Python 生態系中，statsmodels 套件提供了最完整的 OLS 實作，不只輸出係數，還同時提供 t 統計量、p 值、信賴區間、R²、調整後 R²、F 統計量與 Durbin-Watson 統計量等完整的統計摘要，適合需要統計推論的場景。scikit-learn 的 LinearRegression 則以預測為導向，API 簡潔但不輸出 p 值等推論資訊，適合機器學習 Pipeline 整合。在選擇工具時，若目標是理解變數關係與顯著性，使用 statsmodels；若目標是建立預測模型並與其他 ML 方法比較，使用 scikit-learn。

總結而言，OLS 是線性模型估計的基石方法，其數學原理清晰、計算效率高、結果可解釋性強，是學習統計建模與機器學習必備的基礎概念。理解 OLS 的假設、性質與侷限，有助於在面對實際問題時做出更恰當的模型選擇。

## 常見問題

### OLS 與梯度下降求解線性回歸有什麼差異？

OLS 提供線性回歸的解析解（closed-form solution），透過矩陣運算直接求得最佳係數，計算精確且不需要調整學習率或迭代次數。梯度下降則是一種數值優化方法，通過反覆更新參數來逼近最小值，適合資料量龐大到無法直接進行矩陣求逆的場景（矩陣求逆的時間複雜度為 O(p³)，p 為特徵數）。在資料量與特徵數量適中時，OLS 解析解通常更快也更精確；當特徵維度極高或資料量極大時，梯度下降（尤其是隨機梯度下降 SGD）則是更實用的選擇。

### 為什麼 OLS 最小化殘差平方和而不是殘差的絕對值之和？

最小化殘差平方和（L2 損失）相較於最小化殘差絕對值之和（L1 損失）有幾個數學優勢：首先，L2 損失處處可微，使得對目標函式求導並得到解析解成為可能；其次，較大的殘差在平方後被放大，使模型對異常值更加敏感，同時也促使模型盡力解釋所有資料點。相比之下，L1 損失（對應中位數回歸或 LAD 回歸）對異常值更穩健，但沒有封閉解析解，需要數值優化。在資料不含嚴重異常值且誤差近似常態分佈的情況下，OLS（L2）是統計性質更優的選擇。

### 當資料存在多元共線性時，OLS 會有什麼問題？

多元共線性（Multicollinearity）指自變數之間存在高度線性相關，這會導致 OLS 出現以下問題：一是設計矩陣 XᵀX 接近奇異（singular），使得矩陣求逆不穩定，係數估計的變異數急劇膨脹；二是各自變數的係數估計值會高度不穩定，微小的資料變動就可能導致係數大幅改變；三是 t 統計量變小，造成本應顯著的變數無法通過顯著性檢驗。診斷工具包括變異數膨脹因子（VIF）：VIF > 10 通常視為嚴重共線性。解決方案包括去除冗餘變數、做主成分分析（PCA）降維，或改用嶺回歸（Ridge Regression）加入 L2 正規化項以穩定係數估計。

---

深度解說頁：https://aiterms.tw/learning/what-is-ols
快查頁：https://aiterms.tw/terms/ols
最後更新：2026/06/22