線性迴歸模型 是什麼?

Linear Regression Model:線性迴歸模型 的完整解釋

假設因變數與一個或多個自變數之間存在線性關係,並透過最小化殘差平方和來估計參數的統計預測模型。

線性迴歸模型(Linear Regression Model)是所有統計預測與機器學習方法的基礎,其歷史可追溯至 19 世紀初高斯(Carl Friedrich Gauss)與勒讓德(Adrien-Marie Legendre)發展的最小二乘法(Least Squares Method)。儘管深度學習時代來臨,線性迴歸仍因其可解釋性強、計算高效、對訓練資料需求少的特性,在商業分析、科學研究與 AI 特徵分析中保有重要地位。

模型形式

簡單線性迴歸(Simple Linear Regression):僅有一個自變數 x,模型為 y = β₀ + β₁x + ε,其中 β₀ 為截距(Intercept),β₁ 為斜率(Slope),ε 為服從常態分布的隨機誤差。

多元線性迴歸(Multiple Linear Regression):有 p 個自變數,模型為 y = β₀ + β₁x₁ + β₂x₂ + ... + βₚxₚ + ε,用矩陣表示為 y = Xβ + ε,其中 X 是設計矩陣(Design Matrix)。

OLS 估計

普通最小二乘法(Ordinary Least Squares, OLS)透過最小化殘差平方和(RSS = Σ(yᵢ - ŷᵢ)²)求解迴歸係數,解析解(閉合解)為 β̂ = (XᵀX)⁻¹Xᵀy。OLS 估計量在高斯-馬可夫定理(Gauss-Markov Theorem)的假設下(線性、無偏、同方差、無自相關)是最佳線性無偏估計量(BLUE, Best Linear Unbiased Estimator)。

評估指標

決定係數(R²,R-squared):衡量模型解釋因變數變異的比例,取值 0 到 1,R² 越高表示模型配適越好,但高 R² 不代表因果關係或預測準確性。

調整 R²(Adjusted R²):對自變數數量進行懲罰,避免加入無關自變數而虛增 R² 的問題,多元迴歸中應優先看調整 R²。

均方誤差(MSE, Mean Squared Error)與均方根誤差(RMSE):衡量預測值與真實值的平均差距,具有原始因變數的量綱,便於業務解釋。

平均絕對誤差(MAE, Mean Absolute Error):對離群值不如 MSE 敏感,在有異常值的場景下更穩健。

模型假設與違反後果

線性迴歸的四大 OLS 假設及其違反時的影響:

線性關係假設:若真實關係是非線性的,強行用線性模型會導致系統性偏誤(Bias)。解決方法:加入多項式特徵(Polynomial Features)、對特徵或輸出取對數、使用廣義加法模型(GAM)等。

同方差假設(Homoscedasticity):殘差的變異數應為常數,若隨 x 變化(異方差,Heteroscedasticity),OLS 估計仍無偏但不再有效率,且標準誤估計不準確。解決方法:使用加權最小二乘(WLS)或穩健標準誤(Robust Standard Errors)。

獨立性假設:觀測值之間應相互獨立,若存在自相關(Autocorrelation,常見於時間序列),OLS 標準誤低估,t 統計量膨脹。解決方法:Durbin-Watson 檢定診斷,使用 GLS 或加入時間項。

常態性假設:小樣本下誤差項需服從常態分布以使 F 檢定和 t 檢定有效;大樣本下由中央極限定理近似成立。

正則化擴展

標準 OLS 在特徵數接近樣本數、或特徵間高度共線性時可能過擬合(Overfitting)。正則化(Regularization)方法為損失函數加入懲罰項:

Ridge 迴歸(L2 正則化):加入 β²(L2 範數)懲罰,讓係數縮小但不歸零,適合處理多重共線性。

Lasso 迴歸(L1 正則化):加入 |β|(L1 範數)懲罰,可讓部分係數精確歸零,實現特徵選擇,適合高維稀疏特徵場景。

Elastic Net:結合 L1 和 L2 懲罰,兼顧特徵選擇與共線性處理。

線性迴歸 vs. 深度學習

線性迴歸仍有深度學習難以取代的優勢:完全可解釋(每個係數代表自變數的邊際效應)、訓練資料需求少(數十到數百條即可)、訓練速度極快、過擬合風險低(在特徵數遠少於樣本數時)。在業務報告、因果推斷、AB 測試結果分析中,線性迴歸提供的係數解釋遠比神經網路重要。然而對於複雜的非線性關係、影像、語音、文本等高維資料,深度學習具有壓倒性的優勢。

在 AI 系統中的應用

在 AI 應用規劃中,線性迴歸常用於以下場景:基準模型(Baseline Model)的建立(先用線性迴歸確立預測下限,再評估複雜模型的增益);特徵重要性快速評估(係數絕對值作為特徵重要性的直觀估計);價格預測、用量預測、銷售預測等業務指標的可解釋預測模型;以及 Explainable AI(XAI)中,用線性模型局部近似複雜模型(如 LIME)。

在 iPAS AI 應用規劃師認證中,線性迴歸模型是統計與機器學習基礎的核心考點,考生需理解其假設、OLS 估計原理、評估指標、正則化擴展以及與其他模型的適用場景比較。

常見問題