因果推論 是什麼?

Causal Inference:因果推論 的完整解釋

因果推論是從觀察數據中推斷因果關係的方法,旨在確定一個變數的變化是否直接導致另一個變數的變化。

容易混淆

因果推論 vs 相關性 相關性只說一起變,因果推論要回答改變 X 會不會導致 Y 變。

觀察研究 vs 隨機試驗 觀察研究看現成資料,隨機試驗用設計降低混雜因子。

因果推論 vs 預測模型 預測模型追求準,因果推論追求可解釋的介入效果。

記住這句就好

先看它要解決的是什麼問題,再看它是不是最合適的方法。

實際案例

案例 1:新優惠券 你想知道發券是否真的提升回購,而不是只是剛好買的人比較多。

案例 2:教育介入 你想知道額外輔導課是否真的拉高成績,而不是剛好去上課的學生本來就更認真。

算法與應用

面向 重點
核心 要分辨干擾因素,才能把相關和因果拆開。
常用工具 A/B 測試、DAG、配對、工具變數、差異中的差異。
注意 沒有好設計的觀察資料,很容易把相關誤看成因果。

中英對照與常見說法

說法 出現場合
因果推論 台灣正式用語
因果推断 簡體寫法
Causal Inference 英文原名
因果分析、因果推理 常見變體

相關不等於因果,差在哪

兩件事同時發生可能有三種原因:A 造成 BB 造成 A、或有第三個因素 C 同時造成 A 和 B。第三種就是混淆變數(confounder),也是統計相關最常見的陷阱。

冰淇淋銷量與溺水人數高度相關,但沒有因果關係,共同原因是氣溫。

因果推論要回答的是反事實(counterfactual)問題:如果同一個人沒有吃這個藥,結果會怎樣?這件事永遠觀察不到,因為同一個人不可能同時吃藥又沒吃藥。這叫做因果推論的根本問題,所有方法本質上都是在估計這個看不到的另一半。

主要方法

方法 需要的條件 說明
隨機對照試驗(RCT)/A/B 測試 能隨機分配 黃金標準,隨機分配讓兩組的混淆因素平均相同
傾向分數配對 觀測到所有重要混淆變數 把處理組與對照組中條件相近的人配成對再比較
差異中的差異(DiD) 有處理前後與對照組 用對照組的變化扣掉「本來就會發生的變化」
工具變數(IV) 找得到只透過處理影響結果的變數 用外部隨機性製造準實驗
斷點迴歸(RDD) 有明確的門檻規則 比較門檻兩側剛好差一點的個體

因果圖(DAG)是規劃這些分析的工具:先把變數之間假設的因果方向畫出來,才能判斷該控制哪些變數。

不是控制越多變數越好,這是很多人的直覺錯誤。控制到對撞因子(collider)會憑空製造出偏誤,控制到中介變數(mediator) 會把想估計的效果本身扣掉一部分。該不該控制某個變數,取決於它在因果圖上的位置,不取決於它跟結果的相關性高低。

實務上什麼時候特別需要它

做決策而不只是做預測的時候。預測模型回答「這個客戶會不會流失」,因果模型回答「如果我發折價券,能挽回多少」。前者用相關就夠,後者不做因果分析會做出反效果的決策。

典型例子是行銷:模型找出最可能購買的人並對他們發券,看起來轉換率很高,但這些人本來就會買,發券只是白送錢。真正該找的是發了才會買、不發就不會買的那群人,這需要提升建模(uplift modeling),本質上是因果推論。

情境判斷

Q1(判斷題): 看到冰淇淋銷量和溺水率一起升高,能說冰淇淋造成溺水嗎? → 不能,這很可能是氣溫這個混雜因素一起在作用。

Q2(判斷題): 如果 A/B 測試做得很完整,還需要擔心混雜嗎? → 通常比觀察資料少很多,但還是要注意實驗污染和執行偏差。

常見問題

因果推論一定要有實驗嗎?

不一定,但有實驗通常最乾淨;沒有實驗時就要靠嚴謹設計補強。

因果推論和統計檢定是一樣的嗎?

不一樣,檢定只是判斷差異顯著,因果推論要再回答介入效果。

混雜因子是什麼?

它是同時影響 X 和 Y 的第三個因素,會把因果關係搞亂。