樣本自適應梯度估計 是什麼?
SAGE:樣本自適應梯度估計 的完整解釋
透過對不同訓練樣本動態調整梯度估計策略,在保持訓練穩定的前提下提升收斂效率的機器學習優化技術。
SAGE 在 AI 與機器學習領域中是一個具有多重語意的縮寫,在不同研究脈絡下指涉不同的技術方法。本文主要從兩個最常見的角度進行說明。
第一個含義是 Shapley Additive Global Explanations,這是一種基於 Shapley 值(Shapley Value)的全域模型可解釋性方法,由 Ian Covert 等研究者提出,與廣為人知的 SHAP(Shapley Additive Explanations)密切相關。SHAP 計算每個特徵對個別預測結果的貢獻,而 SAGE 則關注特徵對整體模型表現的全域貢獻度。具體而言,SAGE 值衡量的是:若移除某個特徵,模型在整個資料集上的預測效能(如 AUC、準確率)會下降多少。這種全域視角使得決策者能夠理解哪些特徵對模型的整體預測能力最為關鍵,有助於特徵選擇與模型簡化的決策。
SAGE 計算的理論基礎同樣是合作賽局論中的 Shapley 值,它滿足效率性(所有特徵的 SAGE 值之和等於使用所有特徵與不使用任何特徵時模型效能的差值)、對稱性(等貢獻的特徵有相同的 SAGE 值)等重要公理,使其在理論上具備良好的解釋性保障。相較於其他全域重要性方法(如基於排列的特徵重要性),SAGE 在理論嚴謹性上更具優勢,但計算代價也更高,通常需要蒙地卡羅採樣進行近似估計。
第二個含義是在優化算法領域,SAGE 有時指稱一類樣本自適應的梯度估計方法,這類方法的目標是在隨機梯度下降(SGD)框架下,透過更智能的樣本選擇或梯度估計策略,減少梯度估計的方差,同時保持計算效率。與標準的隨機採樣不同,自適應採樣方法(如重要性採樣)可以優先選取梯度信號更強的訓練樣本,提升每次迭代的資訊量,從而加速收斂。
在可解釋 AI(XAI, Explainable AI)的研究與應用中,基於 Shapley 值的方法(包括 SHAP 和 SAGE)已成為最受信賴的可解釋性工具之一,廣泛應用於金融風控模型的特徵重要性分析、醫療診斷模型的決策因素解釋、以及 AI 監管合規(如歐盟 AI 法案要求的決策透明度)。
理解 SAGE 所在的可解釋 AI 生態系,對於 AI 應用規劃師來說非常重要,因為在企業 AI 落地過程中,監管機構、業務決策者與終端使用者對模型決策的解釋需求日益強烈,能夠選用適當的可解釋性工具(區分全域解釋與局部解釋的工具)是 AI 系統設計的重要能力之一。 可解釋 AI 全局歸因指標(SAGE, Shapley Additive Global Importance)是一種計算特徵全局重要性的方法,基於博弈論的 Shapley 值理論,衡量每個特徵對模型整體預測性能的平均貢獻。
SAGE 由 Ian Covert, Scott Lundberg 和 Su-In Lee 於 2020 年提出,是 SHAP 框架的全局對應方法。與 SHAP 的局部解釋(針對單個預測)不同,SAGE 的目標是量化每個特徵在整個資料集上對模型性能的貢獻。
SAGE 的計算原理是從模型性能角度定義 Shapley 值:移除某個特徵(或用條件均值替換)後,模型性能(以損失函數衡量)的下降幅度代表該特徵的貢獻。SAGE 將這個貢獻在所有可能的特徵子集中平均,確保符合 Shapley 公理(效率性、對稱性、虛特徵性、線性性)。
SAGE 的重要應用場景包括:特徵選擇(識別真正重要的特徵以精簡模型)、模型調試(診斷哪些特徵驅動模型決策)、業務解釋(向非技術人員解釋模型的驅動因素)。
與 SHAP 特徵重要性(各樣本 |SHAP| 值的平均)的差異在於:SAGE 直接基於性能指標計算,更能反映模型在預測任務上的真實依賴;SHAP 特徵重要性基於預測值的方差,有時高重要性特徵對性能提升有限(例如特徵對高方差方向重要,但該方向與真實標籤相關性弱)。
SAGE 的計算涉及枚舉所有特徵子集,對於高維資料需要使用蒙地卡羅採樣近似,計算成本高於單個預測的 SHAP 值,但提供了更嚴格的全局性能歸因。