獎賞塑形 是什麼?
Reward Shaping:獎賞塑形 的完整解釋
修改強化學習的獎賞函數以加快收斂和改進學習效率的技術。
核心概念
獎賞塑形的基本思想是在原始獎賞函數基礎上添加額外獎賞信號。原始獎賞R(s,a,s')只在任務完成或特定里程碑時發放,導致智能體初期收到全零獎賞,無法學習。通過添加中間獎賞或進度獎賞,智能體能更頻繁地收到反饋,加快學習。
但任意修改獎賞可能改變問題的最優解。例如在導航任務中,若只獎賞向目標靠近的距離減小,忽視路徑長度,智能體可能學會低效繞路達到相同目標距離改進。保證獎賞塑形不改變最優策略的方法是使用潛在函數(potential-based shaping)。
潛在函數獎賞塑形定義為:F(s,a,s') = γΦ(s') - Φ(s),其中Φ是某個狀態函數。新獎賞為R'(s,a,s') = R(s,a,s') + F(s,a,s')。這種形式的塑形被證明保持最優策略不變,只改變價值估計。關鍵是Φ必須編碼問題的領域知識。
運作原理
實踐中獎賞塑形有幾種常見形式。第一是距離獎賞,獎勵智能體更接近目標:F = -γ·dist(s') + dist(s)。第二是進度獎賞,獎勵完成子目標:每當達成里程碑時加獎賞。第三是規則懲罰,對違反安全或效率約束懲罰。
例如在機械臂學習抓取任務時,原始任務只在成功抓取物體時發放+1獎賞,其他時無獎賞。獎賞塑形可添加:手臂接近物體時+0.1,抓取力度適中時+0.05,物體被抬起時+0.2。這樣智能體每步都有稀疏反饋,學習加速。
實現時需謹慎。過多塑形獎賞會掩蓋原始任務,導致學到錯誤的最優策略。例如在遊戲中過度獎賞探索,可能導致智能體探索而忽視目標。平衡方法是使用較小的塑形權重,或動態調整,初期大重量幫助探索,後期減小權重讓原始獎賞主導。
課程學習與獎賞塑形結合時效果更佳。開始時任務簡單,獎賞豐富,幫助智能體快速學習基礎技能;逐步增加難度,減少獎賞,使智能體在複雜環境中精化策略。
實際應用
機器人學習複雜操作任務時普遍使用獎賞塑形。例如機械臂學習從散亂堆中整理物體,原始獎賞只在全部整理完成時發放。通過添加部分物體整理完成的獎賞、物體堆疊穩定度獎賞等,機器人能逐步學會基礎動作。
無人機控制中,獎賞塑形幫助無人機學會如懸停、跟蹤移動目標等基礎技能。原始任務可能是複雜的巡邏任務,但通過獎賞塑形引導先學會穩定懸停和轉向,基礎任務學會後再組合完成複雜任務。
遊戲AI訓練中,獎賞塑形加速智能體學習。在複雜遊戲中獲勝需要數千萬步,直接學習困難。通過中間獎賞(如獲得資源、消滅敵人、佔領領地),智能體能更快指引。
自動駕駛模擬訓練使用獎賞塑形確保安全。基礎獎賞是到達目地點,塑形獎賞包括安全駕駛(無碰撞)、舒適度(低加速度)、效率(短路程)。這樣訓練的策略既能完成任務,又遵守安全和舒適約束。
推薦系統中,獎賞塑形平衡短期點擊和長期用戶滿意度。點擊是容易測量的短期獎賞,用戶保留率是長期獎賞。通過添加塑形獎賞獎勵長期保留,系統不會過度優化短期指標。
常見誤區
許多人認為獎賞塑形可任意使用。實際上不當塑形會改變最優策略,導致學到的解決方案對原始問題次優。例如在象棋遊戲中過度獎勵佔領中心,可能導致智能體忽視防守,在實際對局中敗北。
另一誤區是認為更多獎賞信號總是更好。過度塑形導致智能體優化塑形獎賞而非原始目標。正確做法是最小化塑形獎賞,只在必要時使用。
有人忽視潛在函數的重要性。使用任意塑形獎賞可能改變最優策略,只有基於潛在函數的塑形才能保證策略不變。不過實踐中為了簡化,許多應用接受輕微改變,並通過微調權重控制影響。
與相關技術的比較
- 與課程學習的比較:獎賞塑形修改同一任務的獎賞函數,課程學習逐步增加任務難度。兩者常結合使用,簡單課程階段用豐富塑形獎賞,複雜階段減少塑形。課程學習更關注任務順序,獎賞塑形更關注獎賞結構。
- 與內在動機的比較:獎賞塑形手工設計額外獎賞,內在動機(如好奇心)自動產生探索信號。獎賞塑形更精準但需領域知識,內在動機更通用但可能不夠精確。現代方法常結合兩者。
- 與逆強化學習的比較:逆強化學習從演示中推斷獎賞函數,獎賞塑形手工修改已知獎賞。逆強化學習適合難以明確定義獎賞的任務,獎賞塑形適合已有獎賞但學習困難的任務。
- 與分層強化學習的比較:分層強化學習分解複雜任務為多層子任務,獎賞塑形在單層任務內添加中間獎賞。兩者都能加速學習,分層更適合結構化任務,塑形更適合單層優化。