搜尋意圖: 如果你在找「獎賞塑形 是什麼」或「獎賞塑形 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 修改強化學習的獎賞函數以加快收斂和改進學習效率的技術。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
修改強化學習的獎賞函數以加快收斂和改進學習效率的技術。
核心概念
獎賞塑形的基本思想是在原始獎賞函數基礎上添加額外獎賞信號。原始獎賞R(s,a,s')只在任務完成或特定里程碑時發放,導致智能體初期收到全零獎賞,無法學習。通過添加中間獎賞或進度獎賞,智能體能更頻繁地收到反饋,加快學習。
但任意修改獎賞可能改變問題的最優解。例如在導航任務中,若只獎賞向目標靠近的距離減小,忽視路徑長度,智能體可能學會低效繞路達到相同目標距離改進。保證獎賞塑形不改變最優策略的方法是使用潛在函數(potential-based shaping)。
潛在函數獎賞塑形定義為:F(s,a,s') = γΦ(s') - Φ(s),其中Φ是某個狀態函數。新獎賞為R'(s,a,s') = R(s,a,s') + F(s,a,s')。這種形式的塑形被證明保持最優策略不變,只改變價值估計。關鍵是Φ必須編碼問題的領域知識。
運作原理
實踐中獎賞塑形有幾種常見形式。第一是距離獎賞,獎勵智能體更接近目標:F = -γ·dist(s') + dist(s)。第二是進度獎賞,獎勵完成子目標:每當達成里程碑時加獎賞。第三是規則懲罰,對違反安全或效率約束懲罰。
例如在機械臂學習抓取任務時,原始任務只在成功抓取物體時發放+1獎賞,其他時無獎賞。獎賞塑形可添加:手臂接近物體時+0.1,抓取力度適中時+0.05,物體被抬起時+0.2。這樣智能體每步都有稀疏反饋,學習加速。
實現時需謹慎。過多塑形獎賞會掩蓋原始任務,導致學到錯誤的最優策略。例如在遊戲中過度獎賞探索,可能導致智能體探索而忽視目標。平衡方法是使用較小的塑形權重,或動態調整,初期大重量幫助探索,後期減小權重讓原始獎賞主導。
課程學習與獎賞塑形結合時效果更佳。開始時任務簡單,獎賞豐富,幫助智能體快速學習基礎技能;逐步增加難度,減少獎賞,使智能體在複雜環境中精化策略。
實際應用
機器人學習複雜操作任務時普遍使用獎賞塑形。例如機械臂學習從散亂堆中整理物體,原始獎賞只在全部整理完成時發放。通過添加部分物體整理完成的獎賞、物體堆疊穩定度獎賞等,機器人能逐步學會基礎動作。
無人機控制中,獎賞塑形幫助無人機學會如懸停、跟蹤移動目標等基礎技能。原始任務可能是複雜的巡邏任務,但通過獎賞塑形引導先學會穩定懸停和轉向,基礎任務學會後再組合完成複雜任務。
遊戲AI訓練中,獎賞塑形加速智能體學習。在複雜遊戲中獲勝需要數千萬步,直接學習困難。通過中間獎賞(如獲得資源、消滅敵人、佔領領地),智能體能更快指引。
自動駕駛模擬訓練使用獎賞塑形確保安全。基礎獎賞是到達目地點,塑形獎賞包括安全駕駛(無碰撞)、舒適度(低加速度)、效率(短路程)。這樣訓練的策略既能完成任務,又遵守安全和舒適約束。
推薦系統中,獎賞塑形平衡短期點擊和長期用戶滿意度。點擊是容易測量的短期獎賞,用戶保留率是長期獎賞。通過添加塑形獎賞獎勵長期保留,系統不會過度優化短期指標。
常見誤區
許多人認為獎賞塑形可任意使用。實際上不當塑形會改變最優策略,導致學到的解決方案對原始問題次優。例如在象棋遊戲中過度獎勵佔領中心,可能導致智能體忽視防守,在實際對局中敗北。
另一誤區是認為更多獎賞信號總是更好。過度塑形導致智能體優化塑形獎賞而非原始目標。正確做法是最小化塑形獎賞,只在必要時使用。
有人忽視潛在函數的重要性。使用任意塑形獎賞可能改變最優策略,只有基於潛在函數的塑形才能保證策略不變。不過實踐中為了簡化,許多應用接受輕微改變,並通過微調權重控制影響。
與相關技術的比較
- 與課程學習的比較:獎賞塑形修改同一任務的獎賞函數,課程學習逐步增加任務難度。兩者常結合使用,簡單課程階段用豐富塑形獎賞,複雜階段減少塑形。課程學習更關注任務順序,獎賞塑形更關注獎賞結構。
- 與內在動機的比較:獎賞塑形手工設計額外獎賞,內在動機(如好奇心)自動產生探索信號。獎賞塑形更精準但需領域知識,內在動機更通用但可能不夠精確。現代方法常結合兩者。
- 與逆強化學習的比較:逆強化學習從演示中推斷獎賞函數,獎賞塑形手工修改已知獎賞。逆強化學習適合難以明確定義獎賞的任務,獎賞塑形適合已有獎賞但學習困難的任務。
- 與分層強化學習的比較:分層強化學習分解複雜任務為多層子任務,獎賞塑形在單層任務內添加中間獎賞。兩者都能加速學習,分層更適合結構化任務,塑形更適合單層優化。
常見問題
什麼時候應該使用獎賞塑形?
當原始任務獎賞過於稀疏,導致智能體難以學習時,獎賞塑形最有用。例如從零開始學習視頻遊戲,若只在贏得遊戲時+1獎賞,其他時刻全零,智能體難以探索。添加中間獎賞(如擊敗敵人+0.1、獲得金幣+0.05)可大幅加快學習。但當獎賞已足夠密集或問題相對簡單時,獎賞塑形收益不大。判斷方法是看無塑形訓練的收斂速度,若極慢則考慮加塑形。
獎賞塑形如何避免改變最優策略?
使用潛在函數基礎塑形。定義狀態價值函數Φ(s)編碼領域知識,塑形獎賞為F(s,a,s') = γΦ(s') - Φ(s)。加上此塑形後,馬可夫決策過程的最優策略保持不變,只改變價值估計。例如在導航中,設Φ(s) = -distance_to_goal(s),則塑形獎賞獎勵朝向目標移動,而不改變最優路徑(取決於障礙物)。不過實踐中許多應用為簡化使用非潛在函數塑形,接受輕微改變,透過小心調整權重控制影響。
獎賞塑形的權重應如何設置?
獎賞塑形權重決定了塑形獎賞相對於原始獎賞的重要性。通常設置方式為R'(s,a,s') = R(s,a,s') + w·F(s,a,s'),其中w是權重。推薦從小權重開始,如0.01或0.1,觀察學習曲線。若訓練加速且最終性能不變,說明權重合適。若性能下降,說明塑形過度,應減小權重。動態調整也有效,初期w較大幫助探索,後期逐步減小至零,讓原始獎賞主導最終優化。權重設置是經驗工程,沒有通用公式。