| 講演抄録/キーワード |
| 講演名 |
2012-12-12 09:00
遷移した状態の集約によって適切なShaping報酬を提示する強化学習 ○岡 晋之介・村越一支(豊橋技科大) NC2012-74 |
| 抄録 |
(和) |
Shapingの概念が取り入れられた強化学習は,容易な行動から複雑な行動へと誘導的にShaping報酬という強化信号を与えることで,学習の収束を早める手法である.Grze\'{s} and Kudenko(2010)は複数の状態を一つの状態に集約させることでShaping報酬を求める手法を提案した.しかしこの手法は,状態の位置的な隣接関係を利用して状態集約を行っており,遷移的に遠く価値が大きく異なる状態を集約してしまう可能性がある.この問題点を改善するため,本研究ではエージェントが遷移した経路によって状態集約を行う手法を提案する.この改善により迷路問題でのシミュレーション実験において,従来手法と比べ本手法が学習効果をより高められる適切なShaping報酬を提示できていることを確認した. |
| (英) |
Reinforcement learning adapting the idea of ``Shaping'' is a method to speed up the learning process by giving additional shaping reward that leads an agent from simple to complicated actions. Grze\'{s} and Kudenko(2010) proposed the online learning of shaping rewards by aggregating some states in the environment to one abstract state. Their method, however, used a position of the state in the state space to aggregate some states. This has a possibility that could aggregate some states which are far different from their values. In order to address that question, we propose a learning method which aggregates states the learning agent transported. We showed higher effectiveness of learning in a maze problem of our method than one in the conventional method. |
| キーワード |
(和) |
強化学習 / Shaping報酬 / 状態集約 / / / / / |
| (英) |
reinforcement learning / shaping reward / state aggregation / / / / / |
| 文献情報 |
信学技報, vol. 112, no. 345, NC2012-74, pp. 1-6, 2012年12月. |
| 資料番号 |
NC2012-74 |
| 発行日 |
2012-12-05 (NC) |
| ISSN |
Print edition: ISSN 0913-5685 Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
NC2012-74 |