| 講演抄録/キーワード |
| 講演名 |
2026-07-24 10:25
視線データを用いたモデルベース強化学習 ○三宅晃平・大石慶一朗・中川博之(岡山大) ICM2026-12 SC2026-18 |
| 抄録 |
(和) |
深層強化学習は,画像情報のような状態数が非常に多い環境においても強化学習の実行を可能にし,これによって強化学習の適用可能性が大幅に向上した.しかし,深層強化学習は報酬が非常に稀な環境において学習効率が著しく低下するという課題を抱えている.本研究では,人間の視線データを補助報酬として統合した新しいモデルベース強化学習手法を提案し,この課題の解決を図る.提案手法では,専門家の視線停留点から抽出したサブゴールを組み込む.また,報酬設計の際は,目標付近での停滞による価値の過大評価を防ぐため,サブゴールとの距離の差分に基づく距離差分報酬を採用する.さらに,サブゴールの切り替え時や失敗時に発生する不適切な負の報酬を受け取らないようにする動的報酬リセット機構を導入することで,学習の安定化を実現する.報酬を得る頻度が非常に低い環境における実験として,提案手法の有効性を従来手法との学習速度および学習の安定性の観点から比較・検証する.また,パラメータを変更して同様の実験を行うことで,その際に生じる変化についても考察する. |
| (英) |
Deep reinforcement learning (DRL) has enabled the execution of reinforcement learning in environments with a massive number of states, such as visual information, thereby significantly expanding its applicability. However, DRL suffers from a severe decline in learning efficiency in environments where rewards are extremely sparse. To address this challenge, this study proposes a novel model-based reinforcement learning method that integrates human gaze data as a shaping reward. The proposed method incorporates subgoals extracted from an expert's gaze fixation points. Furthermore, in the reward design, a potential-based reward difference—calculated based on the distance to the subgoal—is employed to prevent the overestimation of value caused by stagnation near the objective. In addition, a dynamic reward reset mechanism is introduced to stabilize learning by ensuring that inappropriate negative rewards are not received during subgoal transitions or failures. Through experiments conducted in a reward-sparse environment, we evaluate and verify the effectiveness of the proposed method in comparison with conventional methods, focusing on learning speed and stability. Finally, we investigate the resulting behavioral changes by varying the key parameters in similar experimental setups. |
| キーワード |
(和) |
深層強化学習 / 視線データ / モデルベース強化学習 / 世界モデル / 報酬設計 / / / |
| (英) |
Deep Reinforcement Learning / Gaze Data / Model-Based Reinforcement Learning / World Models / Reward Design / / / |
| 文献情報 |
信学技報, vol. 126, no. 129, SC2026-18, pp. 56-63, 2026年7月. |
| 資料番号 |
SC2026-18 |
| 発行日 |
2026-07-16 (ICM, SC) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
ICM2026-12 SC2026-18 |
| 研究会情報 |
| 研究会 |
SC ICM |
| 開催期間 |
2026-07-23 - 2026-07-24 |
| 開催地(和) |
リンクモア平安閣市民ホール 1F会議室(1) |
| 開催地(英) |
|
| テーマ(和) |
サービスコンピューティング,サービス管理,運用管理技術,一般 |
| テーマ(英) |
|
| 講演論文情報の詳細 |
| 申込み研究会 |
SC |
| 会議コード |
2026-07-SC-ICM |
| 本文の言語 |
日本語 |
| タイトル(和) |
視線データを用いたモデルベース強化学習 |
| サブタイトル(和) |
|
| タイトル(英) |
Proposal of Model-Based Reinforcement Learning using Gaze Data |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
深層強化学習 / Deep Reinforcement Learning |
| キーワード(2)(和/英) |
視線データ / Gaze Data |
| キーワード(3)(和/英) |
モデルベース強化学習 / Model-Based Reinforcement Learning |
| キーワード(4)(和/英) |
世界モデル / World Models |
| キーワード(5)(和/英) |
報酬設計 / Reward Design |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
三宅 晃平 / Kohei Miyake / ミヤケ コウヘイ |
| 第1著者 所属(和/英) |
岡山大学 (略称: 岡山大)
Okayama University (略称: Okayama Univ.) |
| 第2著者 氏名(和/英/ヨミ) |
大石 慶一朗 / Keiichiro Oishi / オオイシ ケイイチロウ |
| 第2著者 所属(和/英) |
岡山大学 (略称: 岡山大)
Okayama University (略称: Okayama Univ.) |
| 第3著者 氏名(和/英/ヨミ) |
中川 博之 / Hiroyuki Nakagawa / ナカガワ ヒロユキ |
| 第3著者 所属(和/英) |
岡山大学 (略称: 岡山大)
Okayama University (略称: Okayama Univ.) |
| 第4著者 氏名(和/英/ヨミ) |
/ / |
| 第4著者 所属(和/英) |
(略称: )
(略称: ) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2026-07-24 10:25:00 |
| 発表時間 |
25分 |
| 申込先研究会 |
SC |
| 資料番号 |
ICM2026-12, SC2026-18 |
| 巻番号(vol) |
vol.126 |
| 号番号(no) |
no.128(ICM), no.129(SC) |
| ページ範囲 |
pp.56-63 |
| ページ数 |
8 |
| 発行日 |
2026-07-16 (ICM, SC) |
|