ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2026-07-24 10:25
視線データを用いたモデルベース強化学習
三宅晃平大石慶一朗中川博之岡山大ICM2026-12 SC2026-18
抄録 (和) 深層強化学習は,画像情報のような状態数が非常に多い環境においても強化学習の実行を可能にし,これによって強化学習の適用可能性が大幅に向上した.しかし,深層強化学習は報酬が非常に稀な環境において学習効率が著しく低下するという課題を抱えている.本研究では,人間の視線データを補助報酬として統合した新しいモデルベース強化学習手法を提案し,この課題の解決を図る.提案手法では,専門家の視線停留点から抽出したサブゴールを組み込む.また,報酬設計の際は,目標付近での停滞による価値の過大評価を防ぐため,サブゴールとの距離の差分に基づく距離差分報酬を採用する.さらに,サブゴールの切り替え時や失敗時に発生する不適切な負の報酬を受け取らないようにする動的報酬リセット機構を導入することで,学習の安定化を実現する.報酬を得る頻度が非常に低い環境における実験として,提案手法の有効性を従来手法との学習速度および学習の安定性の観点から比較・検証する.また,パラメータを変更して同様の実験を行うことで,その際に生じる変化についても考察する. 
(英) Deep reinforcement learning (DRL) has enabled the execution of reinforcement learning in environments with a massive number of states, such as visual information, thereby significantly expanding its applicability. However, DRL suffers from a severe decline in learning efficiency in environments where rewards are extremely sparse. To address this challenge, this study proposes a novel model-based reinforcement learning method that integrates human gaze data as a shaping reward. The proposed method incorporates subgoals extracted from an expert's gaze fixation points. Furthermore, in the reward design, a potential-based reward difference—calculated based on the distance to the subgoal—is employed to prevent the overestimation of value caused by stagnation near the objective. In addition, a dynamic reward reset mechanism is introduced to stabilize learning by ensuring that inappropriate negative rewards are not received during subgoal transitions or failures. Through experiments conducted in a reward-sparse environment, we evaluate and verify the effectiveness of the proposed method in comparison with conventional methods, focusing on learning speed and stability. Finally, we investigate the resulting behavioral changes by varying the key parameters in similar experimental setups.
キーワード (和) 深層強化学習 / 視線データ / モデルベース強化学習 / 世界モデル / 報酬設計 / / /  
(英) Deep Reinforcement Learning / Gaze Data / Model-Based Reinforcement Learning / World Models / Reward Design / / /  
文献情報 信学技報, vol. 126, no. 129, SC2026-18, pp. 56-63, 2026年7月.
資料番号 SC2026-18 
発行日 2026-07-16 (ICM, SC) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード ICM2026-12 SC2026-18

研究会情報
研究会 SC ICM  
開催期間 2026-07-23 - 2026-07-24 
開催地(和) リンクモア平安閣市民ホール 1F会議室(1) 
開催地(英)  
テーマ(和) サービスコンピューティング,サービス管理,運用管理技術,一般 
テーマ(英)  
講演論文情報の詳細
申込み研究会 SC 
会議コード 2026-07-SC-ICM 
本文の言語 日本語 
タイトル(和) 視線データを用いたモデルベース強化学習 
サブタイトル(和)  
タイトル(英) Proposal of Model-Based Reinforcement Learning using Gaze Data 
サブタイトル(英)  
キーワード(1)(和/英) 深層強化学習 / Deep Reinforcement Learning  
キーワード(2)(和/英) 視線データ / Gaze Data  
キーワード(3)(和/英) モデルベース強化学習 / Model-Based Reinforcement Learning  
キーワード(4)(和/英) 世界モデル / World Models  
キーワード(5)(和/英) 報酬設計 / Reward Design  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 三宅 晃平 / Kohei Miyake / ミヤケ コウヘイ
第1著者 所属(和/英) 岡山大学 (略称: 岡山大)
Okayama University (略称: Okayama Univ.)
第2著者 氏名(和/英/ヨミ) 大石 慶一朗 / Keiichiro Oishi / オオイシ ケイイチロウ
第2著者 所属(和/英) 岡山大学 (略称: 岡山大)
Okayama University (略称: Okayama Univ.)
第3著者 氏名(和/英/ヨミ) 中川 博之 / Hiroyuki Nakagawa / ナカガワ ヒロユキ
第3著者 所属(和/英) 岡山大学 (略称: 岡山大)
Okayama University (略称: Okayama Univ.)
第4著者 氏名(和/英/ヨミ) / /
第4著者 所属(和/英) (略称: )
(略称: )
第5著者 氏名(和/英/ヨミ) / /
第5著者 所属(和/英) (略称: )
(略称: )
第6著者 氏名(和/英/ヨミ) / /
第6著者 所属(和/英) (略称: )
(略称: )
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2026-07-24 10:25:00 
発表時間 25分 
申込先研究会 SC 
資料番号 ICM2026-12, SC2026-18 
巻番号(vol) vol.126 
号番号(no) no.128(ICM), no.129(SC) 
ページ範囲 pp.56-63 
ページ数
発行日 2026-07-16 (ICM, SC) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会