ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2024-12-20 09:40
事前知識を用いたQ学習
今川孝久榎田修一九工大IBISML2024-34
抄録 (和) 強化学習は報酬が高い行動を学習する方法であり,その代表的アルゴリズムの一つがQ-学習である.
Q-学習においてregretの解析が進んできたが,多くの分析は一から学習するということを前提としている.
もし,学習済みの知識を活かすことができれば,転移学習などの研究で示されているように改善が可能である.
そこで,本研究では事前に学習対象に対する知識を得られるという仮定の下でのQ-学習アルゴリズムBiased Exploration Q-learning (BEQ)を提案する.
そしてBEQのregretの解析を行い,regretの上界が$mathcal{O}(hat{w}_{max}sqrt{H^2S'A'Tiota} + HS'A'Delta_Q)$であり,知識を使っているという違いがあるものの,既存手法より小さいことを示す.
また,実験を通じて,事前知識を導入する既存手法Potential Based Reward Shapingに対して,BEQは優れていることを示す. 
(英) Reinforcement learning (RL) is a method for learning actions which are highly rewarding and one of the representative methods of RL is Q-learning.
Regret of Q-learning have been analyzed, however most of them assume that learning takes place from scratch.
If the agent has acquired prior knowledge about the learning domain, its learning will be more efficient as suggested in transfer learning research.
Therefore, we propose a Q-learning method, Biased Exploration Q-learning (BEQ), which assumes that the agent can acquire domain knowledge in advance.
We analyze regret of BEQ and show that its upper bound is $mathcal{O}(hat{w}_{max}sqrt{H^2S'A'Tiota} + HS'A'Delta_Q)$.
BEQ and existing methods differ in terms of whether the agent can obtain the domain knowledge or not, but this bound is smaller than those of existing methods.
Also experiments show that BEQ outperforms Potential Based Reward Shaping (PBRS), which is a common method for introducing domain knowledge.
キーワード (和) 強化学習 / Q-学習 / 転移学習 / 事前知識 / / / /  
(英) Reinforcement Learning / Q-Learning / Transfer Learning / Prior Knowledge / / / /  
文献情報 信学技報, vol. 124, no. 321, IBISML2024-34, pp. 14-27, 2024年12月.
資料番号 IBISML2024-34 
発行日 2024-12-13 (IBISML) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード IBISML2024-34

研究会情報
研究会 IBISML  
開催期間 2024-12-20 - 2024-12-21 
開催地(和) 北海道大学大学院環境科学院棟講義室1(D101) 
開催地(英) Lecture room 1 (D101), Graduate School of Environmental Science 
テーマ(和) 生成AI、機械学習一般 
テーマ(英) generative AI, machine learning 
講演論文情報の詳細
申込み研究会 IBISML 
会議コード 2024-12-IBISML 
本文の言語 日本語 
タイトル(和) 事前知識を用いたQ学習 
サブタイトル(和)  
タイトル(英) Q-Learning with Prior Knowledge 
サブタイトル(英)  
キーワード(1)(和/英) 強化学習 / Reinforcement Learning  
キーワード(2)(和/英) Q-学習 / Q-Learning  
キーワード(3)(和/英) 転移学習 / Transfer Learning  
キーワード(4)(和/英) 事前知識 / Prior Knowledge  
キーワード(5)(和/英) /  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 今川 孝久 / Takahisa Imagawa / イマガワ タカヒサ
第1著者 所属(和/英) 九州工業大学 (略称: 九工大)
Kyushu Institute of Technology (略称: KIT)
第2著者 氏名(和/英/ヨミ) 榎田 修一 / Shuichi Enokida / エノキダ シュウイチ
第2著者 所属(和/英) 九州工業大学 (略称: 九工大)
Kyushu Institute of Technology (略称: KIT)
第3著者 氏名(和/英/ヨミ) / /
第3著者 所属(和/英) (略称: )
(略称: )
第4著者 氏名(和/英/ヨミ) / /
第4著者 所属(和/英) (略称: )
(略称: )
第5著者 氏名(和/英/ヨミ) / /
第5著者 所属(和/英) (略称: )
(略称: )
第6著者 氏名(和/英/ヨミ) / /
第6著者 所属(和/英) (略称: )
(略称: )
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2024-12-20 09:40:00 
発表時間 20分 
申込先研究会 IBISML 
資料番号 IBISML2024-34 
巻番号(vol) vol.124 
号番号(no) no.321 
ページ範囲 pp.14-27 
ページ数 14 
発行日 2024-12-13 (IBISML) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会