ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2026-03-19 16:50
[招待講演]オフライン強化学習における識別器を用いた制約と不確実性の利用による性能の向上
木寺隼也新谷光祐常田登生金沢大)・山根 智下関市立大MSS2025-80 NLP2025-161
抄録 (和) 近年,強化学習(Reinforcement Learning: RL)は最適な行動方策を自動的に学習できる手法として大きな注目を集めている.
しかし,RLは環境との相互作用を繰り返しながら方策を獲得する必要があるため,現実的なタスクへの適用は困難である.

この課題に対して近年,環境との相互作用を必要とせず,事前に蓄積された経験データから学習を行うオフライン強化学習(Offline RL,Batch RL)が盛んに研究されている.
一方で,オフラインRLでは分布シフト(distributional shift)と呼ばれる問題により,一般的なRL手法をそのまま適用しても学習がうまく機能しないことが知られている.
そのため,分布シフトを抑制するための手法がオフラインRLにおいて活発に検討されている.

本研究では,TD3+BCと呼ばれるオフラインRL手法に対し,生成的敵対ネットワーク(Generative Adversarial Networks: GANs)で用いられる識別器(discriminator)による制約を導入した新しいオフライン強化学習アルゴリズムを提案する.
提案手法を3次元ロボット制御シミュレーションのベンチマークを用いて既存手法と比較し,その有効性を検証する. 
(英) In recent years, reinforcement learning (RL) has received a lot of attention because we can automatically learn optimal behavioral policies.
However, since RL acquires the policy by repeatedly interacting with the environment, it is difficult to learn about realistic tasks.
In recent years, there has been a lot of research on offline RL (batch RL), which does not need to interact with the environment, but learns from the accumulated experience prepared in advance.
Learning does not work by applying common RL methods directly to offline RL because of a problem called distributional shift.
Methods to suppress distributional shift have been actively studied in offline RL.
In this study, we propose a new offline RL algorithm that adds constraints from discriminators used in Generative Adversarial Networks to the offline RL method called TD3+BC.
We compare and validate the proposed method with existing methods using a benchmark for 3D robot control simulation.
キーワード (和) 強化学習 / オフライン強化学習 / 生成的敵対ネットワーク / 識別器 / ロボット制御 / / /  
(英) Reinforcement Learning / Offline Reinforcement Learning / Generative Adversarial Networks / Discriminator / Robot Control / / /  
文献情報 信学技報, vol. 125, no. 417, MSS2025-80, pp. 173-178, 2026年3月.
資料番号 MSS2025-80 
発行日 2026-03-11 (MSS, NLP) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード MSS2025-80 NLP2025-161

研究会情報
研究会 MSS NLP  
開催期間 2026-03-18 - 2026-03-19 
開催地(和) シンフォニアテクノロジー響ホール伊勢(伊勢市観光文化会館) 
開催地(英)  
テーマ(和) MSS,NLP,一般 
テーマ(英)  
講演論文情報の詳細
申込み研究会 MSS 
会議コード 2026-03-MSS-NLP 
本文の言語 英語(日本語タイトルあり) 
タイトル(和) オフライン強化学習における識別器を用いた制約と不確実性の利用による性能の向上 
サブタイトル(和)  
タイトル(英) Combined Constraint on Behavior Cloning and Discriminator in Offline Reinforcement Learning 
サブタイトル(英)  
キーワード(1)(和/英) 強化学習 / Reinforcement Learning  
キーワード(2)(和/英) オフライン強化学習 / Offline Reinforcement Learning  
キーワード(3)(和/英) 生成的敵対ネットワーク / Generative Adversarial Networks  
キーワード(4)(和/英) 識別器 / Discriminator  
キーワード(5)(和/英) ロボット制御 / Robot Control  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 木寺 隼也 / Shunya Kidera / キデラ シュンヤ
第1著者 所属(和/英) 金沢大学 (略称: 金沢大)
Kanazawa University (略称: Kanazawa Univ.)
第2著者 氏名(和/英/ヨミ) 新谷 光祐 / Kousuke SHintani / シンタニ コウスケ
第2著者 所属(和/英) 金沢大学 (略称: 金沢大)
Kanazawa University (略称: Kanazawa Univ.)
第3著者 氏名(和/英/ヨミ) 常田 登生 / Toi Tsuneda /
第3著者 所属(和/英) 金沢大学 (略称: 金沢大)
Kanazawa University (略称: Kanazawa Univ.)
第4著者 氏名(和/英/ヨミ) 山根 智 / Satoshi Yamane / ヤマネ サトシ
第4著者 所属(和/英) 下関市立大学 (略称: 下関市立大)
Shimonoseki City University (略称: Shimonoseki City Univ.)
第5著者 氏名(和/英/ヨミ) / /
第5著者 所属(和/英) (略称: )
(略称: )
第6著者 氏名(和/英/ヨミ) / /
第6著者 所属(和/英) (略称: )
(略称: )
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2026-03-19 16:50:00 
発表時間 45分 
申込先研究会 MSS 
資料番号 MSS2025-80, NLP2025-161 
巻番号(vol) vol.125 
号番号(no) no.417(MSS), no.418(NLP) 
ページ範囲 pp.173-178 
ページ数
発行日 2026-03-11 (MSS, NLP) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会