ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2026-01-20 10:45
[招待講演]大規模基盤モデル開発における安全性対策
綿岡晃輝SB IntuitionsEMM2025-113
抄録 (和) 言語や視覚情報を統合的に扱う大規模基盤モデルは, 幅広い分野での応用が期待され, 社会への導入が急速に進んでいる一方で, その安全性の確保は喫緊の課題である.
懸念される潜在的なリスクとしては, 有害コンテンツの生成, 個人情報の漏洩, あるいはジェイルブレイクなどを通じた犯罪への悪用などが挙げられる.
本稿では, 大規模基盤モデルの開発ライフサイクル全体を通じた多層的な安全性対策について包括的に論じる.
具体的には, 開発段階を「事前学習」「事後学習」「推論」の三つに分け, 各フェーズにおける安全性の観点から技術的介入を体系的に整理する.
事前学習段階においては, 学習コーパスに含まれる違法ドメインのブロックや個人特定情報の匿名化処理, およびデータフィルタリング手法について概説する.
事後学習段階においては, モデルの安全性アラインメントを強化するための教師あり学習および強化学習におけるデータセット構築の指針に加え, リスク誘発率を定量化するベンチマーキングや, 敵対的な攻撃シナリオを想定したレッドチーミングの重要性を説く.
さらに推論段階においては, システムプロンプトによる挙動制御に加え, 入出力を動的に監視するガードレールモデルの導入など, 外部機構による防御策を提示する.
これらの実践的な取り組みを示した上で, 安全性を中核の一つに据えた基盤モデル開発体制のこれからの展望や課題について論じる. 
(英) Large foundation models process language and visual data to demonstrate broad capabilities across domains, becoming vital social infrastructure due to their versatility.
However, alongside their rapid capability expansion, significant security risks have materialized, including the generation of harmful content, leakage of private information, and malicious exploitation through intentional jailbreak.
This paper provides a comprehensive overview of multi-layered safety strategies throughout the entire lifecycle of foundation models.
I categorize safety approaches into three distinct phases: pre-training, post-training, and inference, systematizing technical interventions for each.
In the pre-training phase, we outline methods for blocking illegal domains, anonymizing personally identifiable information, and filtering biased data within training corpora.
For the post-training phase, we discuss guidelines for constructing datasets for supervised fine-tuning and reinforcement learning to enhance model alignment.
Furthermore, we emphasize the importance of benchmarking to quantify risk induction rates and red teaming under adversarial attack scenarios.
In the inference phase, we present defense mechanisms using external architectures, such as dynamic input and output monitoring via guardrail models, in addition to to behavioral control through system prompts.
Finally, building upon these practical measures, we discuss the future landscape of foundation model development frameworks that place safety at the core.
キーワード (和) 大規模基盤モデル / AI安全性 / レッドチーミング / ガードレール / / / /  
(英) Large Foundation Models / AI Safety / Red Teaming / Guardrails / / / /  
文献情報 信学技報, vol. 125, no. 317, EMM2025-113, pp. 67-67, 2026年1月.
資料番号 EMM2025-113 
発行日 2026-01-12 (EMM) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード EMM2025-113

研究会情報
研究会 EMM  
開催期間 2026-01-19 - 2026-01-20 
開催地(和) 東北大学 電気通信研究所 本館1階オープンセミナー室 
開催地(英) Tohoku Univ. 
テーマ(和) 臨場感生成,ユニバーサルメディア,ディジタルエンタテインメント,一般 
テーマ(英) Sense of Presence, Universal Media, Digital Entertainment, etc. 
講演論文情報の詳細
申込み研究会 EMM 
会議コード 2026-01-EMM 
本文の言語 日本語 
タイトル(和) 大規模基盤モデル開発における安全性対策 
サブタイトル(和)  
タイトル(英) Safety Strategies in Large Foundation Model Development 
サブタイトル(英)  
キーワード(1)(和/英) 大規模基盤モデル / Large Foundation Models  
キーワード(2)(和/英) AI安全性 / AI Safety  
キーワード(3)(和/英) レッドチーミング / Red Teaming  
キーワード(4)(和/英) ガードレール / Guardrails  
キーワード(5)(和/英) /  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 綿岡 晃輝 / Koki Wataoka / ワタオカ コウキ
第1著者 所属(和/英) SB Intuitions株式会社 (略称: SB Intuitions)
SB Intuitions Corp. (略称: SB Intuitions)
第2著者 氏名(和/英/ヨミ) / /
第2著者 所属(和/英) (略称: )
(略称: )
第3著者 氏名(和/英/ヨミ) / /
第3著者 所属(和/英) (略称: )
(略称: )
第4著者 氏名(和/英/ヨミ) / /
第4著者 所属(和/英) (略称: )
(略称: )
第5著者 氏名(和/英/ヨミ) / /
第5著者 所属(和/英) (略称: )
(略称: )
第6著者 氏名(和/英/ヨミ) / /
第6著者 所属(和/英) (略称: )
(略称: )
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2026-01-20 10:45:00 
発表時間 60分 
申込先研究会 EMM 
資料番号 EMM2025-113 
巻番号(vol) vol.125 
号番号(no) no.317 
ページ範囲 p.67 
ページ数
発行日 2026-01-12 (EMM) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会