| 講演抄録/キーワード |
| 講演名 |
2025-03-07 11:25
大規模言語モデルが持つ心の理論に関する安全性評価に向けて ○青島達大・秋山満昭(NTT) ICSS2024-104 |
| 抄録 |
(和) |
大規模言語モデル(LLM)の性能が向上するにつれて,安全性評価の重要性が高まっている.安全性評価の中で近年,LLMが監視機構を無効化した上で,相手を欺くように回答する挙動が指摘されつつある.例えば,LLMが与えられた仕事を遂行する中で,自身の存続にとって都合の悪い情報を入手すると,秘密裏に行動し,またその結果を確認するような質問に対して,虚偽の回答を行うという結果が報告されている.このような事業者や利用者に対する欺瞞的行為の危険性を評価するために,LLMが内部で密かに意図を以って示した挙動なのかどうかを検証すべきであると考える.本論文では,LLMが持つ心の理論を測定すべきであるという提案を行う.まず,心の理論に関する研究を整理し,安全性評価で実施すべき観点とタスクを整理する.心の理論が発達心理学の文脈を中心に研究されてきたことを踏まえて,オープンウェイトなLLMのシリーズにおける成長傾向を分析する.結果として,LLMの文章読解力は向上している一方で,LLMが持つ心の理論は発達したとは言えないことが分かった.最後に,LLMが持つ心の理論に関する安全性評価の現状と今後の課題を示す. |
| (英) |
As Large Language Models (LLMs) improve their performance, safety evaluations of LLMs have become more critical. In recent safety evaluations, some deceptive behaviors were observed, such as an LLM trying to turn off oversight mechanisms and deceiving developers or users. For example, if an LLM is doing some work and reads some information inconvenient for itself, it acts secretly and gives false answers to questions intended to confirm those results. To evaluate these deceptions against developers and users, we should verify whether LLMs' actions are based on their internal intent. This paper proposes that LLM developers evaluate the Theory of Mind in LLMs. First, we will review the Theory of Mind research and organize the evaluation criteria and tasks that LLM developers should do in safety evaluations. Theory of Mind has been primarily studied in developmental psychology; we analyze growth trends in each series of open-weight LLMs. As a result, although LLMs improve their reading comprehension performance, their Theory of Mind abilities do not improve. Finally, we will clarify the future direction related to the safety evaluations of the Theory of Mind in LLMs. |
| キーワード |
(和) |
大規模言語モデル / 安全性評価 / 心の理論 / / / / / |
| (英) |
Large Language Models / safety evaluations / Theory of Mind / / / / / |
| 文献情報 |
信学技報, vol. 124, no. 422, ICSS2024-104, pp. 273-280, 2025年3月. |
| 資料番号 |
ICSS2024-104 |
| 発行日 |
2025-02-27 (ICSS) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
ICSS2024-104 |
| 研究会情報 |
| 研究会 |
ICSS IPSJ-SPT |
| 開催期間 |
2025-03-06 - 2025-03-07 |
| 開催地(和) |
沖縄県立美術館・博物館 |
| 開催地(英) |
Okinawa Prefectural Museum & Art Museum |
| テーマ(和) |
セキュリティ,トラスト,一般 |
| テーマ(英) |
Security, Trust, etc. |
| 講演論文情報の詳細 |
| 申込み研究会 |
ICSS |
| 会議コード |
2025-03-ICSS-SPT |
| 本文の言語 |
日本語 |
| タイトル(和) |
大規模言語モデルが持つ心の理論に関する安全性評価に向けて |
| サブタイトル(和) |
|
| タイトル(英) |
Towards Safety Evaluations of Theory of Mind in Large Language Models |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
大規模言語モデル / Large Language Models |
| キーワード(2)(和/英) |
安全性評価 / safety evaluations |
| キーワード(3)(和/英) |
心の理論 / Theory of Mind |
| キーワード(4)(和/英) |
/ |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
青島 達大 / Tatsuhiro Aoshima / アオシマ タツヒロ |
| 第1著者 所属(和/英) |
NTT社会情報研究所 (略称: NTT)
NTT Social Informatics Laboratories (略称: NTT) |
| 第2著者 氏名(和/英/ヨミ) |
秋山 満昭 / Mitsuaki Akiyama / アキヤマ ミツアキ |
| 第2著者 所属(和/英) |
NTT社会情報研究所 (略称: NTT)
NTT Social Informatics Laboratories (略称: NTT) |
| 第3著者 氏名(和/英/ヨミ) |
/ / |
| 第3著者 所属(和/英) |
(略称: )
(略称: ) |
| 第4著者 氏名(和/英/ヨミ) |
/ / |
| 第4著者 所属(和/英) |
(略称: )
(略称: ) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2025-03-07 11:25:00 |
| 発表時間 |
20分 |
| 申込先研究会 |
ICSS |
| 資料番号 |
ICSS2024-104 |
| 巻番号(vol) |
vol.124 |
| 号番号(no) |
no.422 |
| ページ範囲 |
pp.273-280 |
| ページ数 |
8 |
| 発行日 |
2025-02-27 (ICSS) |
|