| 講演抄録/キーワード |
| 講演名 |
2026-03-16 11:35
マルチモーダルなキャラクタ設定データに適した話者性を有するテキスト音声合成 ○迫田正太・平尾悠太朗・ペルスキアエルナンデス モニカ・内山英昭・清川 清(奈良先端大) IMQ2025-29 IE2025-106 MVE2025-36 |
| 抄録 |
(和) |
アニメーション制作では, 配信を含む流通拡大に伴い制作需要が増加しており, 品質を維持したまま工程を効率化する支援が求められている. 作画・映像工程では機械学習に基づく支援が整備されつつある一方で, 完成映像に合わせて台詞を録音するアフレコ工程を直接支援する技術は十分ではなく, 現場負担が大きい.本稿では, 顔画像とキャラクタ設定文から話者埋め込みを推定し,高品質 TTS 基盤へ条件として注入するマルチモーダル入力(顔画像 + 設定文)の音声合成手法を提案する. 特に,設定文からの推定を安定化する性別スタイル分解と, 入力の品質・情報量に応じて重み付けを調整する不確かさ考慮 Gated Fusion により,外見手掛かりと人物像手掛かりを統合する. 148 名のアニメキャラクタから構築したデータセットで評価した結果, 提案手法はユニモーダル入力(顔画像のみ/設定文のみ)と比較して主観評価(自然性・親和性)を有意に改善した. さらに, キャラクタとの親和度(MOS-Match)ではキャラクタ本来の声(GT)と同等以上の評価が得られ,実制作における声設計・候補比較を支援し得る可能性を示した. 加えて, 埋め込み空間の可視化からも, 多様な話者性の表現と分離の傾向を確認した. |
| (英) |
Animation production increasingly demands workflow support that improves efficiency without sacrificing quality, yet direct assistance for voice recording remains limited. This paper proposes a multimodal text-to-speech framework that estimates speaker embeddings from facial images and natural-language character descriptions and injects them into a high-quality TTS backbone. To stabilize text-based estimation, we introduce a gender-style decomposition that separates the dominant gender-direction component from residual personality components. We further propose an uncertainty-aware gated fusion that adaptively integrates modalities depending on input quality and information content. Experiments on a dataset of 148 anime characters show that the proposed method significantly improves MOS-based naturalness and character-voice affinity relative to unimodal baselines. Moreover, the character-voice affinity (MOS-Match) is comparable to, and in some cases higher than, the ground-truth reference condition (GT), suggesting its potential to support voice design and candidate comparison in production. Embedding-space analyses further confirm improved diversity and separation. |
| キーワード |
(和) |
音声合成 / Text-to-Speech / マルチモーダル学習 / アニメーション制作支援 / 音声制作支援 / / / |
| (英) |
Speech Synthesis / Text-to-Speech / Multimodal Learning / Animation Production Support / Voice Recording Support / / / |
| 文献情報 |
信学技報, vol. 125, no. 411, MVE2025-36, pp. 55-60, 2026年3月. |
| 資料番号 |
MVE2025-36 |
| 発行日 |
2026-03-09 (IMQ, IE, MVE) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
IMQ2025-29 IE2025-106 MVE2025-36 |
| 研究会情報 |
| 研究会 |
CQ MVE IMQ IE |
| 開催期間 |
2026-03-16 - 2026-03-18 |
| 開催地(和) |
沖縄産業支援センター |
| 開催地(英) |
Okinawa-Sangyoushien-Center |
| テーマ(和) |
五感に訴えるオンラインメディアとその評価,および一般 |
| テーマ(英) |
|
| 講演論文情報の詳細 |
| 申込み研究会 |
MVE |
| 会議コード |
2026-03-CQ-MVE-IMQ-IE |
| 本文の言語 |
日本語 |
| タイトル(和) |
マルチモーダルなキャラクタ設定データに適した話者性を有するテキスト音声合成 |
| サブタイトル(和) |
|
| タイトル(英) |
Text-to-Speech Synthesis with Speaker Identity Based on Multimodal Character Profile Data |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
音声合成 / Speech Synthesis |
| キーワード(2)(和/英) |
Text-to-Speech / Text-to-Speech |
| キーワード(3)(和/英) |
マルチモーダル学習 / Multimodal Learning |
| キーワード(4)(和/英) |
アニメーション制作支援 / Animation Production Support |
| キーワード(5)(和/英) |
音声制作支援 / Voice Recording Support |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
迫田 正太 / Shota Sakoda / サコダ ショウタ |
| 第1著者 所属(和/英) |
奈良先端科学技術大学院 (略称: 奈良先端大)
Nara Institute of Science (略称: NAIST) |
| 第2著者 氏名(和/英/ヨミ) |
平尾 悠太朗 / Yutaro Hirao / ヒラオ ユウタロウ |
| 第2著者 所属(和/英) |
奈良先端科学技術大学院 (略称: 奈良先端大)
Nara Institute of Science (略称: NAIST) |
| 第3著者 氏名(和/英/ヨミ) |
ペルスキアエルナンデス モニカ / Monica Perusquia-Hernandez / ペルスキアエルナンデス モニカ |
| 第3著者 所属(和/英) |
奈良先端科学技術大学院 (略称: 奈良先端大)
Nara Institute of Science (略称: NAIST) |
| 第4著者 氏名(和/英/ヨミ) |
内山 英昭 / Hideaki Uchiyama / ウチヤマ ヒデアキ |
| 第4著者 所属(和/英) |
奈良先端科学技術大学院 (略称: 奈良先端大)
Nara Institute of Science (略称: NAIST) |
| 第5著者 氏名(和/英/ヨミ) |
清川 清 / Kiyoshi Kiyokawa / キヨカワ キヨシ |
| 第5著者 所属(和/英) |
奈良先端科学技術大学院 (略称: 奈良先端大)
Nara Institute of Science (略称: NAIST) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2026-03-16 11:35:00 |
| 発表時間 |
20分 |
| 申込先研究会 |
MVE |
| 資料番号 |
IMQ2025-29, IE2025-106, MVE2025-36 |
| 巻番号(vol) |
vol.125 |
| 号番号(no) |
no.408(IMQ), no.410(IE), no.411(MVE) |
| ページ範囲 |
pp.55-60 |
| ページ数 |
6 |
| 発行日 |
2026-03-09 (IMQ, IE, MVE) |