| 講演抄録/キーワード |
| 講演名 |
2021-03-04 16:45
オーディオビジュアル目的話者抽出の実環境動作に向けたattention機構の検討 ○佐藤 宏・落合 翼・木下慶介・デルクロア マーク・中谷智広・荒木章子(NTT) EA2020-88 SIP2020-119 SP2020-53 |
| 抄録 |
(和) |
目的話者抽出技術とは, 目的話者に関する手がかりを用いて混合音からその話者の音声を抽出する技術である. 従来目的話者手がかりとして, 事前に登録した目的話者の音声 (audio手がかり) を用いる手法と, 目的話者の顔の動画 (visual手がかり) を用いる手法が提案されてきた. さらに近年ではより頑健に抽出が可能な手法としてaudio手がかりとvisual手がかり両者を用いるaudio-visual目的話者抽出が検討されている. これまでにaudio-visual目的話者抽出は, 単一モーダルの手がかりを用いる手法と比較して頑健に動作することがシミュレーションデータに対して示されている. しかしその実環境への適用に関する検討はまだ十分なされていなかった. audio-visual目的話者抽出の実環境適応における課題の1つは手がかりの欠損である. 例えば撮影されたvisual手がかりが話者の手をはじめとする遮蔽物に隠された場合など, 実環境において手がかりは必ずしも高い信頼性で得られるとは限らない. 本研究では信頼性の低い手がかりの悪影響を低減し, より頑健な動作を実現するために, 異なるモーダルから得られる手がかりの情報を信頼性に基づいて重みづけて統合する新たなattention機構とその学習方法を提案した. シミュレーションデータを用いた評価実験の結果, 提案法は従来手法と比較してSDRを1.0 dB改善することが確認された. 加えて本研究では実収録データを作成し, 提案法を用いたaudio-visual目的話者抽出が実収録データに対しても動作することを示した. |
| (英) |
The audio-visual target speech extraction, which aims at extracting a target speaker's voice from a mixture with audio and visual clues, has received much interest.
In previous works, the audio-visual target speaker extraction has shown more stable performance than single modality methods for simulated data.
However, its adaptation towards realistic situations has not been fully explored as well as evaluations on real recorded mixtures.
Especially, we focus on clue corruption problem that occurs often in real recordings.
In this work, we propose a novel attention mechanism for multi-modal fusion and its training methods that enable to selective use of more reliable clues.
We record an audio-visual dataset of simultaneous speech with realistic visual clue corruption, and show that audio-visual target speech extraction with our proposals successfully work on real data as well as on simulated data. |
| キーワード |
(和) |
オーディオビジュアル / 目的話者抽出 / マルチモーダル / SpeakerBeam / / / / |
| (英) |
audio-visual / multi-modal fusion / target speaker extraction / SpeakerBeam / / / / |
| 文献情報 |
信学技報, vol. 120, no. 399, SP2020-53, pp. 170-175, 2021年3月. |
| 資料番号 |
SP2020-53 |
| 発行日 |
2021-02-24 (EA, SIP, SP) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
EA2020-88 SIP2020-119 SP2020-53 |
| 研究会情報 |
| 研究会 |
EA US SP SIP IPSJ-SLP |
| 開催期間 |
2021-03-03 - 2021-03-04 |
| 開催地(和) |
オンライン開催 |
| 開催地(英) |
Online |
| テーマ(和) |
音声,応用/電気音響,信号処理,超音波,一般 |
| テーマ(英) |
Speech, Engineering/Electro Acoustics, Signal Processing, Ultrasonics, and Related Topics |
| 講演論文情報の詳細 |
| 申込み研究会 |
SP |
| 会議コード |
2021-03-EA-US-SP-SIP-SLP |
| 本文の言語 |
日本語 |
| タイトル(和) |
オーディオビジュアル目的話者抽出の実環境動作に向けたattention機構の検討 |
| サブタイトル(和) |
|
| タイトル(英) |
Evaluation of Attention Fusion based Audio-Visual Target Speaker Extraction on Real Recordings |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
オーディオビジュアル / audio-visual |
| キーワード(2)(和/英) |
目的話者抽出 / multi-modal fusion |
| キーワード(3)(和/英) |
マルチモーダル / target speaker extraction |
| キーワード(4)(和/英) |
SpeakerBeam / SpeakerBeam |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
佐藤 宏 / Hiroshi Sato / サトウ ヒロシ |
| 第1著者 所属(和/英) |
日本電信電話株式会社 (略称: NTT)
NTT Corporation (略称: NTT) |
| 第2著者 氏名(和/英/ヨミ) |
落合 翼 / Tsubasa Ochiai / オチアイ ツバサ |
| 第2著者 所属(和/英) |
日本電信電話株式会社 (略称: NTT)
NTT Corporation (略称: NTT) |
| 第3著者 氏名(和/英/ヨミ) |
木下 慶介 / Keisuke Kinoshita / キノシタ ケイスケ |
| 第3著者 所属(和/英) |
日本電信電話株式会社 (略称: NTT)
NTT Corporation (略称: NTT) |
| 第4著者 氏名(和/英/ヨミ) |
デルクロア マーク / Marc Delcroix / デルクロア マーク |
| 第4著者 所属(和/英) |
日本電信電話株式会社 (略称: NTT)
NTT Corporation (略称: NTT) |
| 第5著者 氏名(和/英/ヨミ) |
中谷 智広 / Tomohiro Nakatani / ナカタニ トモヒロ |
| 第5著者 所属(和/英) |
日本電信電話株式会社 (略称: NTT)
NTT Corporation (略称: NTT) |
| 第6著者 氏名(和/英/ヨミ) |
荒木 章子 / Shoko Araki / アラキ ショウコ |
| 第6著者 所属(和/英) |
日本電信電話株式会社 (略称: NTT)
NTT Corporation (略称: NTT) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2021-03-04 16:45:00 |
| 発表時間 |
25分 |
| 申込先研究会 |
SP |
| 資料番号 |
EA2020-88, SIP2020-119, SP2020-53 |
| 巻番号(vol) |
vol.120 |
| 号番号(no) |
no.397(EA), no.398(SIP), no.399(SP) |
| ページ範囲 |
pp.170-175 |
| ページ数 |
6 |
| 発行日 |
2021-02-24 (EA, SIP, SP) |
|