| 講演抄録/キーワード |
| 講演名 |
2022-10-21 15:25
音声対話型UI間の協調動作のための音声発生源判別法に適した特徴量と深層学習モデル ○前田健吾・吉田孝博(東京理科大) PRMU2022-27 |
| 抄録 |
(和) |
今後,ユーザの利用環境において音声対話型のユーザインタフェース(UI)を搭載した機器が複数存在するようになると,それぞれの機器が正しく動作するためには,人が直接発した音声と機器から再生された音声を判別する技術が必要となる.そのため当研究室の先行研究では,Convolutional Neural Network(CNN)とMel-Frequency Cepstral Coefficients(MFCC)を用いた音声発生源判別法を提案した.しかし,先行研究では,音声発生源判別に適した特徴量や深層学習のモデルに関しては検討が不足していた.そこで本研究では,音声発生源判別法に適した特徴量と深層学習のモデルについて調査するために,複数種の特徴量と深層学習モデルについて,音声発生源判別実験により精度を比較した.その結果,MFCCは次元数を増やすほど判別精度が向上することから,スペクトルの微細構造も音声発生源判別法においては重要であることを確認した.また,事前学習済みモデルに対して深層学習の手法の一つであるファインチューニングを行ったモデルが音声発生源判別法においても有効であることを確認した. |
| (英) |
Under the situation that plural devices equipped with a voice user interface exist in the user’s environment in the near future, technology to discriminate between directly uttered speech by the user and playbacked speech from a device will be necessary for each device to work correctly. Therefore, our previous study proposed a speech source discrimination method using a Convolutional Neural Network (CNN) and Mel-Frequency Cepstral Coefficients (MFCC). However, features and deep learning models suitable for the speech source discrimination method have not been researched in previous studies. Therefore, in this study, we compared and evaluated several features and deep learning models by their speech source discrimination accuracy to investigate suitable features and deep learning models for the speech source discrimination method. From the experimental results, we confirmed that the rich feature that includes the fine structure of the spectrum is effective for the speech source discrimination method, since the discrimination accuracy of MFCC improves as the number of dimensions increase. We also confirmed that using a pre-learned model with re-learning by fine-tuning is also effective for the speech source discrimination method. |
| キーワード |
(和) |
音声対話型UI / 音源判別 / 畳み込みニューラルネットワーク / ファインチューニング / / / / |
| (英) |
Voice user interface / Speech source discrimination / Convolutional neural network / Fine-tuning / / / / |
| 文献情報 |
信学技報, vol. 122, no. 223, PRMU2022-27, pp. 29-34, 2022年10月. |
| 資料番号 |
PRMU2022-27 |
| 発行日 |
2022-10-14 (PRMU) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
PRMU2022-27 |
| 研究会情報 |
| 研究会 |
PRMU |
| 開催期間 |
2022-10-21 - 2022-10-22 |
| 開催地(和) |
日本科学未来館 |
| 開催地(英) |
Miraikan - The National Museum of Emerging Science and Innovation |
| テーマ(和) |
人に関わる認識・理解 |
| テーマ(英) |
Recognition and understanding related to people |
| 講演論文情報の詳細 |
| 申込み研究会 |
PRMU |
| 会議コード |
2022-10-PRMU |
| 本文の言語 |
日本語 |
| タイトル(和) |
音声対話型UI間の協調動作のための音声発生源判別法に適した特徴量と深層学習モデル |
| サブタイトル(和) |
|
| タイトル(英) |
Features and Deep Learning Models Suitable for Speech Source Discrimination Method in Plural Voice User Interfaces Environment |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
音声対話型UI / Voice user interface |
| キーワード(2)(和/英) |
音源判別 / Speech source discrimination |
| キーワード(3)(和/英) |
畳み込みニューラルネットワーク / Convolutional neural network |
| キーワード(4)(和/英) |
ファインチューニング / Fine-tuning |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
前田 健吾 / Kengo Maeda / マエダ ケンゴ |
| 第1著者 所属(和/英) |
東京理科大学 (略称: 東京理科大)
Tokyo University of Science (略称: TUS) |
| 第2著者 氏名(和/英/ヨミ) |
吉田 孝博 / Takahiro Yoshida / ヨシダ タカヒロ |
| 第2著者 所属(和/英) |
東京理科大学 (略称: 東京理科大)
Tokyo University of Science (略称: TUS) |
| 第3著者 氏名(和/英/ヨミ) |
/ / |
| 第3著者 所属(和/英) |
(略称: )
(略称: ) |
| 第4著者 氏名(和/英/ヨミ) |
/ / |
| 第4著者 所属(和/英) |
(略称: )
(略称: ) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2022-10-21 15:25:00 |
| 発表時間 |
15分 |
| 申込先研究会 |
PRMU |
| 資料番号 |
PRMU2022-27 |
| 巻番号(vol) |
vol.122 |
| 号番号(no) |
no.223 |
| ページ範囲 |
pp.29-34 |
| ページ数 |
6 |
| 発行日 |
2022-10-14 (PRMU) |