ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2022-10-21 15:25
音声対話型UI間の協調動作のための音声発生源判別法に適した特徴量と深層学習モデル
前田健吾吉田孝博東京理科大PRMU2022-27
抄録 (和) 今後,ユーザの利用環境において音声対話型のユーザインタフェース(UI)を搭載した機器が複数存在するようになると,それぞれの機器が正しく動作するためには,人が直接発した音声と機器から再生された音声を判別する技術が必要となる.そのため当研究室の先行研究では,Convolutional Neural Network(CNN)とMel-Frequency Cepstral Coefficients(MFCC)を用いた音声発生源判別法を提案した.しかし,先行研究では,音声発生源判別に適した特徴量や深層学習のモデルに関しては検討が不足していた.そこで本研究では,音声発生源判別法に適した特徴量と深層学習のモデルについて調査するために,複数種の特徴量と深層学習モデルについて,音声発生源判別実験により精度を比較した.その結果,MFCCは次元数を増やすほど判別精度が向上することから,スペクトルの微細構造も音声発生源判別法においては重要であることを確認した.また,事前学習済みモデルに対して深層学習の手法の一つであるファインチューニングを行ったモデルが音声発生源判別法においても有効であることを確認した. 
(英) Under the situation that plural devices equipped with a voice user interface exist in the user’s environment in the near future, technology to discriminate between directly uttered speech by the user and playbacked speech from a device will be necessary for each device to work correctly. Therefore, our previous study proposed a speech source discrimination method using a Convolutional Neural Network (CNN) and Mel-Frequency Cepstral Coefficients (MFCC). However, features and deep learning models suitable for the speech source discrimination method have not been researched in previous studies. Therefore, in this study, we compared and evaluated several features and deep learning models by their speech source discrimination accuracy to investigate suitable features and deep learning models for the speech source discrimination method. From the experimental results, we confirmed that the rich feature that includes the fine structure of the spectrum is effective for the speech source discrimination method, since the discrimination accuracy of MFCC improves as the number of dimensions increase. We also confirmed that using a pre-learned model with re-learning by fine-tuning is also effective for the speech source discrimination method.
キーワード (和) 音声対話型UI / 音源判別 / 畳み込みニューラルネットワーク / ファインチューニング / / / /  
(英) Voice user interface / Speech source discrimination / Convolutional neural network / Fine-tuning / / / /  
文献情報 信学技報, vol. 122, no. 223, PRMU2022-27, pp. 29-34, 2022年10月.
資料番号 PRMU2022-27 
発行日 2022-10-14 (PRMU) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード PRMU2022-27

研究会情報
研究会 PRMU  
開催期間 2022-10-21 - 2022-10-22 
開催地(和) 日本科学未来館 
開催地(英) Miraikan - The National Museum of Emerging Science and Innovation 
テーマ(和) 人に関わる認識・理解 
テーマ(英) Recognition and understanding related to people 
講演論文情報の詳細
申込み研究会 PRMU 
会議コード 2022-10-PRMU 
本文の言語 日本語 
タイトル(和) 音声対話型UI間の協調動作のための音声発生源判別法に適した特徴量と深層学習モデル 
サブタイトル(和)  
タイトル(英) Features and Deep Learning Models Suitable for Speech Source Discrimination Method in Plural Voice User Interfaces Environment 
サブタイトル(英)  
キーワード(1)(和/英) 音声対話型UI / Voice user interface  
キーワード(2)(和/英) 音源判別 / Speech source discrimination  
キーワード(3)(和/英) 畳み込みニューラルネットワーク / Convolutional neural network  
キーワード(4)(和/英) ファインチューニング / Fine-tuning  
キーワード(5)(和/英) /  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 前田 健吾 / Kengo Maeda / マエダ ケンゴ
第1著者 所属(和/英) 東京理科大学 (略称: 東京理科大)
Tokyo University of Science (略称: TUS)
第2著者 氏名(和/英/ヨミ) 吉田 孝博 / Takahiro Yoshida / ヨシダ タカヒロ
第2著者 所属(和/英) 東京理科大学 (略称: 東京理科大)
Tokyo University of Science (略称: TUS)
第3著者 氏名(和/英/ヨミ) / /
第3著者 所属(和/英) (略称: )
(略称: )
第4著者 氏名(和/英/ヨミ) / /
第4著者 所属(和/英) (略称: )
(略称: )
第5著者 氏名(和/英/ヨミ) / /
第5著者 所属(和/英) (略称: )
(略称: )
第6著者 氏名(和/英/ヨミ) / /
第6著者 所属(和/英) (略称: )
(略称: )
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2022-10-21 15:25:00 
発表時間 15分 
申込先研究会 PRMU 
資料番号 PRMU2022-27 
巻番号(vol) vol.122 
号番号(no) no.223 
ページ範囲 pp.29-34 
ページ数
発行日 2022-10-14 (PRMU) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会