ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2024-05-22 14:15
音声強調で音声認識性能はなぜ劣化するのか? ~ 音声強調誤差が音声認識性能に与える影響の分析 ~
落合 翼NTT)・岩本一真同志社大)・デルクロア マーク池下林太郎佐藤 宏荒木章子NTT)・片桐 滋同志社大EA2024-4
抄録 (和) 深層学習技術は,シングルチャネル音声強調の音声強調性能を劇的に向上させた.しかし近年の研究において,こうしたシングルチャネル音声強調は音声認識性能の向上には必ずしも寄与せず,観測された雑音付き音声信号と比較してもむしろ音声認識性能を劣化させる場合もあることが多数報告されている.従来研究においては,シングルチャネル音声強調によって生じる処理歪みが音声認識を劣化させる要因であると仮定されていた.しかし,そうした音声認識性能を劣化させる処理歪みに関して,詳細な分析や数学的な指標は検討されていなかった.本研究では,シングルチャネル音声強調がなぜ音声認識性能を劣化させるのかについての分析を行い、音声強調誤差に含まれるartifact誤差 [1] が音声認識性能の劣化を引き起こす要因であることを明らかにした [2], [3].また,音声強調フロントエンドを音声認識レベルの学習基準で最適化することによりartifact誤差が低減されることを実験的に示すとともに,強調信号に観測信号を加えることでartifact誤差が低減できることを数理的,実験的に示した.こうした音声認識性能の劣化要因に関する知見は,音声認識に適したシングルチャネル音声強調フロントエンドの設計を考える上で重要なものである. 
(英) Deep learning techniques have dramatically improved the speech enhancement (SE) performance of single-channel SE. However, recent studies has reported that such single-channel SE does not necessarily contribute to improve automatic speech recognition (ASR) performance but rather degrade it compared to inputting observed noisy signals directly. In conventional studies, it is often assumed that processing distortions induced by the single-channel SE are the cause that degrades ASR performance. However, there have been no detailed analyses and mathematical metrics to explain such processing distortions that could degrades the ASR performance. In this study, we analyzed why the single-channel SE degrades ASR performance, and revealed that artifact errors [1] contained in SE errors is the cause that degrades the ASR performance [2], [3]. We also showed experimentally that the artifact errors are reduced by optimizing the SE front-end based on the ASR-level training objective, and also showed mathematically and experimentally that the artifact errors can be reduced by adding an observation signal to the enhanced signal. Insights on this issue would be valuable for designing single-channel SE front-ends suitable for ASR.
キーワード (和) シングルチャネル音声強調 / ロバスト音声認識 / 処理歪み / / / / /  
(英) single-channel speech enhancement / robust automatic speech recognition / processing distortion / / / / /  
文献情報 信学技報, vol. 124, no. 42, EA2024-4, pp. 20-21, 2024年5月.
資料番号 EA2024-4 
発行日 2024-05-15 (EA) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード EA2024-4

研究会情報
研究会 EA  
開催期間 2024-05-22 - 2024-05-22 
開催地(和) オンライン開催 
開催地(英) Online 
テーマ(和) <オーガナイズドセッション>応用/電気音響,一般 
テーマ(英)  
講演論文情報の詳細
申込み研究会 EA 
会議コード 2024-05-EA 
本文の言語 日本語 
タイトル(和) 音声強調で音声認識性能はなぜ劣化するのか? 
サブタイトル(和) 音声強調誤差が音声認識性能に与える影響の分析 
タイトル(英) Why speech enhancement degrades speech recognition performance? 
サブタイトル(英) Analysis of effect of speech enhancement errors on speech recognition performance 
キーワード(1)(和/英) シングルチャネル音声強調 / single-channel speech enhancement  
キーワード(2)(和/英) ロバスト音声認識 / robust automatic speech recognition  
キーワード(3)(和/英) 処理歪み / processing distortion  
キーワード(4)(和/英) /  
キーワード(5)(和/英) /  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 落合 翼 / Tsubasa Ochiai /
第1著者 所属(和/英) 日本電信電話株式会社 (略称: NTT)
NIPPON TELEGRAPH AND TELEPHONE CORPORATION (略称: NTT)
第2著者 氏名(和/英/ヨミ) 岩本 一真 / Kazuma Iwamoto /
第2著者 所属(和/英) 同志社大学 (略称: 同志社大)
Doshisha University (略称: Doshisha Univ.)
第3著者 氏名(和/英/ヨミ) デルクロア マーク / Marc Delcroix /
第3著者 所属(和/英) 日本電信電話株式会社 (略称: NTT)
NIPPON TELEGRAPH AND TELEPHONE CORPORATION (略称: NTT)
第4著者 氏名(和/英/ヨミ) 池下 林太郎 / Rintaro Ikeshita /
第4著者 所属(和/英) 日本電信電話株式会社 (略称: NTT)
NIPPON TELEGRAPH AND TELEPHONE CORPORATION (略称: NTT)
第5著者 氏名(和/英/ヨミ) 佐藤 宏 / Hiroshi Sato /
第5著者 所属(和/英) 日本電信電話株式会社 (略称: NTT)
NIPPON TELEGRAPH AND TELEPHONE CORPORATION (略称: NTT)
第6著者 氏名(和/英/ヨミ) 荒木 章子 / Shoko Araki /
第6著者 所属(和/英) 日本電信電話株式会社 (略称: NTT)
NIPPON TELEGRAPH AND TELEPHONE CORPORATION (略称: NTT)
第7著者 氏名(和/英/ヨミ) 片桐 滋 / Shigeru Katagiri /
第7著者 所属(和/英) 同志社大学 (略称: 同志社大)
Doshisha University (略称: Doshisha Univ.)
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2024-05-22 14:15:00 
発表時間 25分 
申込先研究会 EA 
資料番号 EA2024-4 
巻番号(vol) vol.124 
号番号(no) no.42 
ページ範囲 pp.20-21 
ページ数
発行日 2024-05-15 (EA) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会