| 講演抄録/キーワード |
| 講演名 |
2023-03-01 09:30
Neural Transducer型音声認識におけるScheduled Samplingの検討 ○森谷崇史・芦原孝典・佐藤 宏・松浦孝平・田中智大・増村 亮(NTT) EA2022-100 SIP2022-144 SP2022-64 |
| 抄録 |
(和) |
本研究ではRecurrent neural network-transducer(RNNT)を用いた音声認識におけるScheduled sampling(SS)を提案する.SSは自己回帰モデルにおいて認識誤りに頑健となるように,学習時にモデルの実際の出力をランダムに正解ラベルと入れ替えて学習する手法である.SSは注意機構付きEncoder-Decoderで提案された手法であり,自己回帰モデルにおけるExposure biasと呼ばれる学習時と推論時のモデルの挙動の違いを抑制するアプローチである.しかしながらRNNTの学習時において複雑な出力形式をとるため,SSをRNNTへ適用することは困難である.本研究でRNNTの全パラメタ,または一部のパラメタである内部言語モデルの出力分布に従ってサンプリングを行うRNNTのためのSSを提案する.3つのコーパスを用いて実験を行い,提案手法のSSを用いて学習したRNNTが最も良い認識性能を達成することを確認した.また,日本語話し言葉コーパスでは他の文献と比較しても最高性能を達成したことを報告する. |
| (英) |
In this paper, we propose scheduled sampling approaches suited for the recurrent neural network-transducer (RNNT) that is a promising approach for automatic speech recognition (ASR). SS is a technique to train autoregressive model robustly to past errors by randomly replacing some ground-truth tokens with actual outputs generated from a model. SS mitigates the gaps between training and decoding steps, known as exposure bias, and it is often used for attentional encoder-decoder training. However, SS has not been fully examined for RNNT because of the difficulty in applying SS to RNNT due to the complicated RNNT output form. Our SS approaches sample the tokens generated from the distribution of RNNT itself, i.e. internal language model or RNNT outputs. Experiments in three datasets confirm that RNNT trained with our SS approach achieves the best ASR performance. In particular, on a Japanese ASR task, our best system outperforms the previous state-of-the-art alternative. |
| キーワード |
(和) |
音声認識 / neural network / end-to-end / recurrent neural network-transducer / scheduled sampling / / / |
| (英) |
automatic speech recognition / neural network / end-to-end / recurrent neural network-transducer / scheduled sampling / / / |
| 文献情報 |
信学技報, vol. 122, no. 389, SP2022-64, pp. 147-152, 2023年2月. |
| 資料番号 |
SP2022-64 |
| 発行日 |
2023-02-21 (EA, SIP, SP) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
EA2022-100 SIP2022-144 SP2022-64 |
| 研究会情報 |
| 研究会 |
SP IPSJ-SLP EA SIP |
| 開催期間 |
2023-02-28 - 2023-03-01 |
| 開催地(和) |
沖縄県立博物館・美術館 |
| 開催地(英) |
|
| テーマ(和) |
音声,応用/電気音響, 信号処理,一般 |
| テーマ(英) |
|
| 講演論文情報の詳細 |
| 申込み研究会 |
SP |
| 会議コード |
2023-02-SP-SLP-EA-SIP |
| 本文の言語 |
日本語 |
| タイトル(和) |
Neural Transducer型音声認識におけるScheduled Samplingの検討 |
| サブタイトル(和) |
|
| タイトル(英) |
A Study on Scheduled Sampling for Neural Transducer-based ASR |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
音声認識 / automatic speech recognition |
| キーワード(2)(和/英) |
neural network / neural network |
| キーワード(3)(和/英) |
end-to-end / end-to-end |
| キーワード(4)(和/英) |
recurrent neural network-transducer / recurrent neural network-transducer |
| キーワード(5)(和/英) |
scheduled sampling / scheduled sampling |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
森谷 崇史 / Takafumi Moriya / モリヤ タカフミ |
| 第1著者 所属(和/英) |
NTT (略称: NTT)
NTT (略称: NTT) |
| 第2著者 氏名(和/英/ヨミ) |
芦原 孝典 / Takanori Ashihara / アシハラ タカノリ |
| 第2著者 所属(和/英) |
NTT (略称: NTT)
NTT (略称: NTT) |
| 第3著者 氏名(和/英/ヨミ) |
佐藤 宏 / Hiroshi Sato / サトウ ヒロシ |
| 第3著者 所属(和/英) |
NTT (略称: NTT)
NTT (略称: NTT) |
| 第4著者 氏名(和/英/ヨミ) |
松浦 孝平 / Kohei Matsuura / マツウラ コウヘイ |
| 第4著者 所属(和/英) |
NTT (略称: NTT)
NTT (略称: NTT) |
| 第5著者 氏名(和/英/ヨミ) |
田中 智大 / Tomohiro Tanaka / タナカ トモヒロ |
| 第5著者 所属(和/英) |
NTT (略称: NTT)
NTT (略称: NTT) |
| 第6著者 氏名(和/英/ヨミ) |
増村 亮 / Ryo Masumura / マスムラ リョウ |
| 第6著者 所属(和/英) |
NTT (略称: NTT)
NTT (略称: NTT) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2023-03-01 09:30:00 |
| 発表時間 |
20分 |
| 申込先研究会 |
SP |
| 資料番号 |
EA2022-100, SIP2022-144, SP2022-64 |
| 巻番号(vol) |
vol.122 |
| 号番号(no) |
no.387(EA), no.388(SIP), no.389(SP) |
| ページ範囲 |
pp.147-152 |
| ページ数 |
6 |
| 発行日 |
2023-02-21 (EA, SIP, SP) |
|