ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2023-03-01 09:30
Neural Transducer型音声認識におけるScheduled Samplingの検討
森谷崇史芦原孝典佐藤 宏松浦孝平田中智大増村 亮NTTEA2022-100 SIP2022-144 SP2022-64
抄録 (和) 本研究ではRecurrent neural network-transducer(RNNT)を用いた音声認識におけるScheduled sampling(SS)を提案する.SSは自己回帰モデルにおいて認識誤りに頑健となるように,学習時にモデルの実際の出力をランダムに正解ラベルと入れ替えて学習する手法である.SSは注意機構付きEncoder-Decoderで提案された手法であり,自己回帰モデルにおけるExposure biasと呼ばれる学習時と推論時のモデルの挙動の違いを抑制するアプローチである.しかしながらRNNTの学習時において複雑な出力形式をとるため,SSをRNNTへ適用することは困難である.本研究でRNNTの全パラメタ,または一部のパラメタである内部言語モデルの出力分布に従ってサンプリングを行うRNNTのためのSSを提案する.3つのコーパスを用いて実験を行い,提案手法のSSを用いて学習したRNNTが最も良い認識性能を達成することを確認した.また,日本語話し言葉コーパスでは他の文献と比較しても最高性能を達成したことを報告する. 
(英) In this paper, we propose scheduled sampling approaches suited for the recurrent neural network-transducer (RNNT) that is a promising approach for automatic speech recognition (ASR). SS is a technique to train autoregressive model robustly to past errors by randomly replacing some ground-truth tokens with actual outputs generated from a model. SS mitigates the gaps between training and decoding steps, known as exposure bias, and it is often used for attentional encoder-decoder training. However, SS has not been fully examined for RNNT because of the difficulty in applying SS to RNNT due to the complicated RNNT output form. Our SS approaches sample the tokens generated from the distribution of RNNT itself, i.e. internal language model or RNNT outputs. Experiments in three datasets confirm that RNNT trained with our SS approach achieves the best ASR performance. In particular, on a Japanese ASR task, our best system outperforms the previous state-of-the-art alternative.
キーワード (和) 音声認識 / neural network / end-to-end / recurrent neural network-transducer / scheduled sampling / / /  
(英) automatic speech recognition / neural network / end-to-end / recurrent neural network-transducer / scheduled sampling / / /  
文献情報 信学技報, vol. 122, no. 389, SP2022-64, pp. 147-152, 2023年2月.
資料番号 SP2022-64 
発行日 2023-02-21 (EA, SIP, SP) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード EA2022-100 SIP2022-144 SP2022-64

研究会情報
研究会 SP IPSJ-SLP EA SIP  
開催期間 2023-02-28 - 2023-03-01 
開催地(和) 沖縄県立博物館・美術館 
開催地(英)  
テーマ(和) 音声,応用/電気音響, 信号処理,一般 
テーマ(英)  
講演論文情報の詳細
申込み研究会 SP 
会議コード 2023-02-SP-SLP-EA-SIP 
本文の言語 日本語 
タイトル(和) Neural Transducer型音声認識におけるScheduled Samplingの検討 
サブタイトル(和)  
タイトル(英) A Study on Scheduled Sampling for Neural Transducer-based ASR 
サブタイトル(英)  
キーワード(1)(和/英) 音声認識 / automatic speech recognition  
キーワード(2)(和/英) neural network / neural network  
キーワード(3)(和/英) end-to-end / end-to-end  
キーワード(4)(和/英) recurrent neural network-transducer / recurrent neural network-transducer  
キーワード(5)(和/英) scheduled sampling / scheduled sampling  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 森谷 崇史 / Takafumi Moriya / モリヤ タカフミ
第1著者 所属(和/英) NTT (略称: NTT)
NTT (略称: NTT)
第2著者 氏名(和/英/ヨミ) 芦原 孝典 / Takanori Ashihara / アシハラ タカノリ
第2著者 所属(和/英) NTT (略称: NTT)
NTT (略称: NTT)
第3著者 氏名(和/英/ヨミ) 佐藤 宏 / Hiroshi Sato / サトウ ヒロシ
第3著者 所属(和/英) NTT (略称: NTT)
NTT (略称: NTT)
第4著者 氏名(和/英/ヨミ) 松浦 孝平 / Kohei Matsuura / マツウラ コウヘイ
第4著者 所属(和/英) NTT (略称: NTT)
NTT (略称: NTT)
第5著者 氏名(和/英/ヨミ) 田中 智大 / Tomohiro Tanaka / タナカ トモヒロ
第5著者 所属(和/英) NTT (略称: NTT)
NTT (略称: NTT)
第6著者 氏名(和/英/ヨミ) 増村 亮 / Ryo Masumura / マスムラ リョウ
第6著者 所属(和/英) NTT (略称: NTT)
NTT (略称: NTT)
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2023-03-01 09:30:00 
発表時間 20分 
申込先研究会 SP 
資料番号 EA2022-100, SIP2022-144, SP2022-64 
巻番号(vol) vol.122 
号番号(no) no.387(EA), no.388(SIP), no.389(SP) 
ページ範囲 pp.147-152 
ページ数
発行日 2023-02-21 (EA, SIP, SP) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会