| 講演抄録/キーワード |
| 講演名 |
2009-12-21 13:00
WFSTに基づく音声認識デコーダの最近の評価実験報告 ○ディクソン ポール・ノヴァク ジョセフ・大西 翼・古井貞熙(東工大) NLC2009-14 SP2009-78 |
| 抄録 |
(和) |
本論文では、東京工業大学で開発されているトランスデューサ駆動音声認識デコーダ (T3)に対する最近の評価結果を報告する。二つのASRタスクによって評価を行った。一つ目のタスクは、JNASコーパスによる大語彙連続音声認識のトランスクリプションであり、二つ目は、乗換案内情報における音声検索のタスクである。まず、WFSTネットワーク構築方法の徹底比較によって、高速かつ高精度のネットワークの効率の良い構築方法について報告する。さらに、音声検索のタスクで、HTKとSphinxTrainの音響モデルを、T3で比較し、その結果を報告する。実験の結果から、WFSTネットワークの構築において、logセミリングを使用した方が総合的に良く、T3の柔軟性と高速性を新しいタスクによって確認することができた。 |
| (英) |
This paper describes the latest performance evaluations on the Tokyo Tech Transducer-based (T3) speech decoder. These evaluations focus on two particular tasks which include a large-vocabulary continuous speech
transcription system with a 460k vocabulary evaluated on the JNAS corpus, and a voice search system developed for an all-Japan train timetables task. This paper provides a detailed explanation of the successful steps taken to construct a large integrated network which achieves high recognition performance, based on an exhaustive comparison of different construction strategies. Furthermore, in the context of the voice search task, this paper provides a performance comparison of two widely popular acoustic model toolkits, HTK and SphinxTrain in the unified context of the T3 decoder. In particular these results indicate that there is a significant advantage to employing the log semiring for all WFST construction operations. These results also serve to further verify the flexibility and speed of the T3 decoder on a variety of different tasks. |
| キーワード |
(和) |
音声認識 / WFST / 大語彙連続音声認識 / / / / / |
| (英) |
Speech Recognition / WFST / LVCSR / / / / / |
| 文献情報 |
信学技報, vol. 109, no. 356, SP2009-78, pp. 25-30, 2009年12月. |
| 資料番号 |
SP2009-78 |
| 発行日 |
2009-12-14 (NLC, SP) |
| ISSN |
Print edition: ISSN 0913-5685 Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
NLC2009-14 SP2009-78 |
| 研究会情報 |
| 研究会 |
SP NLC |
| 開催期間 |
2009-12-21 - 2009-12-22 |
| 開催地(和) |
東京大学・山上会館 |
| 開催地(英) |
Univ. of Tokyo |
| テーマ(和) |
第11回音声言語シンポジウム(SP・NLC共催/SLP連催) |
| テーマ(英) |
11th Spoken Language Symposium (SP/NLC/SLP) |
| 講演論文情報の詳細 |
| 申込み研究会 |
SP |
| 会議コード |
2009-12-SP-NLC |
| 本文の言語 |
英語(日本語タイトルあり) |
| タイトル(和) |
WFSTに基づく音声認識デコーダの最近の評価実験報告 |
| サブタイトル(和) |
|
| タイトル(英) |
Recent Evaluations of a WFST-Based Speech Recognition Decoder |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
音声認識 / Speech Recognition |
| キーワード(2)(和/英) |
WFST / WFST |
| キーワード(3)(和/英) |
大語彙連続音声認識 / LVCSR |
| キーワード(4)(和/英) |
/ |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
ディクソン ポール / Paul R. Dixon / ディクソン ポール |
| 第1著者 所属(和/英) |
東京工業大学 (略称: 東工大)
Tokyo Institute of Technology (略称: Tokyo Inst. of Tech.) |
| 第2著者 氏名(和/英/ヨミ) |
ノヴァク ジョセフ / Josef R. Novak / ノヴァク ジョセフ |
| 第2著者 所属(和/英) |
東京工業大学 (略称: 東工大)
Tokyo Institute of Technology (略称: Tokyo Inst. of Tech.) |
| 第3著者 氏名(和/英/ヨミ) |
大西 翼 / Tasuku Oonishi / オーニシ タスク |
| 第3著者 所属(和/英) |
東京工業大学 (略称: 東工大)
Tokyo Institute of Technology (略称: Tokyo Inst. of Tech.) |
| 第4著者 氏名(和/英/ヨミ) |
古井 貞熙 / Sadaoki Furui / フルイ サダオキ |
| 第4著者 所属(和/英) |
東京工業大学 (略称: 東工大)
Tokyo Institute of Technology (略称: Tokyo Inst. of Tech.) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2009-12-21 13:00:00 |
| 発表時間 |
25分 |
| 申込先研究会 |
SP |
| 資料番号 |
NLC2009-14, SP2009-78 |
| 巻番号(vol) |
vol.109 |
| 号番号(no) |
no.355(NLC), no.356(SP) |
| ページ範囲 |
pp.25-30 |
| ページ数 |
6 |
| 発行日 |
2009-12-14 (NLC, SP) |