| 講演抄録/キーワード |
| 講演名 |
2011-11-30 10:05
6万語彙実時間連続音声認識のための40nm,144mW音声認識専用プロセッサの開発 ○菅原隆伸・何 光霽・藤永剛史・宮本優貴・野口紘希・和泉慎太郎・川口 博・吉本雅彦(神戸大) CPM2011-164 ICD2011-96 |
| 抄録 |
(和) |
本研究では,6万語彙の実時間連続音声認識の実現を目指すために新たなアーキテクチャを設計した.提案アーキテクチャでは,音声認識に特化したキャッシュ,言語モデルの粗密探索,閾値カットの導入,GMM演算とViterbi演算の2ステージパイプラインの導入,GMM演算の50先読み・高並列化を行った.その結果,必要メモリ帯域を97.94%削減し,70.86MB/sの低メモリ帯域を達成することが出来た.また,必要動作周波数を78%削減し,126.5MHzで6万語彙実時間音声認識を行うことが出来た.尚,今回の試作では,40nmCMOSプロセスで試作を行い,ロジック部分が1.9Mトランジスタ,内部メモリが7.8Mbitとなっている.この試作チップを測定した結果,126.5MHz,1.1Vの条件下で144mWもの低消費電力で動作することが分かった. |
| (英) |
We have developed a low power VLSI chip for 60k-word real-time continuous speech recognition based on HMM(Hidden Markov Model). Our implementation includes a cache architecture using the locality of speech recognition, beam pruning using dynamic threshold, two-stage language model searching highly parallel Gaussian Mixture Model (GMM) computation based on mixture level, Variable 50 frames look-ahead scheme and elastic pipeline operation between Viterbi transition and GMM processing. Results show that our implementation achieves 97.94% bandwidth reduction (70.86MB/s) and 78% required frequency reduction (126.5MHz) for 60k-word real-time continuous speech recognition. The test chip has been fabricated in 40nm CMOS technology and occupies 2.2mm × 2.5mm containing 1.9M transistors for logic and 7.8 Mbit on-chip memory. Measured data show 144mW power consumption at 126.5MHz and 1.1V. |
| キーワード |
(和) |
40nm VLSI / 隠れマルコフモデル(HMM) / 大語彙連続音声認識システム(LVCSR) / / / / / |
| (英) |
40nm VLSI / Hidden Markov Model (HMM) / large vocabulary continuous speech recognition (LVCSR) / / / / / |
| 文献情報 |
信学技報, vol. 111, no. 327, ICD2011-96, pp. 79-84, 2011年11月. |
| 資料番号 |
ICD2011-96 |
| 発行日 |
2011-11-21 (CPM, ICD) |
| ISSN |
Print edition: ISSN 0913-5685 Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
CPM2011-164 ICD2011-96 |