| 講演抄録/キーワード |
| 講演名 |
2007-11-28 11:30
無作為判別構造解析を用いた日本語母音連結発声の自動認識 ○喬 宇・朝川 智・峯松信明(東大) SP2007-89 |
| 抄録 |
(和) |
音声信号は様々な非言語的要因により変化し,音声認識システムはそれらに対処する必要がある.
多くの非言語的変動は特徴量空間の変換により表現することができる.
音声の構造的表象は特徴量空間の変換に対して不変であることが示されており,非言語的変動に対して頑健な音声認識が可能となる.
しかし,構造的表象はその高い次元性が問題となる.
これにより計算量が増えるだけでなく次元の呪い(curse of dimensionality)の問題も生じる.
本研究では,この問題を解決する手法としてRandom Discriminant Structure Analysis(RDSA)を提案する.
本手法は特徴量選択と判別分析とを用いることにより,高い次元性を持つ構造的表象のパラメータから冗長性を削減し,より低い次元の識別的な特徴量を計算する.
さらに識別的特徴量を用いて複数の識別器を学習し,それらを統合することによって最終的な識別結果を出力する.
連続的に発声された日本語5母音系列をタスクとした認識実験において,8名の話者により学習した提案手法は98.3% の認識率を示し,4,130名による不特定話者HMM(97.4%)を上回る性能を示すことを確認した. |
| (英) |
Automatic speech recognition has to deal with the non-linguistic variations of speech signals. Many non-linguistic variations can be modeled as
the transformations of features. The universal structure of speech \cite{minematsu2004yaa},
\cite{minematsu2005icassp}, proves to be invariant to the feature transformations, and thus provides a robust representation for speech
recognition. One of the difficulties of using the structure
representation is due to its high dimensionality. This not only
increases computational cost but also easily suffers from the curse
of dimensionality \cite{fukunaga1990isp,duin22spr}. In this paper,
we introduce Random Discriminant Structure Analysis (RDSA) to deal
with this problem. Based on the observation that structural features
are highly correlated and include large redundancy, the RDSA
combines random feature selection and discriminative analysis to
calculate several low dimensional and discriminative representations
from an input structure. Then an individual classifier is trained
for each representation and the outputs from each classifier are
integrated for the final classification decision. Experimental
results on connected Japanese vowel utterances show that our
approach achieves a recognition rate of 98.3% based on the training
data of 8 speakers, which is higher than that (97.4%) of HMMs
trained with the utterances of 4,130 speakers. |
| キーワード |
(和) |
無作為判別構造解析 / 音声の構造的表象 / 音声認識 / 日本語母音系列 / / / / |
| (英) |
random discriminant structure / structural representation of speech / speech recognition / Japanese vowel sequences / / / / |
| 文献情報 |
信学技報, vol. 107, no. 356, SP2007-89, pp. 19-24, 2007年11月. |
| 資料番号 |
SP2007-89 |
| 発行日 |
2007-11-21 (SP) |
| ISSN |
Print edition: ISSN 0913-5685 Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
SP2007-89 |
| 研究会情報 |
| 研究会 |
SP |
| 開催期間 |
2007-11-28 - 2007-11-28 |
| 開催地(和) |
千葉工大 |
| 開催地(英) |
Chiba Institute of Technology |
| テーマ(和) |
一般 |
| テーマ(英) |
etc. |
| 講演論文情報の詳細 |
| 申込み研究会 |
SP |
| 会議コード |
2007-11-SP |
| 本文の言語 |
英語(日本語タイトルあり) |
| タイトル(和) |
無作為判別構造解析を用いた日本語母音連結発声の自動認識 |
| サブタイトル(和) |
|
| タイトル(英) |
Recognition of Connected Japanese Vowel Utterances Using Random Discriminant Structure Analysis |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
無作為判別構造解析 / random discriminant structure |
| キーワード(2)(和/英) |
音声の構造的表象 / structural representation of speech |
| キーワード(3)(和/英) |
音声認識 / speech recognition |
| キーワード(4)(和/英) |
日本語母音系列 / Japanese vowel sequences |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
喬 宇 / Yu Qiao / チャオ ユイ |
| 第1著者 所属(和/英) |
東京大学 (略称: 東大)
the University of Tokyo (略称: Univ. of Tokyo) |
| 第2著者 氏名(和/英/ヨミ) |
朝川 智 / Satoshi Asakawa / アサカワ サトシ |
| 第2著者 所属(和/英) |
東京大学 (略称: 東大)
the University of Tokyo (略称: Univ. of Tokyo) |
| 第3著者 氏名(和/英/ヨミ) |
峯松 信明 / Nobuaki Minematsu / ミネマツ ノブアキ |
| 第3著者 所属(和/英) |
東京大学 (略称: 東大)
the University of Tokyo (略称: Univ. of Tokyo) |
| 第4著者 氏名(和/英/ヨミ) |
/ / |
| 第4著者 所属(和/英) |
(略称: )
(略称: ) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2007-11-28 11:30:00 |
| 発表時間 |
30分 |
| 申込先研究会 |
SP |
| 資料番号 |
SP2007-89 |
| 巻番号(vol) |
vol.107 |
| 号番号(no) |
no.356 |
| ページ範囲 |
pp.19-24 |
| ページ数 |
6 |
| 発行日 |
2007-11-21 (SP) |