| 講演抄録/キーワード |
| 講演名 |
2007-11-28 14:00
音声と画像のconfusion networkを用いたマルチモーダル音声認識 ○上澤 泰・石川雅人・田村哲嗣・速水 悟(岐阜大) SP2007-92 |
| 抄録 |
(和) |
音声と画像の結果統合法によるマルチモーダル音声認識では,音声・画像を個別に認識した段階で,統合に必要な情報が的確に含まれた中間表現が重要である.近年,単語グラフのアークをクラスタリングすることで得られるCN(confusion network)が,音声認識の中間表現として用いられていることに加え,出力された各CNを統合するCNC(confusion network combination)が,複数の音声認識器の結果を統合する方法として提案されている.各認識器の誤り傾向が異なるほどCNCによる統合の効果が期待でき,音声と口唇動画像を用いたマルチモーダル音声認識においても有効な統合法であると考えられる.そこで,本研究では,音声と画像をCNCにより統合し,雑音下での音声認識性能の改善を試みた.その性能について評価した.またCNを行う2つの方法や,信頼度スコアとの関連についても検討した. |
| (英) |
In multimodal speech recognition, hypotheses from speech and visual recognizers are usually integrated afterwards when both recognition process have been finished. As speech recognition and visual recognition are done separately, intermediate representation of hypotheses for audio (speech) and visual information is very important issue. Recently, confusion networks (CN) are used as intermediate representation of hypotheses in speech recognition. In addition, confusion network combination (CNC), which integrates multiple confusion networks, have been proposed as a method to integrate hypotheses which are derived from multiple recognition processes. Integration by CNC produces better recognition performance when each recognition process has different property in recognition errors. As multimodal speech recognition integrates audio and visual recognition processes, it is expected that CNC will produce improvement in recognition performance. Therefore, in this paper, audio and visual recognition results were integrated as CNC and were applied to multimodal speech recognition in noisy environment to get improvement in recognition performance. Two methods for combination of CN described. Relationship with confidence scores and recognition correctness is discussed. |
| キーワード |
(和) |
マルチモーダル音声認識 / コンフュージョンネットワーク / コンフュージョンネットワークコンビネーション / / / / / |
| (英) |
MultimodalSpeech Recognition / Confusion Network / Confusion Network Combination / / / / / |
| 文献情報 |
信学技報, vol. 107, no. 356, SP2007-92, pp. 37-42, 2007年11月. |
| 資料番号 |
SP2007-92 |
| 発行日 |
2007-11-21 (SP) |
| ISSN |
Print edition: ISSN 0913-5685 Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
SP2007-92 |
| 研究会情報 |
| 研究会 |
SP |
| 開催期間 |
2007-11-28 - 2007-11-28 |
| 開催地(和) |
千葉工大 |
| 開催地(英) |
Chiba Institute of Technology |
| テーマ(和) |
一般 |
| テーマ(英) |
etc. |
| 講演論文情報の詳細 |
| 申込み研究会 |
SP |
| 会議コード |
2007-11-SP |
| 本文の言語 |
日本語 |
| タイトル(和) |
音声と画像のconfusion networkを用いたマルチモーダル音声認識 |
| サブタイトル(和) |
|
| タイトル(英) |
Multimodal speech recognition using audio and visual confusion networks |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
マルチモーダル音声認識 / MultimodalSpeech Recognition |
| キーワード(2)(和/英) |
コンフュージョンネットワーク / Confusion Network |
| キーワード(3)(和/英) |
コンフュージョンネットワークコンビネーション / Confusion Network Combination |
| キーワード(4)(和/英) |
/ |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
上澤 泰 / Tai Kamisawa / カミサワ タイ |
| 第1著者 所属(和/英) |
岐阜大学 (略称: 岐阜大)
Gifu University (略称: Gifu Univ.) |
| 第2著者 氏名(和/英/ヨミ) |
石川 雅人 / Masato Ishikawa / |
| 第2著者 所属(和/英) |
岐阜大学 (略称: 岐阜大)
Gifu University (略称: Gifu Univ.) |
| 第3著者 氏名(和/英/ヨミ) |
田村 哲嗣 / Satoshi Tamura / |
| 第3著者 所属(和/英) |
岐阜大学 (略称: 岐阜大)
Gifu University (略称: Gifu Univ.) |
| 第4著者 氏名(和/英/ヨミ) |
速水 悟 / Satoru Hayamizu / |
| 第4著者 所属(和/英) |
岐阜大学 (略称: 岐阜大)
Gifu University (略称: Gifu Univ.) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2007-11-28 14:00:00 |
| 発表時間 |
30分 |
| 申込先研究会 |
SP |
| 資料番号 |
SP2007-92 |
| 巻番号(vol) |
vol.107 |
| 号番号(no) |
no.356 |
| ページ範囲 |
pp.37-42 |
| ページ数 |
6 |
| 発行日 |
2007-11-21 (SP) |