ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2007-11-28 14:00
音声と画像のconfusion networkを用いたマルチモーダル音声認識
上澤 泰石川雅人田村哲嗣速水 悟岐阜大SP2007-92
抄録 (和) 音声と画像の結果統合法によるマルチモーダル音声認識では,音声・画像を個別に認識した段階で,統合に必要な情報が的確に含まれた中間表現が重要である.近年,単語グラフのアークをクラスタリングすることで得られるCN(confusion network)が,音声認識の中間表現として用いられていることに加え,出力された各CNを統合するCNC(confusion network combination)が,複数の音声認識器の結果を統合する方法として提案されている.各認識器の誤り傾向が異なるほどCNCによる統合の効果が期待でき,音声と口唇動画像を用いたマルチモーダル音声認識においても有効な統合法であると考えられる.そこで,本研究では,音声と画像をCNCにより統合し,雑音下での音声認識性能の改善を試みた.その性能について評価した.またCNを行う2つの方法や,信頼度スコアとの関連についても検討した. 
(英) In multimodal speech recognition, hypotheses from speech and visual recognizers are usually integrated afterwards when both recognition process have been finished. As speech recognition and visual recognition are done separately, intermediate representation of hypotheses for audio (speech) and visual information is very important issue. Recently, confusion networks (CN) are used as intermediate representation of hypotheses in speech recognition. In addition, confusion network combination (CNC), which integrates multiple confusion networks, have been proposed as a method to integrate hypotheses which are derived from multiple recognition processes. Integration by CNC produces better recognition performance when each recognition process has different property in recognition errors. As multimodal speech recognition integrates audio and visual recognition processes, it is expected that CNC will produce improvement in recognition performance. Therefore, in this paper, audio and visual recognition results were integrated as CNC and were applied to multimodal speech recognition in noisy environment to get improvement in recognition performance. Two methods for combination of CN described. Relationship with confidence scores and recognition correctness is discussed.
キーワード (和) マルチモーダル音声認識 / コンフュージョンネットワーク / コンフュージョンネットワークコンビネーション / / / / /  
(英) MultimodalSpeech Recognition / Confusion Network / Confusion Network Combination / / / / /  
文献情報 信学技報, vol. 107, no. 356, SP2007-92, pp. 37-42, 2007年11月.
資料番号 SP2007-92 
発行日 2007-11-21 (SP) 
ISSN Print edition: ISSN 0913-5685    Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード SP2007-92

研究会情報
研究会 SP  
開催期間 2007-11-28 - 2007-11-28 
開催地(和) 千葉工大 
開催地(英) Chiba Institute of Technology 
テーマ(和) 一般 
テーマ(英) etc. 
講演論文情報の詳細
申込み研究会 SP 
会議コード 2007-11-SP 
本文の言語 日本語 
タイトル(和) 音声と画像のconfusion networkを用いたマルチモーダル音声認識 
サブタイトル(和)  
タイトル(英) Multimodal speech recognition using audio and visual confusion networks 
サブタイトル(英)  
キーワード(1)(和/英) マルチモーダル音声認識 / MultimodalSpeech Recognition  
キーワード(2)(和/英) コンフュージョンネットワーク / Confusion Network  
キーワード(3)(和/英) コンフュージョンネットワークコンビネーション / Confusion Network Combination  
キーワード(4)(和/英) /  
キーワード(5)(和/英) /  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 上澤 泰 / Tai Kamisawa / カミサワ タイ
第1著者 所属(和/英) 岐阜大学 (略称: 岐阜大)
Gifu University (略称: Gifu Univ.)
第2著者 氏名(和/英/ヨミ) 石川 雅人 / Masato Ishikawa /
第2著者 所属(和/英) 岐阜大学 (略称: 岐阜大)
Gifu University (略称: Gifu Univ.)
第3著者 氏名(和/英/ヨミ) 田村 哲嗣 / Satoshi Tamura /
第3著者 所属(和/英) 岐阜大学 (略称: 岐阜大)
Gifu University (略称: Gifu Univ.)
第4著者 氏名(和/英/ヨミ) 速水 悟 / Satoru Hayamizu /
第4著者 所属(和/英) 岐阜大学 (略称: 岐阜大)
Gifu University (略称: Gifu Univ.)
第5著者 氏名(和/英/ヨミ) / /
第5著者 所属(和/英) (略称: )
(略称: )
第6著者 氏名(和/英/ヨミ) / /
第6著者 所属(和/英) (略称: )
(略称: )
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2007-11-28 14:00:00 
発表時間 30分 
申込先研究会 SP 
資料番号 SP2007-92 
巻番号(vol) vol.107 
号番号(no) no.356 
ページ範囲 pp.37-42 
ページ数
発行日 2007-11-21 (SP) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会