| 講演抄録/キーワード |
| 講演名 |
2010-01-22 15:50
AAMを用いた唇領域特徴による音声発話認識 ○駒井祐人・宮本千琴・滝口哲也・有木康雄(神戸大) CQ2009-107 PRMU2009-206 SP2009-147 MVE2009-129 |
| 抄録 |
(和) |
雑音環境下で頑健に音声認識を行う手法の一つとして,音声情報に唇動画像情報を併用して認識を行うマルチモーダル音声認識が注目され,近年研究が進められている.マルチモーダル音声認識では音声情報のみでなく画像情報も大きな役割を果たすため,画像に対してどのような特徴量を用いるかが重要な論点となる.従来から音声特徴量はMFCCなどある程度定まった特徴量が用いられているのに対し,画像特徴量はその抽出法の違いから,さまざまな特徴量が提案されている.
本研究では Active Appearance Modelを用いることで唇領域を自動抽出し,座標値と輝度値の情報を含んだActive Appearance Modelのcombinedパラメータを用いて発話認識することにより,特徴量としての有効性を確認する. |
| (英) |
As one of the techniques for robust speech recognition under the noise environment, multimodal speech recognition using lip dynamic scene information together with audio information is attracting attention
and the research is advanced in recent years.Since audio information together with visual information plays a great role in multimodal speech recognition,image features you use becomes a significant point.
As for the visual features, various features have been proposed because of the difference of the extraction methods while the feature such as MFCC is used to a certain degree for audio features so far. This paper proposes, for spoken word recognition, to utilize c combined parameter extracted by Active Appearance Model applied to a face image including the lip area. Active Appearance Model contains information of the coordinate value and the brightness value as the image feature. |
| キーワード |
(和) |
唇領域 / Active Appearance Model / combinedパラメータ / 音声と画像の統合 / / / / |
| (英) |
Lip area / Active Appearance Model / combined parameter / integration of audio and visual / / / / |
| 文献情報 |
信学技報, vol. 109, no. 375, SP2009-147, pp. 357-362, 2010年1月. |
| 資料番号 |
SP2009-147 |
| 発行日 |
2010-01-14 (CQ, PRMU, SP, MVE) |
| ISSN |
Print edition: ISSN 0913-5685 Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
CQ2009-107 PRMU2009-206 SP2009-147 MVE2009-129 |
| 研究会情報 |
| 研究会 |
PRMU SP MVE CQ |
| 開催期間 |
2010-01-21 - 2010-01-22 |
| 開催地(和) |
京大 |
| 開催地(英) |
Kyoto Univ. |
| テーマ(和) |
クロスモーダル |
| テーマ(英) |
|
| 講演論文情報の詳細 |
| 申込み研究会 |
SP |
| 会議コード |
2010-01-PRMU-SP-MVE-CQ |
| 本文の言語 |
日本語 |
| タイトル(和) |
AAMを用いた唇領域特徴による音声発話認識 |
| サブタイトル(和) |
|
| タイトル(英) |
Speech Recognition Based on Lip Area Feature Captured by AAM |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
唇領域 / Lip area |
| キーワード(2)(和/英) |
Active Appearance Model / Active Appearance Model |
| キーワード(3)(和/英) |
combinedパラメータ / combined parameter |
| キーワード(4)(和/英) |
音声と画像の統合 / integration of audio and visual |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
駒井 祐人 / Yuto Komai / コマイ ユウト |
| 第1著者 所属(和/英) |
神戸大学 (略称: 神戸大)
Kobe University (略称: kobe Univ.) |
| 第2著者 氏名(和/英/ヨミ) |
宮本 千琴 / Chikoto Miyamoto / ミヤモト チコト |
| 第2著者 所属(和/英) |
神戸大学 (略称: 神戸大)
Kobe University (略称: kobe Univ.) |
| 第3著者 氏名(和/英/ヨミ) |
滝口 哲也 / Tetsuya Takiguchi / タキグチ テツヤ |
| 第3著者 所属(和/英) |
神戸大学 (略称: 神戸大)
Kobe University (略称: kobe Univ.) |
| 第4著者 氏名(和/英/ヨミ) |
有木 康雄 / Yasuo Ariki / アリキ ヤスオ |
| 第4著者 所属(和/英) |
神戸大学 (略称: 神戸大)
Kobe University (略称: kobe Univ.) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2010-01-22 15:50:00 |
| 発表時間 |
30分 |
| 申込先研究会 |
SP |
| 資料番号 |
CQ2009-107, PRMU2009-206, SP2009-147, MVE2009-129 |
| 巻番号(vol) |
vol.109 |
| 号番号(no) |
no.373(CQ), no.374(PRMU), no.375(SP), no.376(MVE) |
| ページ範囲 |
pp.357-362 |
| ページ数 |
6 |
| 発行日 |
2010-01-14 (CQ, PRMU, SP, MVE) |
|