| 講演抄録/キーワード |
| 講演名 |
2013-01-29 13:00
音声信号への口唇画像情報ハイディングによるマルチモーダル情報処理の検討 ○阿部洋平・伊藤彰則(東北大) EMM2012-91 |
| 抄録 |
(和) |
人間は発話の際に口を動かすため,口唇動作と発話の間には密接な関係がある.我々は音声信号のみを伝送・保存する環境においても画像情報を用いたマルチモーダル情報処理を実現するため,口唇画像から抽出した特徴量を音声信号に埋め込むことを提案する.本稿では提案手法の概要を示すとともに,マルチモーダルVADへの応用を検討する.SVMを用いた発話検出実験の結果,雑音環境において画像情報を組み合わせることで音響情報のみを用いたVADよりも高い精度が得られた.また,データの埋め込みによる音質および精度への影響の調査実験を行い,大きな影響は出ないことを確認した. |
| (英) |
Lip movement has a close relationship with speech because lip moves when we talk. The idea of this work is to extract the lip movement feature from the facial video and embed the movement feature into speech signal using data hiding technique. In this paper, we show the basic framework of the method and apply the proposal method to multi-modal voice activity detection (VAD). As a result of detection experiment using SVM, we obtained higher accuracy than audio-only VAD in noisy environment. In addition we investigated effects of embedding data into speech signal on sound quality and detection accuracy. |
| キーワード |
(和) |
口唇画像 / 情報ハイディング / マルチモーダル / VAD / / / / |
| (英) |
lip image / information hiding / multi-modal / voice activity detection / / / / |
| 文献情報 |
信学技報, vol. 112, no. 420, EMM2012-91, pp. 1-5, 2013年1月. |
| 資料番号 |
EMM2012-91 |
| 発行日 |
2013-01-22 (EMM) |
| ISSN |
Print edition: ISSN 0913-5685 Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
EMM2012-91 |