ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2018-03-19 10:25
音素事後確率とd-vectorを用いたVariational Autoencoderによるノンパラレル多対多音声変換
齋藤佑樹NTT/東大)・井島勇祐西田京介NTT)・高道慎之介東大EA2017-105 SIP2017-114 SP2017-88
抄録 (和) 話者コードで条件付けされたVariational AutoEncoder (VAE) を用いた従来のノンパラレル音声変換では,発話内容を表す潜在変数の過剰な正則化により,変換音声の品質が著しく劣化する.これに対し,本稿では,話者コードのみならず,学習済みの音声認識モデルの予測結果として得られる音素事後確率で条件付けされたVAE の学習法を提案する.本稿ではさらに,一対一VAE 音声変換を任意話者対での変換が可能な多対多音声変換に拡張するた
めの手法として,(1) 話者コードの適応,及び(2) 話者認証において有効な$d$-vector を用いた学習・変換法を比較する.実験的評価により,(1) 音素事後確率の導入により変換音声の品質が劇的に改善すること,及び(2) 話者コードと $d$-vector の両方がノンパラレル多対多VAE 音声変換に適用可能であることを示す. 
(英) This paper proposes novel frameworks for non-parallel and many-to-many voice conversion (VC) using variational autoencoders (VAEs). In conventional VAE-based VC, converted speech quality is significantly degraded due to an over-regularization of latent variables representing phonetic contents. To overcome the issue, this paper proposes a VAE-based non-parallel VC conditioned by not only the speaker codes but also phonetic posteriorgrams (PPGs) predicted from pre-trained speech recognition models. This paper also extends the conventional VC to many-to-many VC that can convert arbitrary speakers’ characteristics into another ones. We compare two methods to realize this: 1) speaker code adaptation, and 2) the use of $d$-vectors obtained by using pre-trained speaker verification models. Experimental results demonstrate that 1) PPGs successfully improve converted speech quality, and 2) both speaker codes and $d$-vectors can be adopted to the VAE-based non-parallel and many-to-many VC.
キーワード (和) ノンパラレル音声変換 / 多対多音声変換 / variational autoencoder / 音素事後確率 / d-vector / / /  
(英) non-parallel voice conversion / many-to-many voice conversion / variational autoencoders / phonetic posteriorgrams / d-vectors / / /  
文献情報 信学技報, vol. 117, no. 517, SP2017-88, pp. 21-26, 2018年3月.
資料番号 SP2017-88 
発行日 2018-03-12 (EA, SIP, SP) 
ISSN Print edition: ISSN 0913-5685    Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード EA2017-105 SIP2017-114 SP2017-88

研究会情報
研究会 SIP EA SP MI  
開催期間 2018-03-19 - 2018-03-20 
開催地(和) 石垣島 ホテルミヤヒラ 
開催地(英)  
テーマ(和) 音声,応用/電気音響,信号処理,一般 [SIP,EA,SP]/ 医用画像工学一般 [MI] 
テーマ(英) Speech, Engineering/Electro Acoustics, Signal Processing, and Related Topics [SIP, EA, SP]/ Medical Image Engineering, Analysis, Recognition, etc. [MI] 
講演論文情報の詳細
申込み研究会 SP 
会議コード 2018-03-SIP-EA-SP-MI 
本文の言語 日本語 
タイトル(和) 音素事後確率とd-vectorを用いたVariational Autoencoderによるノンパラレル多対多音声変換 
サブタイトル(和)  
タイトル(英) Non-parallel and Many-to-Many Voice Conversion Using Variational Autoencoder Conditioned by Phonetic Posteriorgrams and d-vectors 
サブタイトル(英)  
キーワード(1)(和/英) ノンパラレル音声変換 / non-parallel voice conversion  
キーワード(2)(和/英) 多対多音声変換 / many-to-many voice conversion  
キーワード(3)(和/英) variational autoencoder / variational autoencoders  
キーワード(4)(和/英) 音素事後確率 / phonetic posteriorgrams  
キーワード(5)(和/英) d-vector / d-vectors  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 齋藤 佑樹 / Yuki Saito / サイトウ ユウキ
第1著者 所属(和/英) 日本電信電話株式会社 NTT メディアインテリジェンス研究所/東京大学 (略称: NTT/東大)
NTT Media Intelligence Laboratories, NTT Corporation/The University of Tokyo (略称: NTT/Univ. of Tokyo)
第2著者 氏名(和/英/ヨミ) 井島 勇祐 / Yusuke Ijima / イジマ ユウスケ
第2著者 所属(和/英) 日本電信電話株式会社 NTT メディアインテリジェンス研究所 (略称: NTT)
NTT Media Intelligence Laboratories, NTT Corporation (略称: NTT)
第3著者 氏名(和/英/ヨミ) 西田 京介 / Kyosuke Nishida / ニシダ キョウスケ
第3著者 所属(和/英) 日本電信電話株式会社 NTT メディアインテリジェンス研究所 (略称: NTT)
NTT Media Intelligence Laboratories, NTT Corporation (略称: NTT)
第4著者 氏名(和/英/ヨミ) 高道 慎之介 / Shinnosuke Takamichi / タカミチ シンノスケ
第4著者 所属(和/英) 東京大学 (略称: 東大)
The University of Tokyo (略称: Univ. of Tokyo)
第5著者 氏名(和/英/ヨミ) / /
第5著者 所属(和/英) (略称: )
(略称: )
第6著者 氏名(和/英/ヨミ) / /
第6著者 所属(和/英) (略称: )
(略称: )
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2018-03-19 10:25:00 
発表時間 25分 
申込先研究会 SP 
資料番号 EA2017-105, SIP2017-114, SP2017-88 
巻番号(vol) vol.117 
号番号(no) no.515(EA), no.516(SIP), no.517(SP) 
ページ範囲 pp.21-26 
ページ数
発行日 2018-03-12 (EA, SIP, SP) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会