| 講演抄録/キーワード |
| 講演名 |
2021-10-19 15:10
大規模音声コーパスを用いたDNN-HSMM音声合成のためのモデル学習の検討 ○西澤信行・服部 元(KDDI総合研究所) SP2021-34 WIT2021-27 |
| 抄録 |
(和) |
本研究では、接続合成用に収集された大規模音声コーパスを用いて、DNN-HSMM音声合成のためのモデル学習を行った。従来のHSMM音声合成では入力である言語情報に対応するHSMMのパラメータを決定木で予測していたが、DNN-HSMM音声合成はこの予測にDNNを用いており、より高い合成音品質が期待できる。しかし、HSMMの状態継続長分布のパラメータを同時にDNNで推定するため、モデル学習の初期段階では学習データに対してHSMMの状態のアラインメントを適切に行うことができず、確率的勾配法によるモデル学習が進まない可能性がある。特にDNNにLSTM(long short-term memory)を用いたRNNを用いた場合の学習時の挙動については充分な検討が行われていない。そこで本研究では大規模な音声学習セットを用いて、LSTMを用いた場合のモデル学習時の挙動について調べた。実験の結果、オプティマイザの学習率を適切に設定することで、パラメータをランダムに設定した初期状態からモデル学習が可能なこと、また、各層が2048セルのLSTMで構成される3層の双方向RNNを用いた場合、推定誤差性能が飽和する学習データサイズは20.6時間以上であることが分かった。 |
| (英) |
In this study, an investigation into model training for DNN-HSMM-based speech synthesis using a large speech corpus collected for connection synthesis was conducted. While conventional HSMM-based speech synthesis uses decision trees to predict the HSMM parameters corresponding to the linguistic information, DNN-HSMM-based speech synthesis uses DNNs for this prediction. Thus, it is expected to synthesize higher quality sounds by the method. However, since the parameters of the state duration distributions of the HSMMs are simultaneously estimated by the training, the training by the stochastic gradient method may not properly progress in the early stage of model training where the states cannot be appropriately aligned with training data yet. In particular, the behavior of training of RNNs using LSTM (long short-term memory) for DNN-HSMM-based speech synthesis has not yet been sufficiently studied. The experimental results show that the model can be trained from the randomly initialized states by setting the learning rate of the optimizer appropriately, and the training data size at which performance of the prediction saturates is more than 20.6 hours where using a three-layer bidirectional RNN where each layer consists of 2048-cell LSTMs. |
| キーワード |
(和) |
DMM-HSMM音声合成 / 隠れセミマルコフモデル / 大規模音声コーパス / / / / / |
| (英) |
DNN-HSMM-based speech synthesis / hidden semi-Marcov models / large-scale speech corpus / / / / / |
| 文献情報 |
信学技報, vol. 121, no. 202, SP2021-34, pp. 52-57, 2021年10月. |
| 資料番号 |
SP2021-34 |
| 発行日 |
2021-10-12 (SP, WIT) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
SP2021-34 WIT2021-27 |
| 研究会情報 |
| 研究会 |
SP WIT IPSJ-SLP ASJ-H |
| 開催期間 |
2021-10-19 - 2021-10-19 |
| 開催地(和) |
オンライン開催 |
| 開催地(英) |
Online |
| テーマ(和) |
一般 |
| テーマ(英) |
|
| 講演論文情報の詳細 |
| 申込み研究会 |
SP |
| 会議コード |
2021-10-SP-WIT-SLP-H |
| 本文の言語 |
日本語 |
| タイトル(和) |
大規模音声コーパスを用いたDNN-HSMM音声合成のためのモデル学習の検討 |
| サブタイトル(和) |
|
| タイトル(英) |
A study on model training for DNN-HSMM-based speech synthesis using a large-scale speech corpus |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
DMM-HSMM音声合成 / DNN-HSMM-based speech synthesis |
| キーワード(2)(和/英) |
隠れセミマルコフモデル / hidden semi-Marcov models |
| キーワード(3)(和/英) |
大規模音声コーパス / large-scale speech corpus |
| キーワード(4)(和/英) |
/ |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
西澤 信行 / Nobuyuki Nishizawa / ニシザワ ノブユキ |
| 第1著者 所属(和/英) |
KDDI総合研究所 (略称: KDDI総合研究所)
KDDI Research, Inc. (略称: KDDI Research) |
| 第2著者 氏名(和/英/ヨミ) |
服部 元 / Gen Hattori / ハットリ ゲン |
| 第2著者 所属(和/英) |
KDDI総合研究所 (略称: KDDI総合研究所)
KDDI Research, Inc. (略称: KDDI Research) |
| 第3著者 氏名(和/英/ヨミ) |
/ / |
| 第3著者 所属(和/英) |
(略称: )
(略称: ) |
| 第4著者 氏名(和/英/ヨミ) |
/ / |
| 第4著者 所属(和/英) |
(略称: )
(略称: ) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2021-10-19 15:10:00 |
| 発表時間 |
120分 |
| 申込先研究会 |
SP |
| 資料番号 |
SP2021-34, WIT2021-27 |
| 巻番号(vol) |
vol.121 |
| 号番号(no) |
no.202(SP), no.203(WIT) |
| ページ範囲 |
pp.52-57 |
| ページ数 |
6 |
| 発行日 |
2021-10-12 (SP, WIT) |
|