| 講演抄録/キーワード |
| 講演名 |
2023-02-28 09:10
基本周波数制御可能な高速ニューラル波形生成モデルの比較 ○清水聡太(神戸大/NICT)・岡本拓磨(NICT)・高島遼一・滝口哲也(神戸大)・戸田智基(名大/NICT)・河井 恒(NICT) EA2022-75 SIP2022-119 SP2022-39 |
| 抄録 |
(和) |
深層ニューラルネットワークを用いて音響特徴量から音声波形を生成するニューラルボコーダは,従来のソースフィルタボコーダに比べ,合成音声の品質を大幅に向上させており,高速かつ高品質なニューラルボコーダが数多く提案されている.ニューラルボコーダは従来のソースフィルタボコーダと同様に,基本周波数~($f_{mathrm{o}}$)などの属性を柔軟に制御することが必要とされる.これに対し,$f_{mathrm{o}}$の制御性能を維持しつつ,高品質かつCPUのみでもリアルタイム合成可能なモデルとしてHarmonic-Net+やSiFi-GANが提案されている.本研究では,未知話者合成において,~($f_{mathrm{o}}$)制御可能な高速ニューラル波形生成モデルであるHarmonic-Net+,MS-Harmonic-Net+,SiFi-GANの比較を行う. |
| (英) |
Neural vocoders, which reconstruct speech waveforms from acoustic features with deep neural networks, have significantly improved synthetic speech quality compared to conventional source-filter vocoders. Neural vocoders, like conventional source filter vocoders, are required to be able to flexibly control attributes such as fundamental frequency ($f_{mathrm{o}}$). Harmonic-Net+ and SiFi-GAN have been proposed as models that can synthesize a speech waveform in real time on CPU, while maintaining controllability of $f_{mathrm{o}}$ and high synthetic speech quality. In this study, we conduct experiments to evaluate Harmonic-Net+, MS-Harmonic-Net+ and SiFi-GAN, which are fast neural vocoders with controllability of $f_{mathrm{o}}$ for unseen speaker synthesis. |
| キーワード |
(和) |
音声合成 / ニューラルボコーダ / 基本周波数制御 / リアルタイム合成 / / / / |
| (英) |
speech synthesis / Neural vocoder / fundamental frequency control / real-time inference / / / / |
| 文献情報 |
信学技報, vol. 122, no. 389, SP2022-39, pp. 1-6, 2023年2月. |
| 資料番号 |
SP2022-39 |
| 発行日 |
2023-02-21 (EA, SIP, SP) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
EA2022-75 SIP2022-119 SP2022-39 |
|