| 講演抄録/キーワード |
| 講演名 |
2026-03-03 11:00
[ポスター講演]大規模学習条件下および雑音環境下におけるVAE-SiFiGANの性能評価 ○荻田健一・米山怜於・ホワン ウェンチン・戸田智基(名大) EA2025-124 SIP2025-144 SP2025-77 |
| 抄録 |
(和) |
SiFi-GANは品質・速度・$F_0$制御性能のいずれも高水準で達成するニューラルボコーダである.
しかし、SiFi-GANは信号処理に基づく決定論的な音響特徴表現と決定論的なネットワーク機構に基づく波形生成に依存するため,ゆらぎのモデル化精度や雑音耐性等に課題を抱えている.
これらの課題を解決するため,我々は入力特徴量を変分自己符号化器(variational autoencoder: VAE)による確率的潜在表現に置き換えるVAE-SiFiGANを提案し,単一話者条件下において優れた$F_0$制御性能を達成することを示した.
本稿では,VAE-SiFiGANをより多角的に評価するため,大規模学習条件下での$F_0$制御性能および雑音に対する頑健性について実験的評価を実施する.
また,$F_0$抽出誤差を含むデータは学習に悪影響を及ぼす可能性があるため,これを検出・除外するための新たなデータ選別手法を提案する.
実験的評価から,提案するデータ選別手法が有効であること,VAE-SiFiGANが従来手法の大規模学習条件下の上方$F_0$変換における有声/無声判定精度を上回ること,ならびに従来手法の雑音耐性を改善することを示す. |
| (英) |
Source-filter HiFi-GAN (SiFi-GAN) is a neural vocoder offering fast, high-quality voice synthesis with fundamental frequency ($F_0$) controllability.
However, SiFi-GAN relies on deterministic acoustic representations based on signal processing and waveform generation with a deterministic network architecture, causing limitations of its ability to model stochastic variation and its robustness to noise.
To address these issues, we previously proposed VAE-SiFiGAN that replaced the input features with probabilistic latent representations obtained by a variational autoencoder (VAE), and demonstrated superior $F_0$ controllability on a single-speaker dataset.
In this study, we conduct experimental evaluations on $F_0$ controllability under large-scale training conditions and robustness to noise for a more comprehensive assessment of VAE-SiFiGAN.
Additionally, since data containing $F_0$ extraction errors can adversely affect training, we propose a data selection method to detect and exclude such data.
Experimental evaluations demonstrate that the proposed data selection method is effective, that VAE-SiFiGAN improves voiced/unvoiced decision accuracy during upward $F_0$ conversion under large-scale training conditions, and that VAE-SiFiGAN outperforms SiFi-GAN in robustness against noise. |
| キーワード |
(和) |
ニューラルボコーダ / 変分自己符号化器 / 音源フィルタモデル / 基本周波数制御 / / / / |
| (英) |
neural vocoder / variational autoencoder / source-filter model / fundamental frequency control / / / / |
| 文献情報 |
信学技報, vol. 125, no. 371, SP2025-77, pp. 306-311, 2026年3月. |
| 資料番号 |
SP2025-77 |
| 発行日 |
2026-02-23 (EA, SIP, SP) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
EA2025-124 SIP2025-144 SP2025-77 |
| 研究会情報 |
| 研究会 |
SP EA SIP IPSJ-SLP |
| 開催期間 |
2026-03-02 - 2026-03-04 |
| 開催地(和) |
沖縄県青年会館 |
| 開催地(英) |
|
| テーマ(和) |
音声,応用/電気音響,信号処理,一般 |
| テーマ(英) |
|
| 講演論文情報の詳細 |
| 申込み研究会 |
SP |
| 会議コード |
2026-03-SP-EA-SIP-SLP |
| 本文の言語 |
日本語 |
| タイトル(和) |
大規模学習条件下および雑音環境下におけるVAE-SiFiGANの性能評価 |
| サブタイトル(和) |
|
| タイトル(英) |
Performance Evaluation of VAE-SiFiGAN under Large-Scale Training and Noisy Conditions |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
ニューラルボコーダ / neural vocoder |
| キーワード(2)(和/英) |
変分自己符号化器 / variational autoencoder |
| キーワード(3)(和/英) |
音源フィルタモデル / source-filter model |
| キーワード(4)(和/英) |
基本周波数制御 / fundamental frequency control |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
荻田 健一 / Kenichi Ogita / オギタ ケンイチ |
| 第1著者 所属(和/英) |
名古屋大学 (略称: 名大)
Nagoya University (略称: Nagoya Univ.) |
| 第2著者 氏名(和/英/ヨミ) |
米山 怜於 / Reo Yoneyama / ヨネヤマ レオ |
| 第2著者 所属(和/英) |
名古屋大学 (略称: 名大)
Nagoya University (略称: Nagoya Univ.) |
| 第3著者 氏名(和/英/ヨミ) |
ホワン ウェンチン / Wen-Chin Huang / ホワン ウェンチン |
| 第3著者 所属(和/英) |
名古屋大学 (略称: 名大)
Nagoya University (略称: Nagoya Univ.) |
| 第4著者 氏名(和/英/ヨミ) |
戸田 智基 / Tomoki Toda / トダ トモキ |
| 第4著者 所属(和/英) |
名古屋大学 (略称: 名大)
Nagoya University (略称: Nagoya Univ.) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2026-03-03 11:00:00 |
| 発表時間 |
80分 |
| 申込先研究会 |
SP |
| 資料番号 |
EA2025-124, SIP2025-144, SP2025-77 |
| 巻番号(vol) |
vol.125 |
| 号番号(no) |
no.369(EA), no.370(SIP), no.371(SP) |
| ページ範囲 |
pp.306-311 |
| ページ数 |
6 |
| 発行日 |
2026-02-23 (EA, SIP, SP) |
|