ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2023-02-28 09:30
MS-FC-HiFiGAN : 学習可能な軽量アップサンプリングを用いた高速 ニューラル波形生成モデル
山下陽生神戸大/NICT)・岡本拓磨NICT)・高島遼一滝口哲也神戸大)・戸田智基名大/NICT)・河井 恒NICTEA2022-76 SIP2022-120 SP2022-40
抄録 (和) 近年テキスト音声合成~(Text-to-Speech:~TTS)では品質を保ったまま推論速度を向上することが求められており,そのためニューラルボコーダの高速化が研究されている.Multi-Stream~(MS) iSTFT-HiFi-GANは1CPUでも音声波形を推論可能なボコーダであるHiFi-GANの高速モデルとして提案され,VITSを用いたTTSタスクにおいて若干の音質の劣化があったものの約4倍の高速化がなされた.そこで本稿では,MS-iSTFT-HiFiGANの合成品質向上を目的として逆短時間フーリエ変換~(iSTFT)部を学習可能な全結合層へと変更したMS-FC-HiFi-GANを提案する.このモデルについて,分析合成タスクとテキスト音声合成タスクの2つのタスクにおいて推論速度,合成品質を既存のHiFi-GANの高速モデルと比較を行った.実験の結果,分析合成タスクにおける提案モデルの推論速度は1CPUにおいて0.15のReal Time Factorとなり,MS-iSTFT-HiFiGANと同程度であることが確認された.また提案モデルの合成品質は,TTSタスクではMS-iSTFT-HiFiGANに劣ったものの分析合成では上回る結果となった. 
(英) In recent years, in text-to-speech synthesis, it is required to improve the inference speed while keeping the quality.
Multi-stream(MS) iSTFT-HiFiGAN was proposed as a high-speed model of HiFi-GAN, a vocoder capable of inferring waveforms on single CPU.
In the TTS task using VITS, although there was some deterioration in sound quality, the speed was increased by about 4 times.
In this paper, we propose a MS-FC-HiFi-GAN in which the inverse short-time Fourier transform (iSTFT) part is changed to trainable fully connected layer for the purpose of improving the synthesis quality of the MS-iSTFT-HiFiGAN.
As for the inference speed, RTF was 0.15 on 1 CPU, which is the same as MS-iSTFT-HiFiGAN.
Synthesis quality was inferior to that of MS-iSTFT-HiFiGAN in TTS task, but was superior to thatin analysis/synthesis task.
キーワード (和) 音声合成 / ニューラルボコーダ / HiFi-GAN / Text-to-Speech / 分析合成 / / /  
(英) speech synthesis / Neural Vocoder / HiFi-GAN / Text-to-Speech / Analysis Synthesis / / /  
文献情報 信学技報, vol. 122, no. 389, SP2022-40, pp. 7-12, 2023年2月.
資料番号 SP2022-40 
発行日 2023-02-21 (EA, SIP, SP) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード EA2022-76 SIP2022-120 SP2022-40

研究会情報
研究会 SP IPSJ-SLP EA SIP  
開催期間 2023-02-28 - 2023-03-01 
開催地(和) 沖縄県立博物館・美術館 
開催地(英)  
テーマ(和) 音声,応用/電気音響, 信号処理,一般 
テーマ(英)  
講演論文情報の詳細
申込み研究会 SP 
会議コード 2023-02-SP-SLP-EA-SIP 
本文の言語 日本語 
タイトル(和) MS-FC-HiFiGAN : 学習可能な軽量アップサンプリングを用いた高速 ニューラル波形生成モデル 
サブタイトル(和)  
タイトル(英) MS-FC-HiFiGAN : Fast Neural Waveform Generation Model With Learnable Lightweight Upsampling 
サブタイトル(英)  
キーワード(1)(和/英) 音声合成 / speech synthesis  
キーワード(2)(和/英) ニューラルボコーダ / Neural Vocoder  
キーワード(3)(和/英) HiFi-GAN / HiFi-GAN  
キーワード(4)(和/英) Text-to-Speech / Text-to-Speech  
キーワード(5)(和/英) 分析合成 / Analysis Synthesis  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 山下 陽生 / Haruki Yamashita / ヤマシタ ハルキ
第1著者 所属(和/英) 神戸大学/国立研究開発法人 情報通信研究機構 (略称: 神戸大/NICT)
Kobe University/National Institute of Information and Communications Technology (略称: Kobe Univ/NICT)
第2著者 氏名(和/英/ヨミ) 岡本 拓磨 / Takuma Okamoto / オカモト タクマ
第2著者 所属(和/英) 国立研究開発法人 情報通信研究機構 (略称: NICT)
National Institute of Information and Communications Technology (略称: NICT)
第3著者 氏名(和/英/ヨミ) 高島 遼一 / Ryoichi Takashima / タカシマ リョウイチ
第3著者 所属(和/英) 神戸大学 (略称: 神戸大)
Kobe University (略称: Kobe Univ)
第4著者 氏名(和/英/ヨミ) 滝口 哲也 / Tetsuya Takiguchi / タキグチ テツヤ
第4著者 所属(和/英) 神戸大学 (略称: 神戸大)
Kobe University (略称: Kobe Univ)
第5著者 氏名(和/英/ヨミ) 戸田 智基 / Tomoki Toda / トダ トモキ
第5著者 所属(和/英) 名古屋大学/国立研究開発法人 情報通信研究機構 (略称: 名大/NICT)
Nagoya University/National Institute of Information and Communications Technology (略称: Nagoya Univ/NICT)
第6著者 氏名(和/英/ヨミ) 河井 恒 / Hisashi Kawai / カワイ ヒサシ
第6著者 所属(和/英) 国立研究開発法人 情報通信研究機構 (略称: NICT)
National Institute of Information and Communications Technology (略称: NICT)
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2023-02-28 09:30:00 
発表時間 20分 
申込先研究会 SP 
資料番号 EA2022-76, SIP2022-120, SP2022-40 
巻番号(vol) vol.122 
号番号(no) no.387(EA), no.388(SIP), no.389(SP) 
ページ範囲 pp.7-12 
ページ数
発行日 2023-02-21 (EA, SIP, SP) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会