ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2025-06-14 13:20
[ポスター講演]離散音声トークンを活用した歌声合成システムの開発に向けた音響モデルと特徴量の検討
有田諒子中田 亘山内一輝関 健太郎楊 棟齋藤佑樹猿渡 洋東大SP2025-17
抄録 (和) 本稿では,離散音声トークンを用いた歌声合成において,VQ-VAEベースの三種類のNeural Audio Codec (DAC,SpeechTokenizer,FACodec)と,自己回帰型および非自己回帰型の音響モデルを組み合わせた歌声合成手法を提案する.先行研究では,離散トークン化による音響表現の圧縮と制御性向上が示されているものの,各種コーデックと自己回帰(AR)/非自己回帰(NAR)構造の最適な組み合わせに関する詳細な検討は不足している.その結果,トークン化による情報損失とモデル構造の選択が,合成音声の音質や自然性に影響を及ぼす課題が残存している.本研究では,各コーデックとAR/NARモデルの組み合わせを分析再合成および歌声合成の両面から比較評価し,音質,音韻的正確さ,および自然性といった観点からその影響を分析する.実験の結果,ARモデルはスペクトルおよびピッチ再現性に優れ,特にSpeechTokenizer+AR構成が最良のMCDを達成する一方,NARモデルは滑らかさと自然性に優れ,FACodec+NAR構成が最高のSingMOSを示すことを明らかにする.以上の結果から,離散音声トークンを活用した歌声合成においては,応用目的に応じてARモデルとコーデックの組み合わせを選択することが有効であることを示唆する. 
(英) In this paper, we propose a singing voice synthesis framework that combines discrete audio tokens with three types of VQ-VAE-based neural audio codecs—DAC, SpeechTokenizer, and FACodec—and both autoregressive (AR) and non-autoregressive (NAR) acoustic models. While prior studies have demonstrated the effectiveness of discrete tokenization in improving the compressibility and controllability of acoustic representations, detailed investigations into optimal combinations of codec types and AR/NAR model architectures remain limited. Consequently, challenges persist in balancing the trade-offs between information loss due to tokenization and the impact of model architecture on the quality and naturalness of synthesized singing voices. To address this, we conduct comparative evaluations of various codec and model combinations from both analysis-synthesis and singing voice synthesis perspectives, focusing on metrics such as sound quality, phonetic accuracy, and naturalness. Experimental results reveal that AR models excel in reproducing spectral and pitch features, with the SpeechTokenizer + AR configuration achieving the best MCD score, while NAR models produce smoother and more natural outputs, with the FACodec + NAR configuration attaining the highest SingMOS. These findings suggest that in discrete token-based singing voice synthesis, selecting the appropriate combination of codec and AR/NAR model depending on the application goals is crucial for achieving optimal synthesis performance.
キーワード (和) 歌声合成 / 離散音声トークン / Neural Audio Codec / / / / /  
(英) Singing Voice Synthesis / Discrete Speech Tokens / Neural Audio Codec / / / / /  
文献情報 信学技報, vol. 125, no. 74, SP2025-17, pp. 89-94, 2025年6月.
資料番号 SP2025-17 
発行日 2025-06-06 (SP) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード SP2025-17

研究会情報
研究会 SP IPSJ-SLP IPSJ-MUS  
開催期間 2025-06-13 - 2025-06-14 
開催地(和) 早稲田大学 
開催地(英)  
テーマ(和) 音学シンポジウム2025 
テーマ(英)  
講演論文情報の詳細
申込み研究会 SP 
会議コード 2025-06-SP-SLP-MUS 
本文の言語 日本語 
タイトル(和) 離散音声トークンを活用した歌声合成システムの開発に向けた音響モデルと特徴量の検討 
サブタイトル(和)  
タイトル(英) Consideration of Acoustic Models and Features for the Development of Singing Voice Synthesis System Utilizing Discrete Speech Tokens 
サブタイトル(英)  
キーワード(1)(和/英) 歌声合成 / Singing Voice Synthesis  
キーワード(2)(和/英) 離散音声トークン / Discrete Speech Tokens  
キーワード(3)(和/英) Neural Audio Codec / Neural Audio Codec  
キーワード(4)(和/英) /  
キーワード(5)(和/英) /  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 有田 諒子 / Ryoko Arita / アリタ リョウコ
第1著者 所属(和/英) 東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo)
第2著者 氏名(和/英/ヨミ) 中田 亘 / Wataru Nakata /
第2著者 所属(和/英) 東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo)
第3著者 氏名(和/英/ヨミ) 山内 一輝 / Kazuki Yamauchi /
第3著者 所属(和/英) 東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo)
第4著者 氏名(和/英/ヨミ) 関 健太郎 / Kentaro Seki /
第4著者 所属(和/英) 東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo)
第5著者 氏名(和/英/ヨミ) 楊 棟 / Dong Yang /
第5著者 所属(和/英) 東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo)
第6著者 氏名(和/英/ヨミ) 齋藤 佑樹 / Yuki Saito /
第6著者 所属(和/英) 東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo)
第7著者 氏名(和/英/ヨミ) 猿渡 洋 / Hiroshi Saruwatari /
第7著者 所属(和/英) 東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo)
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2025-06-14 13:20:00 
発表時間 140分 
申込先研究会 SP 
資料番号 SP2025-17 
巻番号(vol) vol.125 
号番号(no) no.74 
ページ範囲 pp.89-94 
ページ数
発行日 2025-06-06 (SP) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会