| 講演抄録/キーワード |
| 講演名 |
2024-03-01 16:05
テキスト生成の自動評価尺度に基づく音声生成の自動評価 ○佐伯高明(東大)・マイティ ソウミ(カーネギーメロン大)・高道慎之介(東大)・渡部晋治(カーネギーメロン大)・猿渡 洋(東大) EA2023-133 SIP2023-180 SP2023-115 |
| 抄録 |
(和) |
音声生成の評価において,主観的評価は長らく最も重要な基準であったが,メルケプストラル歪み (mel cepstral distortion: MCD) や mean opinion score (MOS) 予測モデルなどの客観評価尺度も使用されてきた. これらの客観評価指標は,時間的・金銭的コストが低く,異なる評価結果同士を比較できるという利点があり,人間の主観的判断と高い相関を持つ客観評価尺度が求められている. 本稿では,テキスト生成の評価指標に基づく,音声生成のための自動評価手法を提案する. 提案するSpeechBERTScoreは,生成された音声と参照音声から得られた自己教師あり音声特徴量系列に対してBERTScoreを計算する. また,提案するSpeechBLEUとSpeechTokenDistanceでは,自己教師ありの離散音声トークンを用いて評価尺度を定義する. 合成音声に関する実験的評価では,提案手法のSpeechBERTScoreが,MCDや最先端のMOS予測モデルよりも人間の主観的評価と高く相関することを示した. さらに,提案手法は劣化音声の評価に対しても効果的であり,言語横断的な適用が可能であることが明らかとなった. |
| (英) |
In the evaluation of speech generation, while subjective judgments have long been the gold standard, objective metrics such as Mel Cepstral Distortion (MCD) and Mean Opinion Score (MOS) prediction models have also been used. These objective metrics are valued for their lower time and financial costs and the ability to compare different results, driving the demand for metrics that correlate well with human subjective judgments. This paper proposes an automatic evaluation method for speech generation based on text generation metrics. Our proposed SpeechBERTScore computes BERTScores on self-supervised speech feature sequences derived from both generated and reference speech. In addition, SpeechBLEU and SpeechTokenDistance define metrics using self-supervised discrete speech tokens. Experimental evaluations of synthesized speech show that our SpeechBERTScore correlates better with human subjective ratings than MCD and state-of-the-art MOS prediction models. Furthermore, our approach is effective for degraded speech evaluation and applicable across languages. |
| キーワード |
(和) |
音声自動評価 / 音声生成 / 自己教師あり音声表現 / テキスト生成自動評価 / / / / |
| (英) |
Automatic speech evaluation / Speech generation / Self-supervised speech representations / Text generation metrics / / / / |
| 文献情報 |
信学技報, vol. 123, no. 403, SP2023-115, pp. 421-426, 2024年2月. |
| 資料番号 |
SP2023-115 |
| 発行日 |
2024-02-22 (EA, SIP, SP) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
EA2023-133 SIP2023-180 SP2023-115 |
| 研究会情報 |
| 研究会 |
SIP SP EA IPSJ-SLP |
| 開催期間 |
2024-02-29 - 2024-03-01 |
| 開催地(和) |
沖縄産業支援センター |
| 開催地(英) |
|
| テーマ(和) |
音声,応用/電気音響, 信号処理,一般 |
| テーマ(英) |
|
| 講演論文情報の詳細 |
| 申込み研究会 |
SP |
| 会議コード |
2024-02-SIP-SP-EA-SLP |
| 本文の言語 |
日本語 |
| タイトル(和) |
テキスト生成の自動評価尺度に基づく音声生成の自動評価 |
| サブタイトル(和) |
|
| タイトル(英) |
Evaluating speech generation based on objective measures for text generation |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
音声自動評価 / Automatic speech evaluation |
| キーワード(2)(和/英) |
音声生成 / Speech generation |
| キーワード(3)(和/英) |
自己教師あり音声表現 / Self-supervised speech representations |
| キーワード(4)(和/英) |
テキスト生成自動評価 / Text generation metrics |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
佐伯 高明 / Takaaki Saeki / |
| 第1著者 所属(和/英) |
東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo) |
| 第2著者 氏名(和/英/ヨミ) |
マイティ ソウミ / Soumi Maiti / |
| 第2著者 所属(和/英) |
カーネギーメロン大学 (略称: カーネギーメロン大)
Carnegie Mellon University (略称: CMU) |
| 第3著者 氏名(和/英/ヨミ) |
高道 慎之介 / Shinnosuke Takamichi / |
| 第3著者 所属(和/英) |
東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo) |
| 第4著者 氏名(和/英/ヨミ) |
渡部 晋治 / Shinji Watanabe / |
| 第4著者 所属(和/英) |
カーネギーメロン大学 (略称: カーネギーメロン大)
Carnegie Mellon University (略称: CMU) |
| 第5著者 氏名(和/英/ヨミ) |
猿渡 洋 / Hiroshi Saruwatari / |
| 第5著者 所属(和/英) |
東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2024-03-01 16:05:00 |
| 発表時間 |
20分 |
| 申込先研究会 |
SP |
| 資料番号 |
EA2023-133, SIP2023-180, SP2023-115 |
| 巻番号(vol) |
vol.123 |
| 号番号(no) |
no.401(EA), no.402(SIP), no.403(SP) |
| ページ範囲 |
pp.421-426 |
| ページ数 |
6 |
| 発行日 |
2024-02-22 (EA, SIP, SP) |
|