ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2024-03-01 16:05
テキスト生成の自動評価尺度に基づく音声生成の自動評価
佐伯高明東大)・マイティ ソウミカーネギーメロン大)・高道慎之介東大)・渡部晋治カーネギーメロン大)・猿渡 洋東大EA2023-133 SIP2023-180 SP2023-115
抄録 (和) 音声生成の評価において,主観的評価は長らく最も重要な基準であったが,メルケプストラル歪み (mel cepstral distortion: MCD) や mean opinion score (MOS) 予測モデルなどの客観評価尺度も使用されてきた. これらの客観評価指標は,時間的・金銭的コストが低く,異なる評価結果同士を比較できるという利点があり,人間の主観的判断と高い相関を持つ客観評価尺度が求められている. 本稿では,テキスト生成の評価指標に基づく,音声生成のための自動評価手法を提案する. 提案するSpeechBERTScoreは,生成された音声と参照音声から得られた自己教師あり音声特徴量系列に対してBERTScoreを計算する. また,提案するSpeechBLEUとSpeechTokenDistanceでは,自己教師ありの離散音声トークンを用いて評価尺度を定義する. 合成音声に関する実験的評価では,提案手法のSpeechBERTScoreが,MCDや最先端のMOS予測モデルよりも人間の主観的評価と高く相関することを示した. さらに,提案手法は劣化音声の評価に対しても効果的であり,言語横断的な適用が可能であることが明らかとなった. 
(英) In the evaluation of speech generation, while subjective judgments have long been the gold standard, objective metrics such as Mel Cepstral Distortion (MCD) and Mean Opinion Score (MOS) prediction models have also been used. These objective metrics are valued for their lower time and financial costs and the ability to compare different results, driving the demand for metrics that correlate well with human subjective judgments. This paper proposes an automatic evaluation method for speech generation based on text generation metrics. Our proposed SpeechBERTScore computes BERTScores on self-supervised speech feature sequences derived from both generated and reference speech. In addition, SpeechBLEU and SpeechTokenDistance define metrics using self-supervised discrete speech tokens. Experimental evaluations of synthesized speech show that our SpeechBERTScore correlates better with human subjective ratings than MCD and state-of-the-art MOS prediction models. Furthermore, our approach is effective for degraded speech evaluation and applicable across languages.
キーワード (和) 音声自動評価 / 音声生成 / 自己教師あり音声表現 / テキスト生成自動評価 / / / /  
(英) Automatic speech evaluation / Speech generation / Self-supervised speech representations / Text generation metrics / / / /  
文献情報 信学技報, vol. 123, no. 403, SP2023-115, pp. 421-426, 2024年2月.
資料番号 SP2023-115 
発行日 2024-02-22 (EA, SIP, SP) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード EA2023-133 SIP2023-180 SP2023-115

研究会情報
研究会 SIP SP EA IPSJ-SLP  
開催期間 2024-02-29 - 2024-03-01 
開催地(和) 沖縄産業支援センター 
開催地(英)  
テーマ(和) 音声,応用/電気音響, 信号処理,一般 
テーマ(英)  
講演論文情報の詳細
申込み研究会 SP 
会議コード 2024-02-SIP-SP-EA-SLP 
本文の言語 日本語 
タイトル(和) テキスト生成の自動評価尺度に基づく音声生成の自動評価 
サブタイトル(和)  
タイトル(英) Evaluating speech generation based on objective measures for text generation 
サブタイトル(英)  
キーワード(1)(和/英) 音声自動評価 / Automatic speech evaluation  
キーワード(2)(和/英) 音声生成 / Speech generation  
キーワード(3)(和/英) 自己教師あり音声表現 / Self-supervised speech representations  
キーワード(4)(和/英) テキスト生成自動評価 / Text generation metrics  
キーワード(5)(和/英) /  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 佐伯 高明 / Takaaki Saeki /
第1著者 所属(和/英) 東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo)
第2著者 氏名(和/英/ヨミ) マイティ ソウミ / Soumi Maiti /
第2著者 所属(和/英) カーネギーメロン大学 (略称: カーネギーメロン大)
Carnegie Mellon University (略称: CMU)
第3著者 氏名(和/英/ヨミ) 高道 慎之介 / Shinnosuke Takamichi /
第3著者 所属(和/英) 東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo)
第4著者 氏名(和/英/ヨミ) 渡部 晋治 / Shinji Watanabe /
第4著者 所属(和/英) カーネギーメロン大学 (略称: カーネギーメロン大)
Carnegie Mellon University (略称: CMU)
第5著者 氏名(和/英/ヨミ) 猿渡 洋 / Hiroshi Saruwatari /
第5著者 所属(和/英) 東京大学 (略称: 東大)
The University of Tokyo (略称: UTokyo)
第6著者 氏名(和/英/ヨミ) / /
第6著者 所属(和/英) (略称: )
(略称: )
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2024-03-01 16:05:00 
発表時間 20分 
申込先研究会 SP 
資料番号 EA2023-133, SIP2023-180, SP2023-115 
巻番号(vol) vol.123 
号番号(no) no.401(EA), no.402(SIP), no.403(SP) 
ページ範囲 pp.421-426 
ページ数
発行日 2024-02-22 (EA, SIP, SP) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会