| 講演抄録/キーワード |
| 講演名 |
2025-06-13 13:20
単一チャンネル音声分離のためのマルチチャンネルモデルを用いた知識蒸留手法 ○二通大地・ローランド ハルタント・篠田浩一(Science Tokyo) SP2025-3 |
| 抄録 |
(和) |
音声分離は,雑音環境下での音声処理において重要な技術であり,補聴器,音声認識システム,スマート スピーカーなど幅広い分野で応用されているが,単一チャンネルでは空間情報が利用できず,性能が劣る.本研究で は,マルチチャンネルモデルから単一チャンネルモデルへの知識蒸留手法 MCKD-SS を提案する.提案手法では,音 声分離と音源到来方向(DOA)推定を同時に行うマルチタスクモデルから中間層の空間情報を抽出し,単一チャンネ ルモデルに蒸留する.SMS-WSJ や WHAMR!で性能向上を確認し,無響環境では効果が限定的だったが,雑音・残響 環境での有効性を示した. |
| (英) |
Speech separation is an essential technology for processing speech in noisy environments, with applications in hearing aids, speech recognition systems, and smart speakers. However, single-channel models cannot utilize spatial in- formation and tend to have lower performance. This study proposes MCKD-SS (Multi-Channel Knowledge Distillation for Single-Channel Speech Separation), which distills spatial information from the intermediate layers of a multi-task model that simultaneously performs speech separation and direction of arrival (DOA) estimation. Experiments on the SMS-WSJ and WHAMR! datasets confirmed performance improvements, demonstrating effectiveness in noisy and reverberant environments, although the effect was limited in clean conditions. |
| キーワード |
(和) |
音声分離 / 知識蒸留 / 深層学習 / / / / / |
| (英) |
Speech Separation / Knowledge Distillation / Deep Learning / / / / / |
| 文献情報 |
信学技報, vol. 125, no. 74, SP2025-3, pp. 10-15, 2025年6月. |
| 資料番号 |
SP2025-3 |
| 発行日 |
2025-06-06 (SP) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
SP2025-3 |