| 講演抄録/キーワード |
| 講演名 |
2024-05-22 16:50
[招待講演]拡散過程モデルの基礎と音声強調と分離への応用 ○シャイブラー ロビン(LINEヤフー) EA2024-9 |
| 抄録 |
(和) |
拡散過程モデルは、反復的にノイズを目標分布に変換する生成モデルの一種である.これらは,最近の高 品質なテキスト画像変換の生成モデルにおいて利用されており、その高い表現力に注目が集まっている。しかし、他 の生成モデルよりも複雑な数学的概念に依存しており,その分野への参入障壁が高くなっている.本講演では,拡散 過程の基礎理論を紹介し,マルコフ連鎖と確率微分方程式を用いた 2 つの関連するアプローチに焦点を当てる.理論 から実践へと移り,拡散モデルの訓練における一般的な落とし穴とそれらを回避するためのトリックについて議論す る.また、画像生成、音生成,音声合成のための一般的なパイプラインについて取り上げる.後半では,拡散モデルを 音声強調と分離への適用した研究について詳しく紹介する.まず,通常は予測タスクとして解かれる音声強調や分離 に対し、生成モデルを使用する動機について議論する。次に、UNIVERSE やスコアベース生成音声強調(Score-based Generative Speech Enhancement;SGMSE)などの一般的なアーキテクチャを紹介する.音声強調の次に,音声分離タ スクに置ける独特の課題と機会について解説する.最後に,残されている課題と将来の方向性について議論する. |
| (英) |
Diffusion models are a class of generative models that operate in an iterative manner, progressively transforming noise into a target distribution. They are behind the recent success of high-quality text-to-image generation models, that well illustratre their representative power. Despite their success, they rely on more intricate mathemical concepts than other generative models, making the barrier to entry in the field higher. In this talk, I will introduce the basics of diffusion models, which come in two, closely related flavors: via Markov chains and via stochastic differential equations. Moving from theory to practice, we will discuss some of the common pitfalls of training diffusion models and the tricks to avoid them. We will cover some of the popular pipelines for image and, recently, audio generation, and text-to-speech. In the second part, we will dive into the application of diffusion models to speech enhancement and separation. We will first motivate the use of generative models for this typically predictive task. Then, I will present some of the popular architectures such as UNIVERSE and score-based generative speech enhancement (SGMSE). After enhancement, we will move to the speech separation task which presents some distinctive challenges and opportunities. The last part will be dedicated to some of the current challenges and future directions
in the field. |
| キーワード |
(和) |
拡散過程モデル / 生成モデル / 音声分離 / 音声強調 / / / / |
| (英) |
Diffusion models / Generative models / Speech separation / Speech enhancement / / / / |
| 文献情報 |
信学技報, vol. 124, no. 42, EA2024-9, pp. 38-38, 2024年5月. |
| 資料番号 |
EA2024-9 |
| 発行日 |
2024-05-15 (EA) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
EA2024-9 |
| 研究会情報 |
| 研究会 |
EA |
| 開催期間 |
2024-05-22 - 2024-05-22 |
| 開催地(和) |
オンライン開催 |
| 開催地(英) |
Online |
| テーマ(和) |
<オーガナイズドセッション>応用/電気音響,一般 |
| テーマ(英) |
|
| 講演論文情報の詳細 |
| 申込み研究会 |
EA |
| 会議コード |
2024-05-EA |
| 本文の言語 |
日本語 |
| タイトル(和) |
拡散過程モデルの基礎と音声強調と分離への応用 |
| サブタイトル(和) |
|
| タイトル(英) |
Fundamentals of Diffusion Models and their Application to Speech Enhancement and Separation |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
拡散過程モデル / Diffusion models |
| キーワード(2)(和/英) |
生成モデル / Generative models |
| キーワード(3)(和/英) |
音声分離 / Speech separation |
| キーワード(4)(和/英) |
音声強調 / Speech enhancement |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
シャイブラー ロビン / Robin Scheibler / シャイブラー ロビン |
| 第1著者 所属(和/英) |
LINEヤフー株式会社 (略称: LINEヤフー)
LY Corporation (略称: LY Corp.) |
| 第2著者 氏名(和/英/ヨミ) |
/ / |
| 第2著者 所属(和/英) |
(略称: )
(略称: ) |
| 第3著者 氏名(和/英/ヨミ) |
/ / |
| 第3著者 所属(和/英) |
(略称: )
(略称: ) |
| 第4著者 氏名(和/英/ヨミ) |
/ / |
| 第4著者 所属(和/英) |
(略称: )
(略称: ) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2024-05-22 16:50:00 |
| 発表時間 |
50分 |
| 申込先研究会 |
EA |
| 資料番号 |
EA2024-9 |
| 巻番号(vol) |
vol.124 |
| 号番号(no) |
no.42 |
| ページ範囲 |
p.38 |
| ページ数 |
1 |
| 発行日 |
2024-05-15 (EA) |
|