| 講演抄録/キーワード |
| 講演名 |
2025-11-06 10:55
CLAP特徴量による楽器数に対してロバストな演奏動画生成手法 ○中ノ瀬優作・井上勝文・吉岡理文(阪公立大) PRMU2025-8 |
| 抄録 |
(和) |
楽器音から楽器演奏動画を生成する楽器演奏動画生成タスクにおいて,実用的なシステム実現には,メモリ効率の観点から単一モデルで複数楽器に対応する多楽器汎用モデルが求められる.しかし,従来の時間条件付き楽器演奏動画生成手法による多楽器汎用モデルでは,楽器ごとに個別学習した楽器専用モデルに比べて,大きな生成品質の劣化が生じることが課題となっている.本研究では,大規模事前学習モデルCLAPの音響特徴量を従来手法に統合することで,メルスペクトログラム特徴量を補完し,多楽器汎用モデルにおける生成品質の向上を図る.Sub-URMPデータセットの全13楽器を対象とした実験で,多楽器汎用モデル同士の比較において従来手法に対してFID 23.18%,FVD 14.40%,LPIPS 5.05%の改善を達成した.また,楽器専用モデルから多楽器汎用モデルへの移行時の生成品質劣化(FID 71.86%)を大幅に抑制(FID 26.79%)し,楽器数に対するロバスト性を改善した. |
| (英) |
In musical performance video generation from instrument sounds, practical systems require multi-instrument general models capable of handling multiple instruments within a single model for memory efficiency. However, conventional temporally conditioned performance video generation methods suffer from significant quality degradation in multi-instrument general models compared with instrument-specific models trained separately for each instrument.
In this study, we integrate acoustic features from the large-scale pre-trained model CLAP into the conventional framework to complement mel-spectrogram features and enhance generation quality in multi-instrument general models.
Experiments on all 13 instruments in the Sub-URMP dataset demonstrate improvements of 23.18% in FID, 14.40% in FVD, and 5.05% in LPIPS compared with the conventional method under the multi-instrument setting. Moreover, the quality degradation observed when transitioning from instrument-specific to multi-instrument general models (71.86% FID degradation) was substantially reduced (26.79%), indicating improved robustness with respect to the number of instruments. |
| キーワード |
(和) |
Audio-to-Video Generation / 楽器演奏動画生成 / CLAP / GAN / クロスモーダル学習 / 音楽情報処理 / / |
| (英) |
Audio-to-Video Generation / Musical performance video generation / CLAP / GAN / Cross-modal learning / Music information processing / / |
| 文献情報 |
信学技報, vol. 125, no. 229, PRMU2025-8, pp. 7-12, 2025年11月. |
| 資料番号 |
PRMU2025-8 |
| 発行日 |
2025-10-30 (PRMU) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
PRMU2025-8 |
| 研究会情報 |
| 研究会 |
PRMU IPSJ-CVIM IPSJ-CGVI IPSJ-DCC |
| 開催期間 |
2025-11-06 - 2025-11-07 |
| 開催地(和) |
松江テルサ |
| 開催地(英) |
Matsue Terrsa |
| テーマ(和) |
歴史をつなぐCG/DCC/CV/PR技術 |
| テーマ(英) |
|
| 講演論文情報の詳細 |
| 申込み研究会 |
PRMU |
| 会議コード |
2025-11-PRMU-CVIM-CGVI-DCC |
| 本文の言語 |
日本語 |
| タイトル(和) |
CLAP特徴量による楽器数に対してロバストな演奏動画生成手法 |
| サブタイトル(和) |
|
| タイトル(英) |
Musical Performance Video Generation Method Robust to Increasing Number of Instruments Using CLAP Features |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
Audio-to-Video Generation / Audio-to-Video Generation |
| キーワード(2)(和/英) |
楽器演奏動画生成 / Musical performance video generation |
| キーワード(3)(和/英) |
CLAP / CLAP |
| キーワード(4)(和/英) |
GAN / GAN |
| キーワード(5)(和/英) |
クロスモーダル学習 / Cross-modal learning |
| キーワード(6)(和/英) |
音楽情報処理 / Music information processing |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
中ノ瀬 優作 / Yusaku Nakanose / |
| 第1著者 所属(和/英) |
大阪公立大学 (略称: 阪公立大)
Osaka Metropolitan University (略称: Osaka Metropolitan Univ.) |
| 第2著者 氏名(和/英/ヨミ) |
井上 勝文 / Katsufumi Inoue / イノウエ カツフミ |
| 第2著者 所属(和/英) |
大阪公立大学 (略称: 阪公立大)
Osaka Metropolitan University (略称: Osaka Metropolitan Univ.) |
| 第3著者 氏名(和/英/ヨミ) |
吉岡 理文 / Michifumi Yoshioka / ヨシオカ ミチフミ |
| 第3著者 所属(和/英) |
大阪公立大学 (略称: 阪公立大)
Osaka Metropolitan University (略称: Osaka Metropolitan Univ.) |
| 第4著者 氏名(和/英/ヨミ) |
/ / |
| 第4著者 所属(和/英) |
(略称: )
(略称: ) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2025-11-06 10:55:00 |
| 発表時間 |
15分 |
| 申込先研究会 |
PRMU |
| 資料番号 |
PRMU2025-8 |
| 巻番号(vol) |
vol.125 |
| 号番号(no) |
no.229 |
| ページ範囲 |
pp.7-12 |
| ページ数 |
6 |
| 発行日 |
2025-10-30 (PRMU) |