ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2025-11-06 10:55
CLAP特徴量による楽器数に対してロバストな演奏動画生成手法
中ノ瀬優作井上勝文吉岡理文阪公立大PRMU2025-8
抄録 (和) 楽器音から楽器演奏動画を生成する楽器演奏動画生成タスクにおいて,実用的なシステム実現には,メモリ効率の観点から単一モデルで複数楽器に対応する多楽器汎用モデルが求められる.しかし,従来の時間条件付き楽器演奏動画生成手法による多楽器汎用モデルでは,楽器ごとに個別学習した楽器専用モデルに比べて,大きな生成品質の劣化が生じることが課題となっている.本研究では,大規模事前学習モデルCLAPの音響特徴量を従来手法に統合することで,メルスペクトログラム特徴量を補完し,多楽器汎用モデルにおける生成品質の向上を図る.Sub-URMPデータセットの全13楽器を対象とした実験で,多楽器汎用モデル同士の比較において従来手法に対してFID 23.18%,FVD 14.40%,LPIPS 5.05%の改善を達成した.また,楽器専用モデルから多楽器汎用モデルへの移行時の生成品質劣化(FID 71.86%)を大幅に抑制(FID 26.79%)し,楽器数に対するロバスト性を改善した. 
(英) In musical performance video generation from instrument sounds, practical systems require multi-instrument general models capable of handling multiple instruments within a single model for memory efficiency. However, conventional temporally conditioned performance video generation methods suffer from significant quality degradation in multi-instrument general models compared with instrument-specific models trained separately for each instrument.
In this study, we integrate acoustic features from the large-scale pre-trained model CLAP into the conventional framework to complement mel-spectrogram features and enhance generation quality in multi-instrument general models.
Experiments on all 13 instruments in the Sub-URMP dataset demonstrate improvements of 23.18% in FID, 14.40% in FVD, and 5.05% in LPIPS compared with the conventional method under the multi-instrument setting. Moreover, the quality degradation observed when transitioning from instrument-specific to multi-instrument general models (71.86% FID degradation) was substantially reduced (26.79%), indicating improved robustness with respect to the number of instruments.
キーワード (和) Audio-to-Video Generation / 楽器演奏動画生成 / CLAP / GAN / クロスモーダル学習 / 音楽情報処理 / /  
(英) Audio-to-Video Generation / Musical performance video generation / CLAP / GAN / Cross-modal learning / Music information processing / /  
文献情報 信学技報, vol. 125, no. 229, PRMU2025-8, pp. 7-12, 2025年11月.
資料番号 PRMU2025-8 
発行日 2025-10-30 (PRMU) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード PRMU2025-8

研究会情報
研究会 PRMU IPSJ-CVIM IPSJ-CGVI IPSJ-DCC  
開催期間 2025-11-06 - 2025-11-07 
開催地(和) 松江テルサ 
開催地(英) Matsue Terrsa 
テーマ(和) 歴史をつなぐCG/DCC/CV/PR技術 
テーマ(英)  
講演論文情報の詳細
申込み研究会 PRMU 
会議コード 2025-11-PRMU-CVIM-CGVI-DCC 
本文の言語 日本語 
タイトル(和) CLAP特徴量による楽器数に対してロバストな演奏動画生成手法 
サブタイトル(和)  
タイトル(英) Musical Performance Video Generation Method Robust to Increasing Number of Instruments Using CLAP Features 
サブタイトル(英)  
キーワード(1)(和/英) Audio-to-Video Generation / Audio-to-Video Generation  
キーワード(2)(和/英) 楽器演奏動画生成 / Musical performance video generation  
キーワード(3)(和/英) CLAP / CLAP  
キーワード(4)(和/英) GAN / GAN  
キーワード(5)(和/英) クロスモーダル学習 / Cross-modal learning  
キーワード(6)(和/英) 音楽情報処理 / Music information processing  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 中ノ瀬 優作 / Yusaku Nakanose /
第1著者 所属(和/英) 大阪公立大学 (略称: 阪公立大)
Osaka Metropolitan University (略称: Osaka Metropolitan Univ.)
第2著者 氏名(和/英/ヨミ) 井上 勝文 / Katsufumi Inoue / イノウエ カツフミ
第2著者 所属(和/英) 大阪公立大学 (略称: 阪公立大)
Osaka Metropolitan University (略称: Osaka Metropolitan Univ.)
第3著者 氏名(和/英/ヨミ) 吉岡 理文 / Michifumi Yoshioka / ヨシオカ ミチフミ
第3著者 所属(和/英) 大阪公立大学 (略称: 阪公立大)
Osaka Metropolitan University (略称: Osaka Metropolitan Univ.)
第4著者 氏名(和/英/ヨミ) / /
第4著者 所属(和/英) (略称: )
(略称: )
第5著者 氏名(和/英/ヨミ) / /
第5著者 所属(和/英) (略称: )
(略称: )
第6著者 氏名(和/英/ヨミ) / /
第6著者 所属(和/英) (略称: )
(略称: )
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2025-11-06 10:55:00 
発表時間 15分 
申込先研究会 PRMU 
資料番号 PRMU2025-8 
巻番号(vol) vol.125 
号番号(no) no.229 
ページ範囲 pp.7-12 
ページ数
発行日 2025-10-30 (PRMU) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会