| 講演抄録/キーワード |
| 講演名 |
2025-06-14 13:20
[ポスター講演]オープンドメイン視聴覚データセットの構築と汎用視聴覚音響イベント物体検出への応用 ○櫻井 舜(産総研/筑波大)・坂東宜昭(産総研)・井本桂右(京大/産総研)・大西正輝(産総研) SP2025-16 |
| 抄録 |
(和) |
本稿では,映像信号と音響信号を入力として,映像内で音を発している物体の位置とイベント種別を推定する視聴覚音響イベント物体検出 (AV-SEOD) について述べる.
AV-SEODは,見守りシステムや自律ロボットなどの計算機聴取における基盤を成し,高い可用性を確保するには幅広いドメインの音響イベントへの対応が求められる.
しかし,このような技術を教師あり深層学習で構築するには,時空間的な位置情報に加えて膨大な種類のクラス情報を網羅的に付与する必要があり,その高いコストから大規模データセットの構築が困難だった.
そこで本研究では,よりコストの小さい位置情報のみをラベル付けしたデータセットからAV-SEODを学習する.
具体的にはまず,音響イベントを含むWeb動画をできるだけ広範に収集し,これらに音を発する物体に矩形付けしたのち疑似ラベルを付与してデータセットを構築する.
疑似ラベルの付与には,大規模事前学習された画像・テキスト埋め込みモデルを用いることで,音響イベントに対応する疑似ラベルを生成した.
本枠組みで収集した合計約600万フレームに対する音響イベントと矩形のラベルは,従来の公開コーパスと比較して音響イベントの多様性がより高いことを確認した.
さらに,提案データセットによる事前学習が,既存の視聴覚ベンチマークにおける検出精度向上に寄与することを確認した. |
| (英) |
|
| キーワード |
(和) |
視聴覚音響イベント物体検出 / マルチモーダル認識 / 疑似教師ラベル生成 / 大規模事前学習 / / / / |
| (英) |
/ / / / / / / |
| 文献情報 |
信学技報, vol. 125, no. 74, SP2025-16, pp. 84-88, 2025年6月. |
| 資料番号 |
SP2025-16 |
| 発行日 |
2025-06-06 (SP) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
SP2025-16 |