ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2026-03-16 10:40
Vision-LanguageモデルのRobust Fine-tuningのための差分ベクトル等化
鈴木聡志山口真弥武田翔一郎山根大河牧島直輝庵 愛田中智大折橋翔太増村 亮NTTIMQ2025-27 IE2025-104 MVE2025-34
抄録 (和) 対照損失で事前学習されたVision-Language モデルは,画像およびテキストに対応するそれぞれのエンコーダから得られる埋め込みを活用し,高いゼロショット識別性能を達成する.本稿では,In-Distribution (ID) データでこれらのモデルをFine-tuning しつつ,Out-Of-Distribution (OOD) およびゼロショット設定での汎化性能を保つことを目的とする.既存手法は,事前学習で用いられた対照損失をFine-tuning 時に再利用するアプローチを採用している.しかし,これらの手法はVision-Language モデルの汎化性能に重要な役割を果たす,埋め込みの幾何構造を歪め,その結果OOD およびゼロショット性能が制限される課題を発見した.この課題に対処するため,本稿ではFine-tuning 中に幾何構造を明示的に保持する差分ベクトル等化(DiVE) を提案する.DiVE は多様なサンプルに対して事前学習およびFine-tuning 中のモデルから得られる埋め込みの差分ベクトルが等しくなるよう制約し,幾何構造を保持する.このために,Average Vector Loss とPairwise Vector Loss と呼ばれる二種類の損失を導入する.前者は差分ベクトルを加重平均に一致させることで幾何構造を大域的に保持し,後者はモーダル間の整合性を保つことで局所的な幾何構造を維持する.実験において,DiVE は埋め込みの幾何構造を効果的に保持し,さらにFine-tuning で高い性能を達成した. 
(英) Contrastive vision-language models demonstrate strong zero-shot classification ability by leveraging their image and text embeddings. This paper aims to fine-tune these models on in-distribution (ID) data without compromising their generalization abilities. Existing methods tackle this challenge by reusing contrastive loss for fine-tuning. However, we found that these methods distort the geometric structure of the embeddings, which plays a crucial role in the vision-language models. To address this, we propose Difference Vector Equalization (DiVE), which preserves the geometric structure during fine-tuning. The idea behind DiVE is to constrain difference vectors, each of which is obtained by subtracting the embeddings extracted from the pre-trained and fine-tuning models for the same data sample. Therefore, we introduce two losses: average vector loss (AVL) and pairwise vector loss (PVL). AVL preserves the structure globally by constraining difference vectors to be equal to their weighted average. PVL preserves the structure locally by ensuring a consistent multimodal alignment.
キーワード (和) Robust fine-tuning / Vision-Language 対照学習 / Out-Of-Distribution / ゼロショット推論 / / / /  
(英) Robust fine-tuning / vision-language contrastive learning / out-of-distribution / zero-shot inference / / / /  
文献情報 信学技報, vol. 125, no. 410, IE2025-104, pp. 43-48, 2026年3月.
資料番号 IE2025-104 
発行日 2026-03-09 (IMQ, IE, MVE) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード IMQ2025-27 IE2025-104 MVE2025-34

研究会情報
研究会 CQ MVE IMQ IE  
開催期間 2026-03-16 - 2026-03-18 
開催地(和) 沖縄産業支援センター 
開催地(英) Okinawa-Sangyoushien-Center 
テーマ(和) 五感に訴えるオンラインメディアとその評価,および一般 
テーマ(英)  
講演論文情報の詳細
申込み研究会 IE 
会議コード 2026-03-CQ-MVE-IMQ-IE 
本文の言語 日本語 
タイトル(和) Vision-LanguageモデルのRobust Fine-tuningのための差分ベクトル等化 
サブタイトル(和)  
タイトル(英) Difference Vector Equalization for Robust Fine-tuning of Contrastive Vision-Language Models 
サブタイトル(英)  
キーワード(1)(和/英) Robust fine-tuning / Robust fine-tuning  
キーワード(2)(和/英) Vision-Language 対照学習 / vision-language contrastive learning  
キーワード(3)(和/英) Out-Of-Distribution / out-of-distribution  
キーワード(4)(和/英) ゼロショット推論 / zero-shot inference  
キーワード(5)(和/英) /  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 鈴木 聡志 / Satoshi Suzuki / スズキ サトシ
第1著者 所属(和/英) NTT株式会社 (略称: NTT)
NTT, Inc. (略称: NTT)
第2著者 氏名(和/英/ヨミ) 山口 真弥 / Shin'ya Yamaguchi / ヤマグチ シンヤ
第2著者 所属(和/英) NTT株式会社 (略称: NTT)
NTT, Inc. (略称: NTT)
第3著者 氏名(和/英/ヨミ) 武田 翔一郎 / Shoichiro Takeda / タケダ ショウイチロウ
第3著者 所属(和/英) NTT株式会社 (略称: NTT)
NTT, Inc. (略称: NTT)
第4著者 氏名(和/英/ヨミ) 山根 大河 / Taiga Yamane / ヤマネ タイガ
第4著者 所属(和/英) NTT株式会社 (略称: NTT)
NTT, Inc. (略称: NTT)
第5著者 氏名(和/英/ヨミ) 牧島 直輝 / Naoki Makishima / マキシマ ナオキ
第5著者 所属(和/英) NTT株式会社 (略称: NTT)
NTT, Inc. (略称: NTT)
第6著者 氏名(和/英/ヨミ) 庵 愛 / Mana Ihori / イホリ マナ
第6著者 所属(和/英) NTT株式会社 (略称: NTT)
NTT, Inc. (略称: NTT)
第7著者 氏名(和/英/ヨミ) 田中 智大 / Tomohiro Tanaka / タナカ トモヒロ
第7著者 所属(和/英) NTT株式会社 (略称: NTT)
NTT, Inc. (略称: NTT)
第8著者 氏名(和/英/ヨミ) 折橋 翔太 / Shota Orihashi / オリハシ ショウタ
第8著者 所属(和/英) NTT株式会社 (略称: NTT)
NTT, Inc. (略称: NTT)
第9著者 氏名(和/英/ヨミ) 増村 亮 / Ryo Masumura / マスムラ リョウ
第9著者 所属(和/英) NTT株式会社 (略称: NTT)
NTT, Inc. (略称: NTT)
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2026-03-16 10:40:00 
発表時間 20分 
申込先研究会 IE 
資料番号 IMQ2025-27, IE2025-104, MVE2025-34 
巻番号(vol) vol.125 
号番号(no) no.408(IMQ), no.410(IE), no.411(MVE) 
ページ範囲 pp.43-48 
ページ数
発行日 2026-03-09 (IMQ, IE, MVE) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会