| 講演抄録/キーワード |
| 講演名 |
2023-03-17 15:40
Image Captioningのためのピクセル単位のセマンティック情報を用いたCross Attention機構の改良 ○陳 質豪・道満恵介・目加田慶人(中京大) IMQ2022-84 IE2022-161 MVE2022-114 |
| 抄録 |
(和) |
画像キャプション生成モデルでは,画像と単語列の情報を入力として注目領域(重み付き画像特徴)を生成するAttention機構をもつ.しかし,予測結果として得られる単語情報は必ずしも信用できず,それに依存するAttention機構においても望ましい注目領域が得られない場合がある.これに関して,我々の先行研究では,ピクセル単位のセマンティック情報(PSI)がCNNベースのモデルのAttention機構の改良に有効であることを示した.本稿では,TransformerベースのモデルのCross Attention機構にもPSIを導入することを提案する.実験の結果,TransformerベースのモデルであるGRITにおいて,PSIの導入によりキャプション生成の精度が向上することを確認した.提案手法のキャプション生成の精度(BLEU4=42.9)は,執筆時点でCOCO Captions Benchmarkにおける第6位相当であった.また本稿では,PSIに含まれる類義語クラス(e.g. "table"と"coffee table")の存在によりAttentionが分散してしまう問題に対して,類義語クラスをマージするの有効性を検証した結果についても報告する. |
| (英) |
Most of image captioning models have attention modules, and the module outputs an attention map (weighted feature map) from an image and a word sequence. However, a predicted word sequence may contain errors, and thus, the module output may not also be as expected. In this regard, we showed that pixel-wise semantic information (PSI) was effective for improving the attention modules in CNN-based models. This paper proposes the introduction of the PSI to cross attention modules in Transformer-based models. Experimental results showed that the PSI contributed the improvement of captioning accuracy on GRIT, a Transformer-based model. The accuracy of the proposed method, a BLEU4 score of 42.9, was equivalent to the sixth place on the COCO Captions Benchmark. This paper also studies grouping synonyms (e.g. ``table'' and ``coffee table'') in the PSI as a solution of the problem that attentions are distributed among synonyms, and discusses its effectiveness. |
| キーワード |
(和) |
画像キャプション生成 / Vision and Language / Attention / Semantic segmentation / / / / |
| (英) |
Image Captioning / Vision and Language / Attention / Semantic segmentation / / / / |
| 文献情報 |
信学技報, vol. 122, no. 440, MVE2022-114, pp. 333-338, 2023年3月. |
| 資料番号 |
MVE2022-114 |
| 発行日 |
2023-03-08 (IMQ, IE, MVE) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
IMQ2022-84 IE2022-161 MVE2022-114 |
| 研究会情報 |
| 研究会 |
IMQ IE MVE CQ |
| 開催期間 |
2023-03-15 - 2023-03-17 |
| 開催地(和) |
沖縄県青年会館(那覇市) |
| 開催地(英) |
Okinawaken Seinenkaikan (Naha-shi) |
| テーマ(和) |
五感に訴えるオンラインメディアとその評価,および一般(魅力工学研究会協賛) |
| テーマ(英) |
Media of five senses, Multimedia, Media experience, Picture codinge, Image media quality, Network,quality and reliability, etc(AC) |
| 講演論文情報の詳細 |
| 申込み研究会 |
MVE |
| 会議コード |
2023-03-IMQ-IE-MVE-CQ |
| 本文の言語 |
日本語 |
| タイトル(和) |
Image Captioningのためのピクセル単位のセマンティック情報を用いたCross Attention機構の改良 |
| サブタイトル(和) |
|
| タイトル(英) |
Improvement of cross-attention modules for image captioning using pixel-wise semantic information |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
画像キャプション生成 / Image Captioning |
| キーワード(2)(和/英) |
Vision and Language / Vision and Language |
| キーワード(3)(和/英) |
Attention / Attention |
| キーワード(4)(和/英) |
Semantic segmentation / Semantic segmentation |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
陳 質豪 / Zhihao Chen / チン シゴウ |
| 第1著者 所属(和/英) |
中京大学 (略称: 中京大)
Chukyo University (略称: Chukyo Univ.) |
| 第2著者 氏名(和/英/ヨミ) |
道満 恵介 / Keisuke Doman / ドウマン ケイスケ |
| 第2著者 所属(和/英) |
中京大学 (略称: 中京大)
Chukyo University (略称: Chukyo Univ.) |
| 第3著者 氏名(和/英/ヨミ) |
目加田 慶人 / Yoshito Mekada / メカダ ヨシト |
| 第3著者 所属(和/英) |
中京大学 (略称: 中京大)
Chukyo University (略称: Chukyo Univ.) |
| 第4著者 氏名(和/英/ヨミ) |
/ / |
| 第4著者 所属(和/英) |
(略称: )
(略称: ) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2023-03-17 15:40:00 |
| 発表時間 |
25分 |
| 申込先研究会 |
MVE |
| 資料番号 |
IMQ2022-84, IE2022-161, MVE2022-114 |
| 巻番号(vol) |
vol.122 |
| 号番号(no) |
no.437(IMQ), no.439(IE), no.440(MVE) |
| ページ範囲 |
pp.333-338 |
| ページ数 |
6 |
| 発行日 |
2023-03-08 (IMQ, IE, MVE) |
|