ご案内 入会して研究会活動をもっとお得に!研究会参加費・年間登録費が会員価格になります。
お知らせ 【重要】研究会参加費の支払いおよび原稿アップロード手続きの変更に関するご案内
電子情報通信学会 研究会発表申込システム
講演論文 詳細
技報閲覧サービス
[ログイン]
技報アーカイブ
 トップに戻る 前のページに戻る   [Japanese] / [English] 

講演抄録/キーワード
講演名 2023-03-17 15:40
Image Captioningのためのピクセル単位のセマンティック情報を用いたCross Attention機構の改良
陳 質豪道満恵介目加田慶人中京大IMQ2022-84 IE2022-161 MVE2022-114
抄録 (和) 画像キャプション生成モデルでは,画像と単語列の情報を入力として注目領域(重み付き画像特徴)を生成するAttention機構をもつ.しかし,予測結果として得られる単語情報は必ずしも信用できず,それに依存するAttention機構においても望ましい注目領域が得られない場合がある.これに関して,我々の先行研究では,ピクセル単位のセマンティック情報(PSI)がCNNベースのモデルのAttention機構の改良に有効であることを示した.本稿では,TransformerベースのモデルのCross Attention機構にもPSIを導入することを提案する.実験の結果,TransformerベースのモデルであるGRITにおいて,PSIの導入によりキャプション生成の精度が向上することを確認した.提案手法のキャプション生成の精度(BLEU4=42.9)は,執筆時点でCOCO Captions Benchmarkにおける第6位相当であった.また本稿では,PSIに含まれる類義語クラス(e.g. "table"と"coffee table")の存在によりAttentionが分散してしまう問題に対して,類義語クラスをマージするの有効性を検証した結果についても報告する. 
(英) Most of image captioning models have attention modules, and the module outputs an attention map (weighted feature map) from an image and a word sequence. However, a predicted word sequence may contain errors, and thus, the module output may not also be as expected. In this regard, we showed that pixel-wise semantic information (PSI) was effective for improving the attention modules in CNN-based models. This paper proposes the introduction of the PSI to cross attention modules in Transformer-based models. Experimental results showed that the PSI contributed the improvement of captioning accuracy on GRIT, a Transformer-based model. The accuracy of the proposed method, a BLEU4 score of 42.9, was equivalent to the sixth place on the COCO Captions Benchmark. This paper also studies grouping synonyms (e.g. ``table'' and ``coffee table'') in the PSI as a solution of the problem that attentions are distributed among synonyms, and discusses its effectiveness.
キーワード (和) 画像キャプション生成 / Vision and Language / Attention / Semantic segmentation / / / /  
(英) Image Captioning / Vision and Language / Attention / Semantic segmentation / / / /  
文献情報 信学技報, vol. 122, no. 440, MVE2022-114, pp. 333-338, 2023年3月.
資料番号 MVE2022-114 
発行日 2023-03-08 (IMQ, IE, MVE) 
ISSN Online edition: ISSN 2432-6380
著作権に
ついて
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034)
PDFダウンロード IMQ2022-84 IE2022-161 MVE2022-114

研究会情報
研究会 IMQ IE MVE CQ  
開催期間 2023-03-15 - 2023-03-17 
開催地(和) 沖縄県青年会館(那覇市) 
開催地(英) Okinawaken Seinenkaikan (Naha-shi) 
テーマ(和) 五感に訴えるオンラインメディアとその評価,および一般(魅力工学研究会協賛) 
テーマ(英) Media of five senses, Multimedia, Media experience, Picture codinge, Image media quality, Network,quality and reliability, etc(AC) 
講演論文情報の詳細
申込み研究会 MVE 
会議コード 2023-03-IMQ-IE-MVE-CQ 
本文の言語 日本語 
タイトル(和) Image Captioningのためのピクセル単位のセマンティック情報を用いたCross Attention機構の改良 
サブタイトル(和)  
タイトル(英) Improvement of cross-attention modules for image captioning using pixel-wise semantic information 
サブタイトル(英)  
キーワード(1)(和/英) 画像キャプション生成 / Image Captioning  
キーワード(2)(和/英) Vision and Language / Vision and Language  
キーワード(3)(和/英) Attention / Attention  
キーワード(4)(和/英) Semantic segmentation / Semantic segmentation  
キーワード(5)(和/英) /  
キーワード(6)(和/英) /  
キーワード(7)(和/英) /  
キーワード(8)(和/英) /  
第1著者 氏名(和/英/ヨミ) 陳 質豪 / Zhihao Chen / チン シゴウ
第1著者 所属(和/英) 中京大学 (略称: 中京大)
Chukyo University (略称: Chukyo Univ.)
第2著者 氏名(和/英/ヨミ) 道満 恵介 / Keisuke Doman / ドウマン ケイスケ
第2著者 所属(和/英) 中京大学 (略称: 中京大)
Chukyo University (略称: Chukyo Univ.)
第3著者 氏名(和/英/ヨミ) 目加田 慶人 / Yoshito Mekada / メカダ ヨシト
第3著者 所属(和/英) 中京大学 (略称: 中京大)
Chukyo University (略称: Chukyo Univ.)
第4著者 氏名(和/英/ヨミ) / /
第4著者 所属(和/英) (略称: )
(略称: )
第5著者 氏名(和/英/ヨミ) / /
第5著者 所属(和/英) (略称: )
(略称: )
第6著者 氏名(和/英/ヨミ) / /
第6著者 所属(和/英) (略称: )
(略称: )
第7著者 氏名(和/英/ヨミ) / /
第7著者 所属(和/英) (略称: )
(略称: )
第8著者 氏名(和/英/ヨミ) / /
第8著者 所属(和/英) (略称: )
(略称: )
第9著者 氏名(和/英/ヨミ) / /
第9著者 所属(和/英) (略称: )
(略称: )
第10著者 氏名(和/英/ヨミ) / /
第10著者 所属(和/英) (略称: )
(略称: )
第11著者 氏名(和/英/ヨミ) / /
第11著者 所属(和/英) (略称: )
(略称: )
第12著者 氏名(和/英/ヨミ) / /
第12著者 所属(和/英) (略称: )
(略称: )
第13著者 氏名(和/英/ヨミ) / /
第13著者 所属(和/英) (略称: )
(略称: )
第14著者 氏名(和/英/ヨミ) / /
第14著者 所属(和/英) (略称: )
(略称: )
第15著者 氏名(和/英/ヨミ) / /
第15著者 所属(和/英) (略称: )
(略称: )
第16著者 氏名(和/英/ヨミ) / /
第16著者 所属(和/英) (略称: )
(略称: )
第17著者 氏名(和/英/ヨミ) / /
第17著者 所属(和/英) (略称: )
(略称: )
第18著者 氏名(和/英/ヨミ) / /
第18著者 所属(和/英) (略称: )
(略称: )
第19著者 氏名(和/英/ヨミ) / /
第19著者 所属(和/英) (略称: )
(略称: )
第20著者 氏名(和/英/ヨミ) / /
第20著者 所属(和/英) (略称: )
(略称: )
第21著者 氏名(和/英/ヨミ) / /
第21著者 所属(和/英) (略称: )
(略称: )
第22著者 氏名(和/英/ヨミ) / /
第22著者 所属(和/英) (略称: )
(略称: )
第23著者 氏名(和/英/ヨミ) / /
第23著者 所属(和/英) (略称: )
(略称: )
第24著者 氏名(和/英/ヨミ) / /
第24著者 所属(和/英) (略称: )
(略称: )
第25著者 氏名(和/英/ヨミ) / /
第25著者 所属(和/英) (略称: )
(略称: )
第26著者 氏名(和/英/ヨミ) / /
第26著者 所属(和/英) (略称: )
(略称: )
第27著者 氏名(和/英/ヨミ) / /
第27著者 所属(和/英) (略称: )
(略称: )
第28著者 氏名(和/英/ヨミ) / /
第28著者 所属(和/英) (略称: )
(略称: )
第29著者 氏名(和/英/ヨミ) / /
第29著者 所属(和/英) (略称: )
(略称: )
第30著者 氏名(和/英/ヨミ) / /
第30著者 所属(和/英) (略称: )
(略称: )
第31著者 氏名(和/英/ヨミ) / /
第31著者 所属(和/英) (略称: )
(略称: )
第32著者 氏名(和/英/ヨミ) / /
第32著者 所属(和/英) (略称: )
(略称: )
第33著者 氏名(和/英/ヨミ) / /
第33著者 所属(和/英) (略称: )
(略称: )
第34著者 氏名(和/英/ヨミ) / /
第34著者 所属(和/英) (略称: )
(略称: )
第35著者 氏名(和/英/ヨミ) / /
第35著者 所属(和/英) (略称: )
(略称: )
第36著者 氏名(和/英/ヨミ) / /
第36著者 所属(和/英) (略称: )
(略称: )
講演者 第1著者 
発表日時 2023-03-17 15:40:00 
発表時間 25分 
申込先研究会 MVE 
資料番号 IMQ2022-84, IE2022-161, MVE2022-114 
巻番号(vol) vol.122 
号番号(no) no.437(IMQ), no.439(IE), no.440(MVE) 
ページ範囲 pp.333-338 
ページ数
発行日 2023-03-08 (IMQ, IE, MVE) 


[研究会発表申込システムのトップページに戻る]

[電子情報通信学会ホームページ]


IEICE / 電子情報通信学会