| 講演抄録/キーワード |
| 講演名 |
2022-12-16 15:10
[ショートペーパー]コサイン類似度に基づいた超球面上の注視機構とビジョントランスフォーマーへの応用 ○李 正大・川上 玲・井上中順(東工大) PRMU2022-52 |
| 抄録 |
(和) |
コンピュータビジョンでのビジョントランスフォーマーの成功は,その自己注視機構の構造にあると考えられてきた. しかし,ビジョントランスフォーマーの自己注視機構は,中間表現を混合させる操作を含む一般的な構造に代替できる
と,最近の一連の研究で指摘されている. 本稿では, ビジョントランスフォーマーの自己注視機構を,損失関数と分類器の結合として一般化した構造を提案する. また,この構造の実装例として,二進ロジスティック回帰損失の組合せで構成された損失関数と線形分類器を使用したモデルを提示する. このモデルは自己注視機構とは異なり, 内積演算ではなくコサイン類似度を使用する.評価実験では,外部訓練データ無しのCIFAR10とCIFAR100データセットにおける分類精度について,提案手法と,軽量かつ高性能のトランスフォーマーであるDeiTとを比較した. 実験の結果, 提案手法が特定の設定の下では,DeiTより高い精度を得ることが分かった. |
| (英) |
The success of Vision Transformers in computer vision is usually attributed to its distinct structure of self-attention architecture. However, it has been pointed out by a number of researchers that self-attention in Vision Transformer can be replaced with more general structures that involve mixing intermediate tokens. In this paper, we propose an architecture that generalizes self-attention block of Vision Transformer as a loss function combined with a classifier. On top of this, we present an instance of the architecture that employs a combination of logistic regression losses in conjunction with a linear classifier, which relies on cosine similarity instead of dot product. In the experiment section of the paper, we compared the proposed model with DeiT, an effective light-weight Transformer, on classification accuracy for CIFAR10 and CIFAR100 dataset without external training data. As a result, we have discovered that the proposed model performs better than DeiT under certain settings. |
| キーワード |
(和) |
ビジョントランスフォーマー / 注意機構 / 損失関数 / L2正規化 / / / / |
| (英) |
Vision Transformer / attention / loss function / L2 normalization / / / / |
| 文献情報 |
信学技報, vol. 122, no. 314, PRMU2022-52, pp. 106-109, 2022年12月. |
| 資料番号 |
PRMU2022-52 |
| 発行日 |
2022-12-08 (PRMU) |
| ISSN |
Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
PRMU2022-52 |
| 研究会情報 |
| 研究会 |
PRMU |
| 開催期間 |
2022-12-15 - 2022-12-16 |
| 開催地(和) |
富山国際会議場 |
| 開催地(英) |
Toyama International Conference Center |
| テーマ(和) |
制御のためのCV |
| テーマ(英) |
|
| 講演論文情報の詳細 |
| 申込み研究会 |
PRMU |
| 会議コード |
2022-12-PRMU |
| 本文の言語 |
英語(日本語タイトルあり) |
| タイトル(和) |
コサイン類似度に基づいた超球面上の注視機構とビジョントランスフォーマーへの応用 |
| サブタイトル(和) |
|
| タイトル(英) |
Cosine Similarity Based Attention on a Hypersphere for Vision Transformers |
| サブタイトル(英) |
|
| キーワード(1)(和/英) |
ビジョントランスフォーマー / Vision Transformer |
| キーワード(2)(和/英) |
注意機構 / attention |
| キーワード(3)(和/英) |
損失関数 / loss function |
| キーワード(4)(和/英) |
L2正規化 / L2 normalization |
| キーワード(5)(和/英) |
/ |
| キーワード(6)(和/英) |
/ |
| キーワード(7)(和/英) |
/ |
| キーワード(8)(和/英) |
/ |
| 第1著者 氏名(和/英/ヨミ) |
李 正大 / Jungdae Lee / イ ジョンデ |
| 第1著者 所属(和/英) |
東京工業大学 (略称: 東工大)
Tokyo Institute of Technology (略称: Tokyo Tech) |
| 第2著者 氏名(和/英/ヨミ) |
川上 玲 / Rei Kawakami / カワカミ レイ |
| 第2著者 所属(和/英) |
東京工業大学 (略称: 東工大)
Tokyo Institute of Technology (略称: Tokyo Tech) |
| 第3著者 氏名(和/英/ヨミ) |
井上 中順 / Nakamasa Inoue / イノウエ ナカマサ |
| 第3著者 所属(和/英) |
東京工業大学 (略称: 東工大)
Tokyo Institute of Technology (略称: Tokyo Tech) |
| 第4著者 氏名(和/英/ヨミ) |
/ / |
| 第4著者 所属(和/英) |
(略称: )
(略称: ) |
| 第5著者 氏名(和/英/ヨミ) |
/ / |
| 第5著者 所属(和/英) |
(略称: )
(略称: ) |
| 第6著者 氏名(和/英/ヨミ) |
/ / |
| 第6著者 所属(和/英) |
(略称: )
(略称: ) |
| 第7著者 氏名(和/英/ヨミ) |
/ / |
| 第7著者 所属(和/英) |
(略称: )
(略称: ) |
| 第8著者 氏名(和/英/ヨミ) |
/ / |
| 第8著者 所属(和/英) |
(略称: )
(略称: ) |
| 第9著者 氏名(和/英/ヨミ) |
/ / |
| 第9著者 所属(和/英) |
(略称: )
(略称: ) |
| 第10著者 氏名(和/英/ヨミ) |
/ / |
| 第10著者 所属(和/英) |
(略称: )
(略称: ) |
| 第11著者 氏名(和/英/ヨミ) |
/ / |
| 第11著者 所属(和/英) |
(略称: )
(略称: ) |
| 第12著者 氏名(和/英/ヨミ) |
/ / |
| 第12著者 所属(和/英) |
(略称: )
(略称: ) |
| 第13著者 氏名(和/英/ヨミ) |
/ / |
| 第13著者 所属(和/英) |
(略称: )
(略称: ) |
| 第14著者 氏名(和/英/ヨミ) |
/ / |
| 第14著者 所属(和/英) |
(略称: )
(略称: ) |
| 第15著者 氏名(和/英/ヨミ) |
/ / |
| 第15著者 所属(和/英) |
(略称: )
(略称: ) |
| 第16著者 氏名(和/英/ヨミ) |
/ / |
| 第16著者 所属(和/英) |
(略称: )
(略称: ) |
| 第17著者 氏名(和/英/ヨミ) |
/ / |
| 第17著者 所属(和/英) |
(略称: )
(略称: ) |
| 第18著者 氏名(和/英/ヨミ) |
/ / |
| 第18著者 所属(和/英) |
(略称: )
(略称: ) |
| 第19著者 氏名(和/英/ヨミ) |
/ / |
| 第19著者 所属(和/英) |
(略称: )
(略称: ) |
| 第20著者 氏名(和/英/ヨミ) |
/ / |
| 第20著者 所属(和/英) |
(略称: )
(略称: ) |
| 第21著者 氏名(和/英/ヨミ) |
/ / |
| 第21著者 所属(和/英) |
(略称: )
(略称: ) |
| 第22著者 氏名(和/英/ヨミ) |
/ / |
| 第22著者 所属(和/英) |
(略称: )
(略称: ) |
| 第23著者 氏名(和/英/ヨミ) |
/ / |
| 第23著者 所属(和/英) |
(略称: )
(略称: ) |
| 第24著者 氏名(和/英/ヨミ) |
/ / |
| 第24著者 所属(和/英) |
(略称: )
(略称: ) |
| 第25著者 氏名(和/英/ヨミ) |
/ / |
| 第25著者 所属(和/英) |
(略称: )
(略称: ) |
| 第26著者 氏名(和/英/ヨミ) |
/ / |
| 第26著者 所属(和/英) |
(略称: )
(略称: ) |
| 第27著者 氏名(和/英/ヨミ) |
/ / |
| 第27著者 所属(和/英) |
(略称: )
(略称: ) |
| 第28著者 氏名(和/英/ヨミ) |
/ / |
| 第28著者 所属(和/英) |
(略称: )
(略称: ) |
| 第29著者 氏名(和/英/ヨミ) |
/ / |
| 第29著者 所属(和/英) |
(略称: )
(略称: ) |
| 第30著者 氏名(和/英/ヨミ) |
/ / |
| 第30著者 所属(和/英) |
(略称: )
(略称: ) |
| 第31著者 氏名(和/英/ヨミ) |
/ / |
| 第31著者 所属(和/英) |
(略称: )
(略称: ) |
| 第32著者 氏名(和/英/ヨミ) |
/ / |
| 第32著者 所属(和/英) |
(略称: )
(略称: ) |
| 第33著者 氏名(和/英/ヨミ) |
/ / |
| 第33著者 所属(和/英) |
(略称: )
(略称: ) |
| 第34著者 氏名(和/英/ヨミ) |
/ / |
| 第34著者 所属(和/英) |
(略称: )
(略称: ) |
| 第35著者 氏名(和/英/ヨミ) |
/ / |
| 第35著者 所属(和/英) |
(略称: )
(略称: ) |
| 第36著者 氏名(和/英/ヨミ) |
/ / |
| 第36著者 所属(和/英) |
(略称: )
(略称: ) |
| 講演者 |
第1著者 |
| 発表日時 |
2022-12-16 15:10:00 |
| 発表時間 |
10分 |
| 申込先研究会 |
PRMU |
| 資料番号 |
PRMU2022-52 |
| 巻番号(vol) |
vol.122 |
| 号番号(no) |
no.314 |
| ページ範囲 |
pp.106-109 |
| ページ数 |
4 |
| 発行日 |
2022-12-08 (PRMU) |