Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
事前学習言語モデルを用いたVision & Languageの動向 / A Survey of...
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
Kyosuke Nishida
November 30, 2019
Research
3.7k
5
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
事前学習言語モデルを用いたVision & Languageの動向 / A Survey of Pre-trained Language Models for Vision & Language
Kyosuke Nishida
November 30, 2019
More Decks by Kyosuke Nishida
See All by Kyosuke Nishida
論文紹介 / The Llama 3 Herd of Models
kyoun
9
3.2k
大規模言語モデル入門 / LLM introduction (SES2023)
kyoun
122
82k
論文紹介 / Llama 2: Open Foundation and Fine-Tuned Chat Models
kyoun
6
8.2k
PAKDD2023 Tutorial 2: A Gentle Introduction to Technologies Behind Language Models and Recent Achievement in ChatGPT (Parts 3 and 4)
kyoun
7
2k
Collaborative AI: 視覚・言語・行動の融合
kyoun
22
9.5k
NLPとVision-and-Languageの基礎・最新動向 (1) / DEIM Tutorial Part 1: NLP
kyoun
26
11k
NLPとVision-and-Languageの基礎・最新動向 (2) / DEIM Tutorial Part 2 Vision-and-Language
kyoun
23
13k
論文紹介 / Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality
kyoun
3
1.3k
自然言語処理とVision-and-Language / A Tutorial on NLP & Vision-and-Language
kyoun
22
13k
Other Decks in Research
See All in Research
[最先端NLP勉強会2026] Checklists Are Better Than Reward Models For Aligning Language Models
nzw0301
1
310
GLIM とMegaParticles:正規分布近似の限界とタイトカップリング&パーティクルフィルタの進展 / GLIM and MegaParticles : Progress of the distribution representation in SLAM
koide3
0
810
Data Visualization Tools in the Age of AI
flekschas
0
200
HackSick vol.7 LT資料【LLMアーキテクチャ入門・事前学習時の躓き所解説】 スパースなAttention・状態空間モデル
rikkabotan7
0
170
重要だけど測れていないもの:高齢者ケアの見えない課題
theoriatec2024
0
510
論文紹介: Understanding Epistemic Language with a Language-augmented Bayesian Theory of Mind
hisaokatsumi
0
160
「AIとWhyを深堀る」をAIと深堀る
iflection
0
610
Cross-Media Human-Information Interaction
signer
PRO
0
230
The story of RefactoringMiner. Slow research, long-term impact
tsantalis
0
150
SoftMatcha 2: 1兆語規模コーパスの超高速かつ柔らかい検索
e869120_sub
7
3.8k
最先端NLP勉強会2026 論文紹介:Reasoning with Sampling: Your Base Model is Smarter Than You Think (ICLR 2026 paper)
kogoro
4
600
IA for theory
gpeyre
1
400
Featured
See All Featured
I Don’t Have Time: Getting Over the Fear to Launch Your Podcast
jcasabona
35
2.8k
Redefining SEO in the New Era of Traffic Generation
szymonslowik
1
410
No one is an island. Learnings from fostering a developers community.
thoeni
21
3.8k
Music & Morning Musume
bryan
47
7.4k
The Cost Of JavaScript in 2023
addyosmani
55
10k
State of Search Keynote: SEO is Dead Long Live SEO
ryanjones
0
260
Highjacked: Video Game Concept Design
rkendrick25
PRO
1
450
職位にかかわらず全員がリーダーシップを発揮するチーム作り / Building a team where everyone can demonstrate leadership regardless of position
madoxten
69
65k
So, you think you're a good person
axbom
PRO
2
2.1k
A brief & incomplete history of UX Design for the World Wide Web: 1989–2019
jct
2
500
Paper Plane
katiecoart
PRO
2
53k
Leveraging LLMs for student feedback in introductory data science courses - posit::conf(2025)
minecr
1
370
Transcript
事前学習⾔語モデルを⽤いた Vision & Language の動向 2019/11/30 ⻄⽥京介 1
• BERTに代表される事前学習⾔語モデルが Vision & Language タスクにも導⼊され成果を挙げている – VQA,VCR,画像/テキスト検索・含意などでSOTAを更新 • 事前学習⾔語モデルを基に画像/動画キャプションデータを
⽤いて Vision & Language の汎⽤的な事前学習を⾏い, downstreamタスクのデータセットでfine-tuningする – 1つのTransformerで⾔語と画像を同時に扱う,あるいは,2つの Transformerを⾔語・画像のそれぞれに対して⽤意 – 画像を扱うタスクでは物体領域検出を⾏い,各画像領域の表現+位置 を1つの⾔語トークンの⽤に扱うことが主流 • 現在の研究トレンドは, Vision & Language 事前学習タスクの 問題設定の⼯夫および学習データ数の増加による精度向上 概要 2
• 24層の巨⼤モデルで⼤量のデータで事前学習して汎⽤なモ デルを獲得し、各応⽤タスクに適応させるアプローチ • 2018/10/11に発表、11/30までに2662件の被引⽤ • 多数のNLPタスクで⾼い性能を実現して注⽬を浴びる 3 BERT [Devlin(Google)+,
NAACL19 Best Paper] Vision & Language https://www.aclweb.org/anthology/N19-1423
Vision & Language モデルの概要 4
• ⼊⼒形式: 1系列2セグメント.キャプション+画像トークンの系列 • ⾔語表現モデル: BERT large • 画像表現モデル: S3Dによるencoding
→ ベクトル量⼦化で離散トークン化(20k種類) • 事前学習データ: YouTubeの料理動画 (テキストはASR結果) • 事前学習タスク: Masked LM(⾔語&画像トークン), テキスト-単語マッチング • 評価: YouCook II (action classification, video captioning) VideoBERT [Sun(Google)+, ICCV19, arXiv19 Apr 3] 引⽤数19 http://openaccess.thecvf.com/content_ICCV_2019/papers/Sun_VideoBERT_A_Joint_ Model_for_Video_and_Language_Representation_Learning_ICCV_2019_paper.pdf 5
• ⼊⼒形式: 2系列.キャプション単語 / 画像表現 を2つのTRMにそれぞれ⼊⼒ • ⾔語表現モデル: BERT base
• 画像表現モデル: S3Dによるencoding → 画像⽤TRMへ⼊⼒ • 事前学習データ: HowTo100M (テキストはASR結果) • 事前学習タスク: 次フレーム予測,テキスト-単語マッチング • 評価: ActivityNet, Breakfast, and 50Salad (action anticipation), YouCook II (video captioning), COIN(action segmentation) CBT [Sun(Google) +, ICLR20(査読中), arXiv19 Jun 13] 引⽤数4 https://arxiv.org/abs/1906.05743 6
• ⼊⼒形式: 2系列.画像領域(ROI)表現 / キャプション単語系列 • ⾔語表現モデル: BERT base •
画像表現モデル: Faster R-CNNによるROI detection + encoding → 画像⽤TRMへ • 事前学習データ: Conceptual Captions • 事前学習タスク: Masked LM,Masked ROIの意味クラス分類(Faster R-CNNの出⼒ 分布とのKLの最⼩化), テキスト-画像のマッチング • 評価: VQA2, VCR, RefCOCO+, Flicker30k IR VilBERT [Lu(GIT)+, NeurIPS19, arXiv19 Aug 6] 引⽤数16 https://papers.nips.cc/paper/8297-vilbert-pretraining-task-agnostic-visiolinguistic- representations-for-vision-and-language-tasks 7 コード有 https://github.com/jiasenlu/vilbert_beta
• ⼊⼒形式: 1系列2セグメント.キャプション単語+画像領域(ROI)表現 • ⾔語表現モデル: BERT base • 画像表現モデル: Faster
R-CNNによるregion detection + encoding • 事前学習データ: COCO • 事前学習タスク: Masked LM,テキスト-画像のマッチング • 評価: VQA2, VCR, NLVR2, and Flickr30K entities VisualBERT [Li(UCLA)+,arXiv19 Aug 9] 引⽤数15 https://arxiv.org/abs/1908.03557 8 https://github.com/uclanlp/visualbert コード有
• ⼊⼒形式: 1系列.画像領域(ROI)表現+キャプション単語 • ⾔語表現モデル: BERT large • 画像表現モデル: ResNet
152 (VCRのROIをそのまま使う) • 事前学習データ: Conceptual Captions • 事前学習タスク: Masked LM,テキスト-画像のマッチング • 評価: VCR B2T2 [Alberti(Google) +, EMNLP19, arXiv19 Aug 14] 引⽤数8 https://www.aclweb.org/anthology/D19-1219/ 9 https://github.com/google-research/language/tree/master/language/question_answering/b2t2 コード有
• ⼊⼒形式: 1系列2セグメント.画像領域(ROI)クラス+キャプション単語.さらに, 画像表現をearly fusion • ⾔語表現モデル: BERT base •
画像表現モデル: Faster-RCNNによるregion detection + encoding + semantic class • 事前学習データ: Conceptual Captions • 事前学習タスク: Masked LM(⾔語トークン, ROIラベル), テキスト-画像マッチング • 評価: COCO & Flicker30k 画像/テキスト検索, (VCR) Unicoder-VL [Li(Microsoft)+, arXiv19 Aug 16] 引⽤数8 https://arxiv.org/abs/1908.06066 10
• ⼊⼒形式: 2系列.画像領域(ROI)表現 / キャプション単語 を並列⼊⼒ • ⾔語表現モデル: 利⽤なし(構造はBERTと同じ) •
画像表現+領域検出モデル: Faster-RCNNによるregion detection + encoding • 事前学習データ: COCO, Visual Genome, VQA2, GQA, VG-QA • 事前学習タスク: Masked LM, Masked ROIの特徴回帰&意味クラス分類,テキスト- 画像マッチング,Visual Question Answering • 評価: VQA2, GQA LXMERT [Tan(UNC) +, EMNLP19, arXiv19 Aug 20] 引⽤数12 https://arxiv.org/abs/1908.07490 11 https://github.com/airsplay/lxmert コード有
• ⼊⼒形式: 1系列2セグメント.キャプション単語+画像領域(ROI)表現 • ⾔語表現モデル: BERT (base or large) •
画像表現モデル: Faster-RCNNによるROI detection + encoding • 事前学習データ: Conceptual Captions • 事前学習タスク: Masked LM(⾔語トークン, ROIラベル) • 評価: VCR, VQA, RefCOCO+ VLBERT [Su(Microsoft) +, ICLR20(査読中), arXiv19 Aug 22] 引⽤数10 https://arxiv.org/abs/1908.08530 12
• ⼊⼒形式: 1系列2セグメント.画像領域表現+キャプション単語 • ⾔語表現モデル: BERT (base or large) •
画像表現+領域検出モデル: Faster-RCNN • 事前学習データ: COCO, Visual Genome, Conceptual Captions, SBU Captions • 事前学習タスク: Masked LM,Masked ROI 特徴回帰&意味クラス分類(KL最⼩化), テキスト-画像マッチング • 評価: VCR, VQA, Flicker30k, NLVR, SNLI-VE, RefCOCO+(全タスクで現在のSOTA) UNITER [Chen(Microsoft) +, ICLR20(査読中), arXiv19 Sep 25] 引⽤数3 https://arxiv.org/abs/1909.11740 13
事前学習データ& Vision & Languageタスク (UNITER論⽂ベース,動画含まず) 14
15 Vision+Language データ&タスク (UNITER論⽂より)
16 V+Lタスクのスコア⽐較(UNITER論⽂より)
• 300万件の(画像,キャプション)の組 • WebからAlt-textと画像のペアをクロール.Alt-textの固有名詞 について上位語に変換しConceptual Captionsを⾃動⽣成 • Object情報は無し Conceptual Captions
[Sharma(Google)+, ACL18] 引⽤数41 https://www.aclweb.org/anthology/P18-1238/ 17
Conceptual Captions [Sharma(Google)+, ACL18] 引⽤数41 https://www.aclweb.org/anthology/P18-1238/ 18
19 COCO [Lin(Microsoft)+, ECCV14] 引⽤数7142 http://cocodataset.org/#explore • Flickrから収集した10.6万件の画像.各画像に⼈間がアノテー ションしたキャプションが5件付いている •
Object情報あり https://arxiv.org/abs/1405.0312
• 画像10.8万件,画像中のobjectに関連して密に説明⽂がアノ テーションされている 20 Visual Genome [Krishna(Stanford)+,IJCV17] 引⽤数871 https://arxiv.org/abs/1602.07332 https://visualgenome.org/VGViz/explore
• Flickrから収集した99.0万件の写真とキャプション • キャプションの品質を上げるためにフィルタリングを実施 21 SBU Captions [Ordonez +,NIPS11] 引⽤数871
https://papers.nips.cc/paper/4470-im2text-describing- images-using-1-million-captioned-photographs
• 画像に対する質問応答 • UNITERでは分類問題(頻出回答3129種を候補)とする 22 VQA 2.0 [Goyal(Virginia Tech)+, CVPR17]
引⽤数367 https://arxiv.org/abs/1612.00837
• 画像に対する質問応答 • 2.0では質問タイプに応じて回答が均等化されている 23 VQA 2.0 [Goyal(Virginia Tech)+, CVPR17]
引⽤数367 https://arxiv.org/abs/1612.00837
• ⾔語+常識+ビジョンの理解が必要なタスク • UNITERではQ->AとQA->Rに分解して解く.QAあるいは QARの 組を結合してテキスト-画像⼊⼒とし, [CLS]表現を基に分類 24 VCR [Zellers
(U Washington)+, CVPR19] 引⽤数38 Rowan Zellers, Yonatan Bisk, Ali Farhadi, Yejin Choi: From Recognition to Cognition: Visual Commonsense Reasoning. CoRR abs/1811.10830 (2018) 画像と質問(Q) に対して、回答 (A)と根拠(R)を 選択
25 VCRリーダーボード(抜粋) 11/29 https://visualcommonsense.com/leaderboard/ ※各モデルでensemble, largeを優先して抜粋. Q->A: 回答正解率 QA->R: 根拠正解率
Q->AR: 回答&根拠正解率 まだ⼈間とは開きあり
26 NLVR2 [Suhr(Cornell U)+, ACL19] 引⽤数14 https://www.aclweb.org/anthology/P19-1644/ • 2つの画像に関するキャプションが正しい物か否かを分類 •
UNITERでは画像ペア-テキストの組として⼊⼒,[CLS]表現を基に分類
• 画像に関するテキストの含意認識.SNLIのキャプションが Flickr30kから作られていることを利⽤して紐付け 27 SNLI-VE [Xie(NEC Lab America)+, arXiv19] 引⽤数5
https://arxiv.org/abs/1901.06706
28 Image-Text Retrieval [Lee+,ECCV18] 引⽤数73 https://arxiv.org/abs/1803.08024 • COCO, Flickr30kに基づくテキスト→画像 (IR),画像→テキスト(TR)の検索
• UNITERではランキング問題としてfine-tuning.Fine-tuningなしのzero-shot 設定でも実験.
29 RefCOCO [Kazemzadeh+,EMNLP14] 引⽤数259 [Yu+,ECCV16] 引⽤数141 https://github.com/lichengunc/refer https://arxiv.org/abs/1608.00272 https://www.aclweb.org/anthology/D14-1086/ •
テキストに対して最も適切な画像中のRegionを選択する • UNITERではFaster R-CNNで抽出した各ROIに対応する出⼒表現 を基に分類