Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
[Journal club] LISA: Reasoning Segmentation via...
Search
Semantic Machine Intelligence Lab., Keio Univ.
PRO
July 16, 2024
Technology
260
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[Journal club] LISA: Reasoning Segmentation via Large Language Model
Semantic Machine Intelligence Lab., Keio Univ.
PRO
July 16, 2024
More Decks by Semantic Machine Intelligence Lab., Keio Univ.
See All by Semantic Machine Intelligence Lab., Keio Univ.
[Journal club] Predict Before You Explore: Predictive Planning with Specialized Memory for Embodied Question Answering
keio_smilab
PRO
0
81
[Journal club] PHyCLIP: 𝒍𝟏-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning
keio_smilab
PRO
0
86
[Journal club] ReMEmbR: Building and Reasoning Over Long-Horizon Spatio-Temporal Memory for Robot Navigation
keio_smilab
PRO
0
110
[Journal club] ReLaGS: Relational Language Gaussian Splatting
keio_smilab
PRO
0
120
[Journal club] Flow as the Cross-Domain Manipulation Interface
keio_smilab
PRO
0
98
Mobi-𝜋: Mobilizing Your Robot Learning Policy
keio_smilab
PRO
0
160
A Gentle Introduction to Transformers
keio_smilab
PRO
16
7k
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
keio_smilab
PRO
0
60
[Journal club] VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
keio_smilab
PRO
1
150
Other Decks in Technology
See All in Technology
Alphaモジュール使っていいのかい!?いけないのかい!?どっちなんだいっ!?
watany
1
320
ダッシュボード"開発"について 〜使われるダッシュボードのつくりかた〜
kimichan
0
190
AI、CDK と協働する Full TypeScript アプリケーション開発 / Full TypeScript Application with AI and CDK
geekplus_tech
2
480
Playwright × AI Agent でE2Eテストはどう変わるか AI駆動テストの可能性と実用検証の結果
taiga7543
2
790
文字起こし基盤の信頼性
abnoumaru
0
120
「守りたい体験」を渡すだけで E2E を生成させられるようになった話
hinac0
2
1k
Amazon Quick 入門!
ysuzuki
2
130
Kaggleで成長するために意識したこと
prgckwb
2
440
インシデント事例と パッケージの全量解析に学ぶ ソフトウェアサプライチェーンの守り方 / supply-chain-attack-defense
flatt_security
0
890
AIツールを導入しても生産性はあがらない? カオナビが直面した 3つの壁と乗り越え方。/ Overcoming 3 Barriers to AI-Driven Productivity at kaonavi
kaonavi
0
160
なぜ、あなたのAPIは使われないのか? AX時代の設計原則、ガードレール、運用体制
yokawasa
1
210
JAWS_ICEBERG_BASECAMP
iqbocchi
2
110
Featured
See All Featured
技術選定の審美眼(2025年版) / Understanding the Spiral of Technologies 2025 edition
twada
PRO
118
120k
Testing 201, or: Great Expectations
jmmastey
46
8.2k
Connecting the Dots Between Site Speed, User Experience & Your Business [WebExpo 2025]
tammyeverts
11
970
A designer walks into a library…
pauljervisheath
211
24k
Abbi's Birthday
coloredviolet
3
8.8k
DevOps and Value Stream Thinking: Enabling flow, efficiency and business value
helenjbeal
1
260
Into the Great Unknown - MozCon
thekraken
41
2.6k
Lightning Talk: Beautiful Slides for Beginners
inesmontani
PRO
2
610
Claude Code どこまでも/ Claude Code Everywhere
nwiizo
65
57k
Raft: Consensus for Rubyists
vanstee
141
7.6k
ラッコキーワード サービス紹介資料
rakko
1
4M
Effective software design: The role of men in debugging patriarchy in IT @ Voxxed Days AMS
baasie
0
450
Transcript
LISA: Reasoning Segmentation via Large Language Model Xin Lai1, Zhuotao
Tian2, Yukang Chen1, Yanwei Li1, Yuhui Yuan4, Shu Liu3, Jiaya Jia1,3 1 CUHK, 2 HIT(Shenzhen), 3 SmartMore, 4 MSRA CVPR2024 慶應義塾⼤学 杉浦孔明研究室 ⾬宮佳⾳ Lai, Xin, et al. "LISA: Reasoning Segmentation via Large Language Model.” Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2024.
2 🙆 事前に定義されたカテゴリの物体は認識できる 🙆 単純・明⽰的な表現で指定された物体は認識できる e.g., “the orange” 🙅 複雑な推論が必要な記述は理解できない
🙅 知識や常識を含む記述は理解できない e.g., ”the food with high Vitamin C” |背景(1/2): 既存のPerceptionシステムは暗黙的な指⽰を理解できない ×
3 LLMはユーザの暗黙的な意図を推論し理解する能⼒を持つ |背景(2/2): LLMを活用したReasoning Segmentationタスク RQ:この能⼒を活⽤し、複雑な推論を必要とする暗黙的な指⽰⽂から 対象物体のセグメンテーションマスクを⽣成できないか?
4 |関連研究 : 既存のセグメンテーション手法とマルチモーダルLLM ⼿法 概要 X-Decoder [Zou+, CVPR23] 画像とテキストを組み合わせ、複数のタスクを単⼀モデルで処理できる汎⽤デコーダ
SEEM [Zou+, NeurIPS23] テキスト、⾳声、スクリブルなど多様な⼊⼒を扱えるセグメンテーション⼿法 Flamingo [Alayrac+, NeurIPS22] クロスモーダルアテンションで画像と⾔語を統合し、few-shot学習に強み BLIP-2 [Li+, ICML23] frozenしたvisual encoderから得た画像特徴を、text embeddingとともにLLMに⼊⼒ X-Decoder SEEM BLIP-2
5 |提案手法(1/4): large Language Instructed Segmentation Assistant 新規性 セグメンテーション出⼒のrequestを意味する<SEG>トークンを マルチモーダルLLMの語彙に追加
6 |提案手法(2/4): マルチモーダルLLMの処理 ! 𝑦!"! # ℎ#$% ・マルチモーダルLLMの出⼒として<SEG>トークンを含んだテキストである ! 𝒚!"!
を得る ・マルチモーダルLLMの最終層embeddingであり、 <SEG>トークンに対応する # 𝒉#$% を抽出 ・ # 𝒉#$% にMLPのprojection layerである𝛾を適⽤して 𝒉#$% を得る 事前学習済みの LLaVAを使⽤ 効率的な fine-tuningを実現
7 |提案手法(3/4): VisualエンコーダとMaskデコーダ SAM or Mask2Formerを使⽤ ・Visualエンコーダから画像特徴 𝒇 を得る ・𝒉!"#
と 𝒇 を⼊⼒としてMaskデコーダからセグメンテーションマスク # 𝑴 を得る
8 |提案手法(4/4): 損失関数 ・テキスト⽣成の損失関数:LLMの出⼒テキストとGTとのクロスエントロピー誤差 ・セグメンテーションマスクの損失関数:バイナリクロスエントロピー誤差とDice誤差の和 ・全体の損失関数 各ピクセルごとの誤差 全体的な重なり度に基づく誤差 𝜆 は異なる損失間のバランスを
調整するための重み係数
9 |実験設定(1/3): データセット ・Semantic Segmentation データセット ADE20K [Zhou+, CVPR17], COCO-Stuff
[Caesar+, CVPR18], PACO-LVIS [Ramanathan+, CVPR23], PartImageNet [He+, ECCV22], PASCAL-Part [Chen+, CVPR14] ・Vanilla Referring Segmentation データセット refCLEF, refCOCO, refCOCO+ [Kazemzadeh+, EMNLP14], refCOCOg [Mao+, CVPR16] ・Visual Question Answering データセット LLaVA-Instruct-150k [Liu+, 23]
10 |実験設定(2/3): ReasonSeg Reasoning Segmentationタスクの評価のため新たなベンチマークを提案 データの種類 image-instruction-maskの組 データ構成 ・train:239 ・val:200
・test:779 クエリの種類 ・short phrases ・long sentences
11 |実験設定(3/3) Backbone マルチモーダルLLM:LLaVA-7B-v1-1, LLaVA-13B-v1-1 [Liu+, 23] Visualエンコーダ:SAM [Kirillov+, ICCV23],
Mask2Former [Cheng+, CVPR22] 学習環境・時間 NVIDIA 24G 3090 GPU × 8個 3⽇未満 評価指標 ・gIoU:画像ごとのIoUスコアの平均 ・cIoU:全画像の予測領域と正解領域をまとめた累積IoU
12 |定量的結果(1/2): Reasoning Segmentation ・推論を含まないデータセットのみで 学習した場合でも良好な結果 ・ReasonSegでfine-tuningすると さらに優れた結果 ftはReasonSegデータセットでfine-tuningしたもの <-JBOH
$713> <-JV $713> <;PV $713> <;PV $713>
13 |定量的結果(2/2): Reasoning Segmentation 情報伝達の仲介としてのテキストに依存してしまう2段階アプローチと⽐較して end-to-endの学習のLISAが良好な結果
14 |定性的結果(1/2): 既存手法との比較 既存⼿法では複雑な推論をすることが難しいが、LISAでは正しく推論しマスクしている
15 |定性的結果(2/2): 複雑・暗黙的な指示文に対する結果 マスクの根拠をテキストで説明 レスリングの知識を踏まえて回答 1つの回答で複数のマスクを⽣成
16 |追試およびエラー分析 : 成功例 Generate a segmentation mask of the
washbasin in the bathroom. GT Generate a segmentation mask of the hand towel on the towel rack to the left of the sink. マスク ⼊⼒画像
17 |追試およびエラー分析 : 失敗例 GT マスク ⼊⼒画像 Generate a segmentation
mask of the pillow on the couch closest to the plant in the living room. Generate a segmentation mask of the wall picture closest to the front door in the entryway. マスク誤り 対象物体以外もマスク
18 |所感 Strength ▷ 暗黙的な指⽰を理解できるため、ロボットなどの実応⽤に有⽤ ▷ ReasonSegデータセットを⽤いなくてもzero-shotで良好な結果 Weakness ▷ マルチモーダルLLMに依存しており、特にLLaVAの13Bのモデルを使⽤する際に
メモリ使⽤量や推論時間が増加する ▷ 指⽰⽂の複雑さや曖昧さの限界がある
背景 ▷ 複雑・暗黙的な指⽰⽂から対象物体のセグメンテーションマスクを⽣成できれば便利 提案⼿法:LISA ▷ Reasoning SegmentationタスクとReasonSegベンチマークの提案 ▷ マルチモーダルLLMにセグメンテーション能⼒を付加 結果
▷ Reasoning Segmentationタスクにおいて全ての指標でSOTAを達成 19 |まとめ
20 Appendix
21 |定量的結果 : RES Reasoning Segmentationタスクだけでなく、 RESタスクにおいても良好な結果 評価指標は全てcIoU +1.1 +2.6
+2.1 -0.9 -0.2 +0.4 +2.9 +4.6 <-VP $713> <%JOH *$$7> <8BOH *$$7> <:BOH $713> <-JV $713>
22 | Ablation studies(1/2): Visualエンコーダ COCOデータセットのみでトレーニングされたMask2Formerよりも 数⼗億の⾼品質マスクでトレーニングされたSAMの⽅が良好な結果
23 | Ablation studies(2/2): SAMへのLoRAの適用 LoRAのfine-tuningにより元のSAMモデルの⼀般化能⼒が損なわれるため LoRAを適⽤したSAMよりもfrozenされたSAMの⽅が良好な結果