Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
RSJ2024「基盤モデルの実ロボット応用」チュートリアルA(河原塚)
Search
Kento Kawaharazuka
September 06, 2024
Research
2
590
RSJ2024「基盤モデルの実ロボット応用」チュートリアルA(河原塚)
既存の基盤モデルを実ロボットに応用する方法について
Kento Kawaharazuka
September 06, 2024
Tweet
Share
More Decks by Kento Kawaharazuka
See All by Kento Kawaharazuka
RSJ2024学術ランチョンセミナー「若手・中堅による国際化リーダーシップに向けて」資料 (河原塚)
haraduka
0
200
RSJ2023「基盤モデルの実ロボット応用」チュートリアル1(既存の基盤モデルを実ロボットに応用する方法)
haraduka
4
1.6k
Other Decks in Research
See All in Research
RCEへの近道
kawakatz
1
780
SSII2024 [OS2] 画像、その先へ 〜モーション解析への誘い〜
ssii
PRO
1
1.2k
DiscordにおけるキャラクターIPを活用したUGCコンテンツ生成サービスの ラピッドプロトタイピング ~国際ハッカソンでの事例研究
o_ob
0
230
授業評価アンケートのテキストマイニング
langstat
1
350
尺度開発における質的研究アプローチ(自主企画シンポジウム7:認知行動療法における尺度開発のこれから)
litalicolab
0
290
20240626_金沢大学_新機能集積回路設計特論_配布用 #makelsi
takasumasakazu
0
150
[第62回NLPコロキウム]「なりきり」を促すHCI設計:対話型接客ロボットの遠隔操作者へのリアルタイム変換音声フィードバックの適用
nami_ogawa
0
280
CVPR2024論文紹介:Segmentation
hinako0123
0
130
第 2 部 11 章「大規模言語モデルの研究開発から実運用に向けて」に向けて / MLOps Book Chapter 11
upura
0
280
snlp2024_multiheadMoE
takase
0
380
Active Adaptive Experimental Design for Treatment Effect Estimation with Covariate Choices
masakat0
0
190
marukotenant01/tenant-20240826
marketing2024
0
500
Featured
See All Featured
The Mythical Team-Month
searls
218
43k
The Language of Interfaces
destraynor
154
24k
Reflections from 52 weeks, 52 projects
jeffersonlam
346
20k
Gamification - CAS2011
davidbonilla
80
5k
Atom: Resistance is Futile
akmur
261
25k
RailsConf & Balkan Ruby 2019: The Past, Present, and Future of Rails at GitHub
eileencodes
131
33k
Visualization
eitanlees
143
15k
Designing on Purpose - Digital PM Summit 2013
jponch
114
6.9k
GitHub's CSS Performance
jonrohan
1030
450k
Responsive Adventures: Dirty Tricks From The Dark Corners of Front-End
smashingmag
249
21k
Building Adaptive Systems
keathley
38
2.2k
What’s in a name? Adding method to the madness
productmarketing
PRO
22
3.1k
Transcript
1 2022.09.06 RSJ2024 基盤モデルの実ロボット応用 チュートリアルA 河原塚健人1, 松嶋達也1, 宮澤和貴2 (1東京大学, 2大阪大学)
本オーガナイズドセッションの目的 • ロボットのシステム構築が圧倒的に簡単に. 波に乗るしかない. • 海外の研究に置いて行かれないように最新情報をキャッチアップ • 国内で最新情報を共有して立ち向かう・追い越す 2
オーガナイザー 3 河原塚 健人 東京大学 松嶋 達也 東京大学 宮澤 和貴
大阪大学
これまでの活動(1) • 特集号「Real-World Robot Applications of Foundation Models」 @Advanced Robotics
4 • Survey Paper • NLP2024併設ワークショップ: 大規模言語モデルの実世界応用
これまでの活動(2) 5 • Cooking Robotics Workshop @ICRA2024
基盤モデルの実ロボット応用OS 6 RSJ2023 • 3セッション / 21件の発表 • 7機関: 東大,
慶應, 早稲田, 名工大, 立命館, 金沢大, 中部大 RSJ2024 • 4セッション / 27件の発表 • 20機関: 東大, 慶應, 早稲田, 阪大, 京大, Sony, RIKEN AIP, ATR, NII, TCRDL, 産総研, 名工大, 立命館, 創価大, トヨタ自動車, 富士通, 都 立大, 金沢工業, 中部大, ドワンゴ 様々な機関が基盤モデルを使うようになってきた
本チュートリアルの構成 チュートリアルA (河原塚) • 既存の基盤モデルの実ロボット活用例 チュートリアルB (松嶋) • ロボット基盤モデルを作る取り組み チュートリアルC
(宮澤) • 基盤モデルの対話活用について 7 大きな進展はない かなり進展がある 去年の資料 「基盤モデルの実ロボット応用」チュートリアル 去年の資料 「基盤モデルの実ロボット応用」チュートリアル 新規
活用可能な基盤モデルの種類@RSJ2023 8 Visual Prompting 全体的な性能アップ
活用可能な基盤モデルの種類(1) 9 GPT-4o Imagen3 全体的な性能アップ SAM 2
活用可能な基盤モデルの種類(2) 10 PIVOT [S. Nasiriany+, 2024] MOKA [F. Liu+, 2024]
Visual Prompting
活用可能な基盤モデルの種類(3) 11 Depth Anything [L. Yang+, 2024] FoundationPose [B. Wen+,
2024] MeshAnything [Y. Chen+, 2024] 4M [D. Mizrahi+, 2024] URDFormer [Z. Chen+, 2024] 多様なモダリティ
基盤モデルのロボット活用方法@RSJ2023 12
基盤モデルのロボット活用方法@RSJ2023 13 1. CLIPやDeticで認識/LLMで動作計画 2. Affordance/Rewardを構築して強化学習/MPC 3. マップやシーングラフを構築して動作計画 4. センサと制御入力の関係をデータ拡張/学習
チュートリアルBに譲る
基盤モデルのロボット活用方法(1) 14 Eureka [J. Ma+, 2023]
基盤モデルのロボット活用方法(1) 15 Eureka [J. Ma+, 2023]
基盤モデルのロボット活用方法(2) 16 DrEureka [J. Ma+, 2024]
我々の事例@2024 18
我々の事例 – VLMによる食材状態認識 19 [K. Kawaharazuka+, RA-L2024]
我々の事例 – LLM/VLMによる料理ロボット 20 [N. Kanazawa+, Advanced Robotics]
我々の事例 – LLMとPDDLの融合 • LLMとVLMでPDDL(Planning Domain Definition Language)を記述 21 [K.
Shirai+, ICRA2024]
我々の事例 – VLMと動作指令の統合 22 [K. Kawaharazuka+, Humanoids2023]
我々の事例 – 事前知識無しのナビゲーション 23 [K. Kawaharazuka+, Advanced Robotics]
まとめ • チュートリアルA • 既存の基盤モデルの実ロボット活用例 • 一方でRSJ2023からそこまで大きな進展はない • 活用可能な基盤モデルの種類 •
各基盤モデルの性能向上 / よりマルチモーダルへ • 基盤モデルの活用方法 • 基盤モデル×強化学習 / ロボット基盤モデル • 我々の研究事例 • 連続状態認識 / レシピ解釈 / PDDL / 運動指令との融合/ ナビゲーション 25