Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
[RSJ26] Flow as Flow: Modeling Robot Velocity F...
Search
Semantic Machine Intelligence Lab., Keio Univ.
PRO
August 28, 2026
Technology
220
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[RSJ26] Flow as Flow: Modeling Robot Velocity Fields as Probability Velocity Fields
Semantic Machine Intelligence Lab., Keio Univ.
PRO
August 28, 2026
More Decks by Semantic Machine Intelligence Lab., Keio Univ.
See All by Semantic Machine Intelligence Lab., Keio Univ.
[RSJ26] Building a VLA Model Based on Self-Distilled Classification
keio_smilab
PRO
0
200
[RSJ26] AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation
keio_smilab
PRO
0
140
[RSJ26] NarrativeFlow: Flow-Based Vision-Language-Action Model Using Robot Velocity Fields
keio_smilab
PRO
0
170
[RSJ26] Hierarchy-Aware Multimodal Retrieval-Augmented Generation for Embodied Question Answering
keio_smilab
PRO
1
180
[MIRU26] Open-Vocabulary Intention-Guided Object Detection in Diverse Scenes
keio_smilab
PRO
0
200
[Journal club] Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
keio_smilab
PRO
0
49
[MIRU26] To What Extent Does MLLM-as-a-Judge Exhibit Cross-Model Preference Bias?
keio_smilab
PRO
0
290
[Journal club] FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
keio_smilab
PRO
0
38
[Journal club] DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
keio_smilab
PRO
1
78
Other Decks in Technology
See All in Technology
顧客に向き合う開発組織へ。リアーキテクチャとフィーチャーチーム化で挑む組織改革
safie
0
1.8k
2026_devsumi_ozono.pdf
o3
3
490
データ_AIの事業の勝敗をわけるもの
nek0128
0
340
AI 時代のスタートアップエコシステ厶から考究する技術的負債との向き合い方
m3m0r7
PRO
2
1.9k
10分で知る最近のOmarchy
komagata
0
310
AI時代、データエンジニアが一番おもろい
genshun9
0
580
Railsのように考える: See through the Master
snoozer05
PRO
3
710
新機種発売前に見直そう!端末移行で再ログインが要るアプリ・要らないアプリは何が違うのか 〜シームレスに再開できる設計と実装〜
zozotech
PRO
0
180
【技術的負債conf】事業成長に伴う技術的負債の説明責任とAIによるモニタリング、認知的負債について
i35_267
2
1.5k
銀行勘定系システムにおける開発プロセス刷新×AIによる環境モダナイゼーション / Development Process Transformation and AI-Driven Environment Modernization
muit
0
2.1k
作品が生態系になった ─ Mini Tokyo 3D から世界へ
nagix
0
190
Spring BootからQuarkusへの移行
tatsuya1bm
2
110
Featured
See All Featured
Building the Perfect Custom Keyboard
takai
2
870
Chrome DevTools: State of the Union 2024 - Debugging React & Beyond
addyosmani
10
1.3k
Scaling GitHub
holman
464
140k
Introduction to Domain-Driven Design and Collaborative software design
baasie
1
990
How People are Using Generative and Agentic AI to Supercharge Their Products, Projects, Services and Value Streams Today
helenjbeal
1
320
Abbi's Birthday
coloredviolet
4
10k
The SEO Collaboration Effect
kristinabergwall1
1
560
StorybookのUI Testing Handbookを読んだ
zakiyama
31
6.9k
What's in a price? How to price your products and services
michaelherold
247
13k
Data-driven link building: lessons from a $708K investment (BrightonSEO talk)
szymonslowik
1
1.3k
Paper Plane
katiecoart
PRO
4
53k
Unlocking the hidden potential of vector embeddings in international SEO
frankvandijk
0
930
Transcript
物理速度場と確率速度場の統合による Flow Matching に基づく物体操作 慶應義塾⼤学 妹尾幸樹 ⼋島⼤地 髙⽊裕輔 ⼾倉健登 杉浦孔明
Motivation: ⼈間動画をロボット基盤モデルの学習に活⽤したい 背景︓テレオペレーションによるデータの⼤規模化は困難 (投資額が⼤きすぎる) ▪ Gemini Robotics︓1年で数千時間 J ⼈間動画: 収集コスト低,ウェブ上にも⼤量に存在
本研究︓Robot flow を潜在表現として⽤いて⼈間動画から学習 ▪ cf. [Kambara+, RA-L26], [Kaichi+, IROS26] EPIC KITCHEN [Damen+, ECCV18] Data Pyramid [Ye+, 26] Robot flow 2
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ② 物体操作︓Robot flow,観測 →
ロボットの関節⾓ ① ② 3
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ① ② ⽬標画像 初期画像
② 物体操作︓Robot flow,観測 → ロボットの関節⾓ 4
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ② 物体操作︓Robot flow,観測 →
ロボットの関節⾓ ② 観測画像 ① 5
関連研究︓既存⼿法は速度場を粗く近似 ⼿法 特徴 Track2Act [Bharadhwaj+, ECCV24] ⽬標画像に基づくフロー⽣成,ウェブ動画から学習 Im2Flow2Act [Xu+, CoRL24]
LILAC [Kambara+, RA-L26] ⾔語指⽰⽂に基づいて物体中⼼のフローを⽣成 L ロボット動作を有限差分でモデル化 → 速度場の粗い近似にとどまる Track2Act [Bharadhwaj+, ECCV24] 6
提案 : Flow Matching に基づくロボットフローのモデル化 Flow Matching [Lipman+, ICLR23]︓⽣成空間における速度場 (確率フロー)
をモデル化 確率フロー Robot flow 7
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 8
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 9
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 𝝃̇ ! 10
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 𝝃̇ ! 𝒙 11
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝒗 𝒙, 𝝃! , t = 𝝃̇ ! − 𝑘 𝒙 − 𝝃! J 分布外のサンプルにも頑健 𝝃! 𝝃̇ ! 𝒙 𝒗 𝒙, 𝝃! , 𝑡 12
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝒗 𝒙, 𝝃! , t = 𝝃̇ ! − 𝑘 𝒙 − 𝝃! J 分布外のサンプルにも頑健 ℒ = 𝔼!,𝒙,𝝃! 𝒗 𝒙, 𝝃! , t − 𝒗% 𝒙, t ▪ 推論 予測 ! 𝒙! = 𝒙' + - 𝒗% 𝒙( , 𝜏 𝑑𝜏 𝝃! 𝝃̇ ! 𝒙 𝒗 𝒙, 𝝃! , 𝑡 & ' 13
実験設定︓⼈間動画からフローを学習 n フロー⽣成︓⼈間動画とロボット動画を⽤いて訓練 (on H200) Something Something V2 49,257 サンプル
EPIC KITCHEN 54,938 サンプル Fractal 87,212 サンプル Bridge V2 60,064 サンプル n 物体操作︓HSRを⽤いて13種類のタスクで評価 (260試⾏/⼿法) … 14
定量的結果︓4つのベンチマークで既存⼿法を上回る In-domain ⼿法 Zero-shot 推論時間 [ms]↓ Fractal Bridge V2 DROID
Fanuc Manipulation 提案⼿法 21.23 27.11 35.89 22.46 44 Track2Act [Bharadhwaj+, ECCV24] 64.32 47.29 40.73 27.37 1,430 Im2Flow2Act [Xu+, CoRL24] 37.14 51.48 44.14 38.15 5,580 FLIP [Gao+, ICLR25] 66.17 50.73 43.10 28.31 35 評価指標︓Average Displacement Error (↓) Fractal [Brohan+, RSS23] Bridge V2 [Walke+, CoRL23] DROID [Khazatsky+, RSS24] Fanuc Manipulation [Zhu+,23] 15
定量的結果︓4つのベンチマークで既存⼿法を上回る In-domain ⼿法 Zero-shot Fractal Bridge V2 DROID 提案⼿法 21.23
27.11 35.89 Track2Act [Bharadhwaj+, ECCV24] 64.32 47.29 Im2Flow2Act [Xu+, CoRL24] 37.14 FLIP [Gao+, ICLR25] 66.17 Fanuc Manipulation 推論時間 [ms]↓ 40.73 22.46 33倍⾼速 27.37 44 1,430 51.48 44.14 38.15 5,580 50.73 43.10 28.31 35 評価指標︓Average Displacement Error (↓) Fractal [Brohan+, RSS23] Bridge V2 [Walke+, CoRL23] DROID [Khazatsky+, RSS24] Fanuc Manipulation [Zhu+,23] 16
定性的結果︓Zero-shot 設定においても適切に⽣成 ⽬標画像 ベースライン⼿法 提案⼿法 Zero-shot In-domain 初期画像 17
定性的結果︓Zero-shot 設定においても適切に⽣成 ⽬標画像 ベースライン⼿法 提案⼿法 L エンドエフェクタのフローを⽣成出来ず Zero-shot In-domain 初期画像
18
ベースの移動を含む動作でもフローを適切に⽣成&実⾏ 初期画像 ⽬標画像 Robot flow 物体操作 19
実機実験︓13タスクの平均成功率で既存⼿法を上回る 提案⼿法 20
実機実験︓13タスクの平均成功率で既存⼿法を上回る 提案⼿法 +10 平均 21
まとめ︓⼈間動画から学習可能な物体操作⼿法 n ⾔語指⽰⽂設定への拡張 n 9/4 10:44~ @⼤会議室A (OS21 基盤モデル時代における Physical
AI [5/6]) n “Flow Matching および変化キャプショニングに基づく物体操作の学習” n 背景 n ロボットデータの⼤規模化は困難 n ⼈間動画をロボット基盤モデルの学習に活⽤したい n 提案︓Robot flow を確率フローとしてモデル化 n 結果︓ゼロショット設定においても適切に⽣成 22
Appendix 23
Diffusion Transformer (DiT) に基づくモデル構造 ▪ Flow Generation︓⾃⼰回帰 Flow Matching に基づく⽣成
▪ Action Generation︓Robot flow を条件とする Flow Matching Policy 24
⾃⼰回帰⽣成による⾼速化 通常の拡散モデル ▪ ⽣成ステップ≠フローステップ L ⽣成には多段の逆拡散過程 (~250 ステップ程度) Flow as
Flow ▪ ⽣成ステップ=フローステップ J ⽣成にはわずか8ステップ 25
提案⼿法はモデル構造に依らず適⽤可能 ⼿法 In-domain Zero-shot 推論時間 [ms]↓ Fractal Bridge V2 DROID
Fanuc Manipulation 提案⼿法 21.23 27.11 35.89 22.46 44 Track2Act 64.32 47.29 40.73 27.37 1,430 Im2Flow2Act+FaF 33.21 42.96 38.87 26.51 230 Im2Flow2Act 37.14 51.48 44.14 38.15 5,580 FLIP+FaF 38.77 48.34 38.54 26.79 17 FLIP [Gao+, ICLR25] 66.17 50.73 43.10 28.31 35 26
フロー⽣成タスクにおけるエラー分析 (100サンプル) エラーカテゴリ サンプル数 中間時刻における経路誤り 39 正解データにおける不適切な⾏動 21 対象物体の認識誤り 20
終端位置の誤り 16 正解データにおけるトラッキングエラー 4 27