Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
[RSJ26] Flow as Flow: Modeling Robot Velocity F...
Search
Semantic Machine Intelligence Lab., Keio Univ.
PRO
August 28, 2026
Technology
230
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[RSJ26] Flow as Flow: Modeling Robot Velocity Fields as Probability Velocity Fields
Semantic Machine Intelligence Lab., Keio Univ.
PRO
August 28, 2026
More Decks by Semantic Machine Intelligence Lab., Keio Univ.
See All by Semantic Machine Intelligence Lab., Keio Univ.
[RSJ26] Building a VLA Model Based on Self-Distilled Classification
keio_smilab
PRO
0
210
[RSJ26] AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation
keio_smilab
PRO
0
170
[RSJ26] NarrativeFlow: Flow-Based Vision-Language-Action Model Using Robot Velocity Fields
keio_smilab
PRO
0
240
[RSJ26] Hierarchy-Aware Multimodal Retrieval-Augmented Generation for Embodied Question Answering
keio_smilab
PRO
1
200
[MIRU26] Open-Vocabulary Intention-Guided Object Detection in Diverse Scenes
keio_smilab
PRO
0
230
[Journal club] Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
keio_smilab
PRO
0
58
[MIRU26] To What Extent Does MLLM-as-a-Judge Exhibit Cross-Model Preference Bias?
keio_smilab
PRO
0
320
[Journal club] FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
keio_smilab
PRO
0
50
[Journal club] DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
keio_smilab
PRO
1
83
Other Decks in Technology
See All in Technology
Codex概要
ymiya55
0
370
生成AIを使って「人が」考える技術 ― AI時代の人機共想と実践ノウハウ|UNITT AC2026
ishiirikie
0
550
ログラスのマルチプロダクトを 支える認証基盤 〜テナントごとに異なる統制とどう向き合うか〜
dada4386
3
390
[2026 Oracle Technical Deep Dive] Apache Iceberg × Oracle AI Database -Oracle Autonomous AI Lakehouseが実現するAI時代のデータ基盤- (2026年9月17日開催)
oracle4engineer
PRO
0
100
検証フェーズはAIの回答を判断するための学習機会
toru_kubota
2
500
Apache Iceberg が拓く AI 時代のオープンレイクハウス
tomtanaka
0
220
FactoryBotアンチパターン / factory_bot anti-patterns
toshimaru
0
130
生成AIと進める探索的データ分析(2026.10.03 第122回Tokyo.R勉強会)
tatamiya
2
1.4k
形式手法を使って仕様をコーディングしよう
mikanichinose
0
180
freeeらしさをAIとともに作る / Creating the freee Experience with AI
ymrl
0
190
FinTech 1-2 : Overview of FinTech
ks91
PRO
0
150
私の推しは「聞いてから進む」AIです -AI-DLCに一人でアプリを作らせた話
yama3133
1
170
Featured
See All Featured
Bootstrapping a Software Product
garrettdimon
PRO
306
120k
The Cult of Friendly URLs
andyhume
79
7k
Design in an AI World
tapps
1
350
Designing for humans not robots
tammielis
254
26k
The World Runs on Bad Software
bkeepers
PRO
72
12k
Data-driven link building: lessons from a $708K investment (BrightonSEO talk)
szymonslowik
1
1.4k
AI Search: Where Are We & What Can We Do About It?
aleyda
0
8k
[Rails World 2023 - Day 1 Closing Keynote] - The Magic of Rails
eileencodes
38
3k
The agentic SEO stack - context over prompts
schlessera
0
950
How to Ace a Technical Interview
jacobian
280
24k
Git: the NoSQL Database
bkeepers
PRO
433
67k
Speed Design
sergeychernyshev
33
2.1k
Transcript
物理速度場と確率速度場の統合による Flow Matching に基づく物体操作 慶應義塾⼤学 妹尾幸樹 ⼋島⼤地 髙⽊裕輔 ⼾倉健登 杉浦孔明
Motivation: ⼈間動画をロボット基盤モデルの学習に活⽤したい 背景︓テレオペレーションによるデータの⼤規模化は困難 (投資額が⼤きすぎる) ▪ Gemini Robotics︓1年で数千時間 J ⼈間動画: 収集コスト低,ウェブ上にも⼤量に存在
本研究︓Robot flow を潜在表現として⽤いて⼈間動画から学習 ▪ cf. [Kambara+, RA-L26], [Kaichi+, IROS26] EPIC KITCHEN [Damen+, ECCV18] Data Pyramid [Ye+, 26] Robot flow 2
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ② 物体操作︓Robot flow,観測 →
ロボットの関節⾓ ① ② 3
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ① ② ⽬標画像 初期画像
② 物体操作︓Robot flow,観測 → ロボットの関節⾓ 4
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ② 物体操作︓Robot flow,観測 →
ロボットの関節⾓ ② 観測画像 ① 5
関連研究︓既存⼿法は速度場を粗く近似 ⼿法 特徴 Track2Act [Bharadhwaj+, ECCV24] ⽬標画像に基づくフロー⽣成,ウェブ動画から学習 Im2Flow2Act [Xu+, CoRL24]
LILAC [Kambara+, RA-L26] ⾔語指⽰⽂に基づいて物体中⼼のフローを⽣成 L ロボット動作を有限差分でモデル化 → 速度場の粗い近似にとどまる Track2Act [Bharadhwaj+, ECCV24] 6
提案 : Flow Matching に基づくロボットフローのモデル化 Flow Matching [Lipman+, ICLR23]︓⽣成空間における速度場 (確率フロー)
をモデル化 確率フロー Robot flow 7
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 8
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 9
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 𝝃̇ ! 10
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 𝝃̇ ! 𝒙 11
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝒗 𝒙, 𝝃! , t = 𝝃̇ ! − 𝑘 𝒙 − 𝝃! J 分布外のサンプルにも頑健 𝝃! 𝝃̇ ! 𝒙 𝒗 𝒙, 𝝃! , 𝑡 12
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝒗 𝒙, 𝝃! , t = 𝝃̇ ! − 𝑘 𝒙 − 𝝃! J 分布外のサンプルにも頑健 ℒ = 𝔼!,𝒙,𝝃! 𝒗 𝒙, 𝝃! , t − 𝒗% 𝒙, t ▪ 推論 予測 ! 𝒙! = 𝒙' + - 𝒗% 𝒙( , 𝜏 𝑑𝜏 𝝃! 𝝃̇ ! 𝒙 𝒗 𝒙, 𝝃! , 𝑡 & ' 13
実験設定︓⼈間動画からフローを学習 n フロー⽣成︓⼈間動画とロボット動画を⽤いて訓練 (on H200) Something Something V2 49,257 サンプル
EPIC KITCHEN 54,938 サンプル Fractal 87,212 サンプル Bridge V2 60,064 サンプル n 物体操作︓HSRを⽤いて13種類のタスクで評価 (260試⾏/⼿法) … 14
定量的結果︓4つのベンチマークで既存⼿法を上回る In-domain ⼿法 Zero-shot 推論時間 [ms]↓ Fractal Bridge V2 DROID
Fanuc Manipulation 提案⼿法 21.23 27.11 35.89 22.46 44 Track2Act [Bharadhwaj+, ECCV24] 64.32 47.29 40.73 27.37 1,430 Im2Flow2Act [Xu+, CoRL24] 37.14 51.48 44.14 38.15 5,580 FLIP [Gao+, ICLR25] 66.17 50.73 43.10 28.31 35 評価指標︓Average Displacement Error (↓) Fractal [Brohan+, RSS23] Bridge V2 [Walke+, CoRL23] DROID [Khazatsky+, RSS24] Fanuc Manipulation [Zhu+,23] 15
定量的結果︓4つのベンチマークで既存⼿法を上回る In-domain ⼿法 Zero-shot Fractal Bridge V2 DROID 提案⼿法 21.23
27.11 35.89 Track2Act [Bharadhwaj+, ECCV24] 64.32 47.29 Im2Flow2Act [Xu+, CoRL24] 37.14 FLIP [Gao+, ICLR25] 66.17 Fanuc Manipulation 推論時間 [ms]↓ 40.73 22.46 33倍⾼速 27.37 44 1,430 51.48 44.14 38.15 5,580 50.73 43.10 28.31 35 評価指標︓Average Displacement Error (↓) Fractal [Brohan+, RSS23] Bridge V2 [Walke+, CoRL23] DROID [Khazatsky+, RSS24] Fanuc Manipulation [Zhu+,23] 16
定性的結果︓Zero-shot 設定においても適切に⽣成 ⽬標画像 ベースライン⼿法 提案⼿法 Zero-shot In-domain 初期画像 17
定性的結果︓Zero-shot 設定においても適切に⽣成 ⽬標画像 ベースライン⼿法 提案⼿法 L エンドエフェクタのフローを⽣成出来ず Zero-shot In-domain 初期画像
18
ベースの移動を含む動作でもフローを適切に⽣成&実⾏ 初期画像 ⽬標画像 Robot flow 物体操作 19
実機実験︓13タスクの平均成功率で既存⼿法を上回る 提案⼿法 20
実機実験︓13タスクの平均成功率で既存⼿法を上回る 提案⼿法 +10 平均 21
まとめ︓⼈間動画から学習可能な物体操作⼿法 n ⾔語指⽰⽂設定への拡張 n 9/4 10:44~ @⼤会議室A (OS21 基盤モデル時代における Physical
AI [5/6]) n “Flow Matching および変化キャプショニングに基づく物体操作の学習” n 背景 n ロボットデータの⼤規模化は困難 n ⼈間動画をロボット基盤モデルの学習に活⽤したい n 提案︓Robot flow を確率フローとしてモデル化 n 結果︓ゼロショット設定においても適切に⽣成 22
Appendix 23
Diffusion Transformer (DiT) に基づくモデル構造 ▪ Flow Generation︓⾃⼰回帰 Flow Matching に基づく⽣成
▪ Action Generation︓Robot flow を条件とする Flow Matching Policy 24
⾃⼰回帰⽣成による⾼速化 通常の拡散モデル ▪ ⽣成ステップ≠フローステップ L ⽣成には多段の逆拡散過程 (~250 ステップ程度) Flow as
Flow ▪ ⽣成ステップ=フローステップ J ⽣成にはわずか8ステップ 25
提案⼿法はモデル構造に依らず適⽤可能 ⼿法 In-domain Zero-shot 推論時間 [ms]↓ Fractal Bridge V2 DROID
Fanuc Manipulation 提案⼿法 21.23 27.11 35.89 22.46 44 Track2Act 64.32 47.29 40.73 27.37 1,430 Im2Flow2Act+FaF 33.21 42.96 38.87 26.51 230 Im2Flow2Act 37.14 51.48 44.14 38.15 5,580 FLIP+FaF 38.77 48.34 38.54 26.79 17 FLIP [Gao+, ICLR25] 66.17 50.73 43.10 28.31 35 26
フロー⽣成タスクにおけるエラー分析 (100サンプル) エラーカテゴリ サンプル数 中間時刻における経路誤り 39 正解データにおける不適切な⾏動 21 対象物体の認識誤り 20
終端位置の誤り 16 正解データにおけるトラッキングエラー 4 27