Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
[RSJ26] Flow as Flow: Modeling Robot Velocity F...
Search
Semantic Machine Intelligence Lab., Keio Univ.
PRO
August 28, 2026
Technology
15
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[RSJ26] Flow as Flow: Modeling Robot Velocity Fields as Probability Velocity Fields
Semantic Machine Intelligence Lab., Keio Univ.
PRO
August 28, 2026
More Decks by Semantic Machine Intelligence Lab., Keio Univ.
See All by Semantic Machine Intelligence Lab., Keio Univ.
[RSJ26] Hierarchy-Aware Multimodal Retrieval-Augmented Generation for Embodied Question Answering
keio_smilab
PRO
0
18
[MIRU26] Open-Vocabulary Intention-Guided Object Detection in Diverse Scenes
keio_smilab
PRO
0
180
[Journal club] Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
keio_smilab
PRO
0
40
[MIRU26] To What Extent Does MLLM-as-a-Judge Exhibit Cross-Model Preference Bias?
keio_smilab
PRO
0
260
[Journal club] FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
keio_smilab
PRO
0
30
[Journal club] DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
keio_smilab
PRO
1
64
[Journal club] SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
keio_smilab
PRO
0
45
[Journal club] Predict Before You Explore: Predictive Planning with Specialized Memory for Embodied Question Answering
keio_smilab
PRO
0
100
[Journal club] PHyCLIP: 𝒍𝟏-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning
keio_smilab
PRO
0
97
Other Decks in Technology
See All in Technology
:syncing_time:
sksat
2
780
どんな手を使っても絶対間に合わせるスケジューラ
asari194617
0
1.4k
VPCでもFloatingIPを使いたいんだ
y_kotani
1
100
型落ちシンクライアント端末のPoEモジュールを自作したかった話
logica0419
0
460
LLMアプリ、 雰囲気で運用してませんか? 〜LLMOpsの現在地〜
taka_aki
1
130
internal/testlog で遊ぼう
rokuosan
0
250
ハッカソンで入賞した話 @ Findy LT
asari194617
0
1.5k
『自分で判断できるか』を基準に、プロダクトのハンズオン研修でAI利用の線を引いてみた / Where We Drew the Line on AI in Hands-on Training
honyanya
0
260
Claude Teamプランの コスト最適化を考える
rfdnxbro
0
750
Oracle MCP Servers Explained
thatjeffsmith
1
530
RapidCopy2 Matrix I/Oエンジンによるファイルコピーソフトウェアの設計と実装
kengosawa2
1
430
AI駆動開発を組織で促すために
lycorptech_jp
PRO
6
7.2k
Featured
See All Featured
Building AI with AI
inesmontani
PRO
1
1.2k
Utilizing Notion as your number one productivity tool
mfonobong
4
560
How to optimise 3,500 product descriptions for ecommerce in one day using ChatGPT
katarinadahlin
PRO
2
3.8k
How GitHub (no longer) Works
holman
316
150k
Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint/Restore in Edge–Cloud Continuum
chikuwait
0
740
WCS-LA-2024
lcolladotor
0
810
The browser strikes back
jonoalderson
0
1.6k
Creating an realtime collaboration tool: Agile Flush - .NET Oxford
marcduiker
35
2.6k
Building an army of robots
kneath
306
46k
職位にかかわらず全員がリーダーシップを発揮するチーム作り / Building a team where everyone can demonstrate leadership regardless of position
madoxten
64
56k
[SF Ruby Conf 2025] Rails X
palkan
2
1.3k
Prompt Engineering for Job Search
mfonobong
0
420
Transcript
物理速度場と確率速度場の統合による Flow Matching に基づく物体操作 慶應義塾⼤学 妹尾幸樹 ⼋島⼤地 髙⽊裕輔 ⼾倉健登 杉浦孔明
Motivation: ⼈間動画をロボット基盤モデルの学習に活⽤したい 背景︓テレオペレーションによるデータの⼤規模化は困難 (投資額が⼤きすぎる) ▪ Gemini Robotics︓1年で数千時間 J ⼈間動画: 収集コスト低,ウェブ上にも⼤量に存在
本研究︓Robot flow を潜在表現として⽤いて⼈間動画から学習 ▪ cf. [Kambara+, RA-L26], [Kaichi+, IROS26] EPIC KITCHEN [Damen+, ECCV18] Data Pyramid [Ye+, 26] Robot flow 2
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ② 物体操作︓Robot flow,観測 →
ロボットの関節⾓ ① ② 3
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ① ② ⽬標画像 初期画像
② 物体操作︓Robot flow,観測 → ロボットの関節⾓ 4
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ② 物体操作︓Robot flow,観測 →
ロボットの関節⾓ ② 観測画像 ① 5
関連研究︓既存⼿法は速度場を粗く近似 ⼿法 特徴 Track2Act [Bharadhwaj+, ECCV24] ⽬標画像に基づくフロー⽣成,ウェブ動画から学習 Im2Flow2Act [Xu+, CoRL24]
LILAC [Kambara+, RA-L26] ⾔語指⽰⽂に基づいて物体中⼼のフローを⽣成 L ロボット動作を有限差分でモデル化 → 速度場の粗い近似にとどまる Track2Act [Bharadhwaj+, ECCV24] 6
提案 : Flow Matching に基づくロボットフローのモデル化 Flow Matching [Lipman+, ICLR23]︓⽣成空間における速度場 (確率フロー)
をモデル化 確率フロー Robot flow 7
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 8
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 9
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 𝝃̇ ! 10
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 𝝃̇ ! 𝒙 11
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝒗 𝒙, 𝝃! , t = 𝝃̇ ! − 𝑘 𝒙 − 𝝃! J 分布外のサンプルにも頑健 𝝃! 𝝃̇ ! 𝒙 𝒗 𝒙, 𝝃! , 𝑡 12
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝒗 𝒙, 𝝃! , t = 𝝃̇ ! − 𝑘 𝒙 − 𝝃! J 分布外のサンプルにも頑健 ℒ = 𝔼!,𝒙,𝝃! 𝒗 𝒙, 𝝃! , t − 𝒗% 𝒙, t ▪ 推論 予測 ! 𝒙! = 𝒙' + - 𝒗% 𝒙( , 𝜏 𝑑𝜏 𝝃! 𝝃̇ ! 𝒙 𝒗 𝒙, 𝝃! , 𝑡 & ' 13
実験設定︓⼈間動画からフローを学習 n フロー⽣成︓⼈間動画とロボット動画を⽤いて訓練 (on H200) Something Something V2 49,257 サンプル
EPIC KITCHEN 54,938 サンプル Fractal 87,212 サンプル Bridge V2 60,064 サンプル n 物体操作︓HSRを⽤いて13種類のタスクで評価 (260試⾏/⼿法) … 14
定量的結果︓4つのベンチマークで既存⼿法を上回る In-domain ⼿法 Zero-shot 推論時間 [ms]↓ Fractal Bridge V2 DROID
Fanuc Manipulation 提案⼿法 21.23 27.11 35.89 22.46 44 Track2Act [Bharadhwaj+, ECCV24] 64.32 47.29 40.73 27.37 1,430 Im2Flow2Act [Xu+, CoRL24] 37.14 51.48 44.14 38.15 5,580 FLIP [Gao+, ICLR25] 66.17 50.73 43.10 28.31 35 評価指標︓Average Displacement Error (↓) Fractal [Brohan+, RSS23] Bridge V2 [Walke+, CoRL23] DROID [Khazatsky+, RSS24] Fanuc Manipulation [Zhu+,23] 15
定量的結果︓4つのベンチマークで既存⼿法を上回る In-domain ⼿法 Zero-shot Fractal Bridge V2 DROID 提案⼿法 21.23
27.11 35.89 Track2Act [Bharadhwaj+, ECCV24] 64.32 47.29 Im2Flow2Act [Xu+, CoRL24] 37.14 FLIP [Gao+, ICLR25] 66.17 Fanuc Manipulation 推論時間 [ms]↓ 40.73 22.46 33倍⾼速 27.37 44 1,430 51.48 44.14 38.15 5,580 50.73 43.10 28.31 35 評価指標︓Average Displacement Error (↓) Fractal [Brohan+, RSS23] Bridge V2 [Walke+, CoRL23] DROID [Khazatsky+, RSS24] Fanuc Manipulation [Zhu+,23] 16
定性的結果︓Zero-shot 設定においても適切に⽣成 ⽬標画像 ベースライン⼿法 提案⼿法 Zero-shot In-domain 初期画像 17
定性的結果︓Zero-shot 設定においても適切に⽣成 ⽬標画像 ベースライン⼿法 提案⼿法 L エンドエフェクタのフローを⽣成出来ず Zero-shot In-domain 初期画像
18
ベースの移動を含む動作でもフローを適切に⽣成&実⾏ 初期画像 ⽬標画像 Robot flow 物体操作 19
実機実験︓13タスクの平均成功率で既存⼿法を上回る 提案⼿法 20
実機実験︓13タスクの平均成功率で既存⼿法を上回る 提案⼿法 +10 平均 21
まとめ︓⼈間動画から学習可能な物体操作⼿法 n ⾔語指⽰⽂設定への拡張 n 9/4 10:44~ @⼤会議室A (OS21 基盤モデル時代における Physical
AI [5/6]) n “Flow Matching および変化キャプショニングに基づく物体操作の学習” n 背景 n ロボットデータの⼤規模化は困難 n ⼈間動画をロボット基盤モデルの学習に活⽤したい n 提案︓Robot flow を確率フローとしてモデル化 n 結果︓ゼロショット設定においても適切に⽣成 22
Appendix 23
Diffusion Transformer (DiT) に基づくモデル構造 ▪ Flow Generation︓⾃⼰回帰 Flow Matching に基づく⽣成
▪ Action Generation︓Robot flow を条件とする Flow Matching Policy 24
⾃⼰回帰⽣成による⾼速化 通常の拡散モデル ▪ ⽣成ステップ≠フローステップ L ⽣成には多段の逆拡散過程 (~250 ステップ程度) Flow as
Flow ▪ ⽣成ステップ=フローステップ J ⽣成にはわずか8ステップ 25
提案⼿法はモデル構造に依らず適⽤可能 ⼿法 In-domain Zero-shot 推論時間 [ms]↓ Fractal Bridge V2 DROID
Fanuc Manipulation 提案⼿法 21.23 27.11 35.89 22.46 44 Track2Act 64.32 47.29 40.73 27.37 1,430 Im2Flow2Act+FaF 33.21 42.96 38.87 26.51 230 Im2Flow2Act 37.14 51.48 44.14 38.15 5,580 FLIP+FaF 38.77 48.34 38.54 26.79 17 FLIP [Gao+, ICLR25] 66.17 50.73 43.10 28.31 35 26
フロー⽣成タスクにおけるエラー分析 (100サンプル) エラーカテゴリ サンプル数 中間時刻における経路誤り 39 正解データにおける不適切な⾏動 21 対象物体の認識誤り 20
終端位置の誤り 16 正解データにおけるトラッキングエラー 4 27