Upgrade to Pro — share decks privately, control downloads, hide ads and more …

[RSJ26] NarrativeFlow: Flow-Based Vision-Langua...

[RSJ26] NarrativeFlow: Flow-Based Vision-Language-Action Model Using Robot Velocity Fields

More Decks by Semantic Machine Intelligence Lab., Keio Univ.

Other Decks in Technology

Transcript

  1. Motivation: VLAの事後学習を少量のデータで行いたい 背景:既存VLAはロボットごとに大規模な事後学習が必要 ▪ π 0.5 [Black+, CoRL25] : 約400時間

    本研究:ロボットの形態に依らない動作表現 Robot flowを活用 ☺ 少量のデータを用いた事後学習 ▪ cf. [Kambara+, RAL26], [Kaichi+, IROS26],[妹尾+, RSJ26] Robot flow OXE [O'Neill+, ICRA24] π0.5 [Black+, CoRL25] 2
  2. 問題設定: 言語指示に基づくフローを媒介とした物体操作 ① フロー生成:言語指示,初期画像 → Robot flow :Robot flow,観測 →

    ロボットの関節角 Put the mustard in the bin. ① ② 現在観測 初期画像 言語指示 ② 物体操作 3
  3. 問題設定: 言語指示に基づくフローを媒介とした物体操作 ① フロー生成:言語指示,初期画像 → Robot flow :Robot flow,観測 →

    ロボットの関節角 Put the mustard in the bin. ① ② 現在観測 初期画像 言語指示 ② 物体操作 4
  4. 問題設定: 言語指示に基づくフローを媒介とした物体操作 ① フロー生成:言語指示,初期画像 → Robot flow :Robot flow,観測 →

    ロボットの関節角 Put the mustard in the bin. ① ② 現在観測 初期画像 言語指示 ② 物体操作 5
  5. 関連研究: 既存手法はロボットの動作を粗く近似 手法 特徴 FLIP [Gao+, ICLR24] Im2Flow2Act [Xu+, CoRL24]

    LILAC [Kambara+, RAL26] ☺ 少量のロボットデータで事後学習  フローを有限差分でモデル化  連続的な動作の粗い近似 LILAC Im2Flow2Act 6
  6. 言語指示を条件としたFlow Matchingに基づくフロー生成 Flow as Flow [妹尾+, RSJ26] 初期画像 ☺ 連続的な速度場でモデル化

    ℒ𝐹aF = 𝔼𝑡,𝒙 𝒗 − 𝒗𝜃 𝒙, t 言語指示 Put the banana on the cloth. 2 Transformer Encoder 予測  言語指示を扱えない  ℒ 𝐹aF のみで無関係な視覚情報を十分に分離できない Flow-as-Flow Module Robot flow e.g., 照明条件 7
  7. 提案: 変化キャプショニングに基づく補助損失項の導入 初期画像 Narrative Delta 損失 ▪ 初期画像と目標画像の間の変化キャプションをMLLMで生成 ☺ 中間表現

    を無関係な視覚情報に整合させない 言語指示 Put the banana on the cloth. the table to rest on the blue cloth. 2 The robot moves the banana from near the wall and places it between the fork and the pot. … 𝑁𝑐 the banana … Flow-as-Flow Module Robot flow MLLM 1 A banana is moved from the right side of … 目標画像 初期画像 Transformer Encoder 8
  8. 実験設定: 形態の異なるロボットデータで訓練 ◼ Robot flow 生成 87,212 サンプル 60,064 サンプル

    Fractal [Brohan+, RSS23] Bridge V2 [Walke+, CoRL23] ◼ 物体操作 (HSR) ◼ 訓練:30エピソード × 13タスク ◼ 評価:20エピソード × 13タスク × 3手法 … 9
  9. 定量的結果: 両ベンチマークでベースラインを上回った 手法 Fractal Bridge V2 ADE ↓ FDE ↓

    ADE ↓ FDE ↓ 提案手法 21.68 31.59 30.59 42.42 FLIP [Gao+, ICLR24] 66.17 87.52 50.73 68.43 Im2Flow2Act [Xu+, CoRL24] 37.14 47.74 51.48 70.93 ADE: Average Displacement Error FDE: Final Displacement Error 10
  10. 定量的結果: 両ベンチマークでベースラインを上回った 手法 提案手法 Fractal Bridge V2 ADE ↓ FDE

    ↓ ADE ↓ FDE ↓ 21.68 31.59 30.59 42.42 FLIP [Gao+, ICLR24] 66.17 -15.46 87.52 50.73 -20.14 68.43 Im2Flow2Act [Xu+, CoRL24] 37.14 47.74 51.48 70.93 ADE: Average Displacement Error FDE: Final Displacement Error 11
  11. 定性的結果: 言語指示に対応する適切なフローを生成 言語指示 初期画像 Im2Flow2Act 提案手法 Pick pepsi can from

    top shelf of fridge. 正しい ☺ 対象物体 Put the silver lid on the silver pot. 適切な ☺ 中間軌道 12
  12. 実機実験:30エピソード/タスクの事後学習で平均成功率58% Mobile chair pushing Mobile drawer closing Mobile bin picking

    Mobile water pouring 提案手法 90 85 60 35 20 58 FLIP [Gao+, ICLR24] 35 50 25 5 10 28 Im2Flow2Act [Xu+, CoRL24] 70 成功率[%] 65 45 20 Mobile Avg. cup (13タスク) stacking 15 45 14 +13
  13. まとめ 背景 ▪ 言語指示に基づくフローを媒介にした物体操作 ☺ 少量のロボットデータで事後学習  連続的な動作を有限差分で粗く近似 Pick pepsi

    can from top shelf of fridge. 新規性 ▪ 言語指示を条件としたFlow Matchingに基づくフロー生成 ▪ 変化キャプショニングに基づく補助損失項 結果 x1 Take the towel from rack. ▪ フロー生成タスクおよび実機実験で ベースライン手法を上回った ▪ 30エピソード/タスクの事後学習で平均成功率58% 15
  14. 追加実験: キャプション数が多いほど良好な結果 補助損失項で使用する変化キャプション数𝑁𝑐 を変化させて評価 Fractal Bridge V2 𝑵𝒄 ADE ↓

    FDE ↓ ADE ↓ FDE ↓ 5 21.68 31.59 30.59 42.42 3 21.71 31.68 30.63 42.80 1 21.70 31.68 31.24 43.64 0 (補助損失項なし) 25.83 35.72 33.79 47.81 18
  15. 提案: 特殊トークンを経路ごとに分離 初期画像 損失関数: 単一の特殊トークン(e.g., [CLS]トークン)  複数の学習信号が集中し,互いに干渉 言語指示 Put

    the banana on the cloth. The robot moves the banana from near the wall and places it between the fork and the pot. Flow-as-Flow Module Robot flow MLLM A banana is moved from the right side of the table to rest on the blue cloth. … 目標画像 初期画像 サブタスクトークン:経路ごとの特殊トークン ☺ 干渉を緩和し,各目的に応じた特徴表現を学習 20
  16. 提案: 特殊トークンを経路ごとに分離 初期画像 損失関数: 単一の特殊トークン(e.g., [CLS]トークン)  複数の学習信号が集中し,互いに干渉 言語指示 Put

    the banana on the cloth. The robot moves the banana from near the wall and places it between the fork and the pot. Flow-as-Flow Module Robot flow MLLM A banana is moved from the right side of the table to rest on the blue cloth. … 目標画像 初期画像 サブタスクトークン:経路ごとの特殊トークン ☺ 干渉を緩和し,各目的に応じた特徴表現を学習 21
  17. Ablation Study: サブタスクトークン サブタスクトークン Fractal Bridge V2 ADE ↓ FDE

    ↓ ADE ↓ FDE ↓ 2 21.68 31.59 30.59 42.42 1 24.72 33.96 33.20 45.30 0 23.20 32.91 33.41 47.40 提案手法 22
  18. Flow matching に基づく Robot flow のモデル化 ▪ Flow as Flow

    [妹尾+, RSJ26] :Robot flow を確率フローとしてモデル化 ☺ 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝒗 𝒙, 𝝃𝑡 , t = 𝝃ሶ 𝑡 − 𝑘 𝒙 − 𝝃𝑡 ☺ 分布外のサンプルにも頑健 ℒ = 𝔼𝑡,𝒙,𝝃𝑡 𝒗 𝒙, 𝝃𝑡 , t − 𝒗𝜃 𝒙, t ▪ 推論 𝝃𝑡 𝝃ሶ 𝑡 𝒙 𝒗 𝒙, 𝝃𝑡 , 𝑡 2 予測 𝑡 𝒙𝑡 = 𝒙0 + න 𝒗𝜃 𝒙𝜏 , 𝜏 𝑑𝜏 0 23
  19. 評価指標: ADE, FDE ▪ Average Displacement Error • ▪ Final

    Displacement Error : N個の特徴点の時刻tにおける画像内座標 𝑢𝑡𝑛 , 𝑣𝑡𝑛 の予測値と正解値 • 初期画像におけるエンドエフェクタ領域内の点を特徴点に設定. 24
  20. エラー分析 フロー生成タスクにおける失敗例100サンプルを分析 ◼ マルチモーダル言語理解誤り 言語指示と初期画像からタスクを誤って理解 し,言語指示に対応しないフローを生成 言語指示 Place the spatula

    just behind the eggplant. 初期画像 提案手法 カテゴリ マルチモーダル言語理解誤り 30 中間軌道誤り 22 終端位置誤り 14 曖昧性を含む言語指示 9 対象物体の遮蔽 8 アノテーションエラー 17 合計 100 25