Upgrade to Pro — share decks privately, control downloads, hide ads and more …

[RSJ26] AnoleVLA: Lightweight Vision-Language-A...

[RSJ26] AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation

More Decks by Semantic Machine Intelligence Lab., Keio Univ.

Other Decks in Technology

Transcript

  1. Motivation: VLAのメモリ消費量・推論時間を削減したい 背景: VLAを実機で動作させる際、推論時の計算コストが問題  メモリ消費量が大きく高性能な計算機が必要 軌道生成の研究 [Kambara+, RA-L26], [Kaichi+,

    IROS26],...  推論時間が長くアームの動作がjerkyに 本研究: 軽量かつ高速なVLAを提案 “Pick up the cube and put it into the basket.” 推論時間 [ms] OpenVLA  jerkyな動作 GPUメモリ消費 17GB以上 𝜋0 𝜋0.5 提案手法 𝜋0.5 推論時の動作 [Jiaming+, 26] GPUメモリ消費量 [GB] 2
  2. 関連研究: VLAの計算コストを抑制する研究 手法 特徴 SmolVLA 0.45Bの軽量VLA ・action chunkingを活用  Transformerに基づくバックボーン・長系列の処理が困難

    深層状態空間モデルに基づくバックボーン  画像上の接触点 / 姿勢予測のみ・軌道を生成しない [Shukor+, 25] RoboMamba [Liu+, NeurIPS24] SmolVLA RoboMamba 3
  3. 高速かつメモリ消費量の少ないバックボーンLLM ▪ Mamba [Gu+, COLM24] による系列処理 隠れ状態 入力 約6Mの学習可能パラメータ 出力

    ブロックの多層化 ☺ 𝒪(𝑁)での系列処理 cf.  Transformerの計算量は𝒪(𝑁 2 ) ☺ 370Mパラメータの軽量モデル cf.  RoboMamba: 2.8B 8
  4. 実験設定: シミュレーション・実機ロボットにおける実験 ▪ シミュレーション実験: Meta-World [Yu+, CoRL19] ▪ 実機実験: モバイルマニピュレーションタスク(HSRを使用)

    ▪ リーダ・フォロワシステムを用い、データを収集 タスク数 エピソード数 試行回数/タスク シミュレーション 50 2,500 10 実機 5 250 10 Meta-Worldのタスク例 実機実験のデータ収集 9
  5. 定性的結果: シミュレーションで様々なタスクに成功 "Grasp a stick and pull a box with

    the stick." "Sweep a puck off the table." 提案手法 ベースライン手法 提案手法 ベースライン手法 ☺ 目標位置に物体を移動  不適切な位置で停止 ☺ 物体を把持し移動  物体を把持できず失敗 12
  6. 実機実験: モバイルマニピュレーションタスクは困難  ベースの回転・移動に伴う視点変化があり困難 ”Insert the lemon into the cup.

    ” 提案手法  事前学習データセットに モバイルタスクが少ない 2.4% 𝜋0.5 x2 その他 97.6% 𝜋0.5 の事前学習データセット 13