Upgrade to Pro — share decks privately, control downloads, hide ads and more …

[Journal club] Evo-1: Lightweight Vision-Langua...

[Journal club] Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment

More Decks by Semantic Machine Intelligence Lab., Keio Univ.

Other Decks in Technology

Transcript

  1. Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment Tao Li

    n 1,2,3 Yilei Zhong 1 Yuxi n Du 1,2,3 Ji ngji ng Zhang 1 Ji ting Liu 1 Yinx inyu Ch en 5 Encheng Gu 6 Ziyan Liu 1 Hongyi Cai 1 Yanwen Zou 1,3,4 Lixin g Zou 1 Zhaoye Zhou 1 Gen Li 1,3,7 Bo Zh ao 1,2,3 1 School of AI, Shangh ai Jiao Tong Uni versity 2 EvoMin d Tech 3 IAAR-Sh anghai 4 SII 5 Carnegi e Mellon Univ ersity 6 Univ ersi ty of Cambri dge 7 Nanyang Technological Un iversit y 2026 慶應義塾大学 杉浦孔明研究室 萱原大智 CVPR 2026 L i n , Ta o , e t a l . E v o - 1 : L i gh t w ei gh t V i s i o n - L a ng u ag e - A c t i on M o d el w i t h P re s e rv ed Se m an t i c A l i gn m e nt . In : I E E E / C VF C o nf er en c e o n C o m pu t er V i s i on an d P a t t e rn R ec o gn i t i o n . 20 2 6.
  2. 概要 ▪ 背景 ▪ 既存VLAは数十億パラメータ、大規模ロボットデータ事前学習に依存し、実機への導入が困難 ▪ end-to-end 学習がVLMの意味空間を破壊し、下流タスクへの過学習を招く ▪ 提案:Evo-1

    ▪ 軽量なバックボーンを採用したVLAを構築し、訓練コストを削減 ▪ 二段階学習(VLM凍結→全体fine-tune)でVLMの意味空間を保持 ▪ 結果 ▪ Meta-World, RoboTwin, LIBEROでベースライン手法を上回る ▪ 実機4タスクでベースライン手法を上回り、高い推論速度と性能を両立 2
  3. 背景(1/2): VLAは大規模化、大規模データセットに依存 ▪ Vision-Language-Action (VLA) モデルは大規模化 (e.g., Open VLA :

    7B, 𝜋 0 : 3.5B) ▪ Open X-Embodimentデータセット等のロボットデータセットの大規模化 ▪ 実機への搭載とリアルタイム制御が困難  OpenVLAや𝜋 0 は15GB超のGPUメモリが必要  推論速度が7~11Hzと遅く、リアルタイム制御に不十分 ▪ ロボットデータ事前学習はコスト膨大  大規模なデータの収集に膨大なコストがかかる →VLAを軽量で大規模なロボット事前学習に依存しないモデルにしたい 3
  4. 背景(2/2): end-to-end学習がVLMの意味空間を破壊 ▪ end-to-end学習で意味空間が破壊される ▪ VLM は大規模視覚言語データセットでの学習で、 視覚と言語の対応関係を獲得  ランダムに初期化された

    action expert からの noisy gradient がVLMに逆伝播  事前学習で獲得した表現が崩壊 A tten tion map (a) 一 段 階( 既 存 手 法 )で 学 習 し た 時 右図(a): 視覚-言語の整合が弱く、アテンションが崩壊 右図(b): アテンションが物体領域に集中・空間的に整合 →意味空間を保持する学習戦略が必要 (b ) 二 段 階(提 案 手法 ) で 学 習 した 時 4
  5. 関連研究: 軽量VLAは性能不足、大規模VLAは制約が強い 軽量化と性能のトレードオフを破り、ロボット事前学習にも依存しないVLA設計が課題 手法 パラメータ OpenVLA [Kim+, CoRL24] 7B OpenX-Embodimentで事前学習、離散action

    tokenで行動を予測  15GB超のメモリ要求、実機制御8Hz以下 𝜋0 [Black+, RSS25] 3.5B PaliGemmaにflow-matchingベースのaction expertを統合し連続値による制御を実現  大規模ロボットデータでの事前学習が必須、計算コスト膨大 SmolVLA [Shukor+, ICLR26] 2.25B SmolVLM-2 backbone + flow-matching action expert、token削減を採用  複雑な実機タスクでの性能・ロバスト性が不十分 TinyVLA [Wen+, RAL25] 1.3B 軽量VLM + diffusion-based policy decoderで 軽量なVLAを実現  複雑タスクへの性能が不足 OpenVLA 概要と課題 𝜋0 5
  6. 提案手法(1/4): Evo-1の全体アーキテクチャ ▪ アーキテクチャ: Vision Language Backbone (InternVL3-1B) + cross-modulated

    DiT + integration moduleの軽量設計 (合計0.77Bパラメータ) ▪ 二段階学習: VLMを段階的に解凍して、意味空間を保持しつつ軌道生成へ適応 InternVL3-1B cross-modulated DiT integration module 6
  7. 提案手法(2/4): VLMバックボーン (InternVL3-1B) ▪ 採用モデル: InternVL3-1B [Zhu+, 25] ▪ Visual

    encoder: InternViT-300M ▪ Language branch: Qwen2.5-0.5B ▪ RGB入力: 448×448にリサイズ、ダウンサンプリングで visual token数を1/4に削減 ▪ VLM (Qwen2.5) の最初の14層のみを採用 ▪ 中間層が最も視覚・言語アラインメントが強い ▪ 14層目から特徴量 𝑧 𝑡 を抽出 → integration moduleへ 7
  8. 提案手法(3/4): VLMの特徴量の保持と軌道生成 ▪ multimodal特徴とproprioceptive情報を統合 ▪ VLMの最終層から 𝑧 𝑡 を抽出 ▪

    shared embedding spaceへ𝑧 𝑡 と𝑠 𝑡 を結合 ☺ 射影せず連結することで VLM 特徴とstate情報を 保ったまま条件付けする ▪ 同じ [𝒛 𝒕 ; 𝒔 𝒕 ] を全DiT層に入力 ☺ 層をまたいだ条件付けの一貫性を確保 ▪ Action expert: Diffusion Transformer (DiT) ▪ Flow matching により、noised actionを 徐々にデノイズする速度場を学習 ▪ noised action: ▪ 損失: 𝜏はベータ分布からサンプリング ▪ 推論: H=50ステップのaction chunk  𝒕 を一括予測 ▪ アクションエキスパート 𝑧𝑡 𝑠𝑡 𝑧𝑡 : VLM特徴量 𝑠𝑡 : robot stateの特徴量 : 真値のアクション : 標準ガウス分布からサンプリング されたノイズベクトル 8
  9. 提案手法(4/4): 二段階学習によるVLMの意味空間を保持 ▪ 動機: VLMのmultimodal理解能力の保持とaction生成への適応をバランス  end-to-end 学習は意味空間を破壊 →二段階学習でVLMの持つ意味空間を保持 Stage

    1: Action Expert Stage 2: Full Fine Tuning Frozen Trainable ◼ VLM backboneを凍結 ◼ noisy gradientがバックボーンに逆伝播しないように ◼ 全体をactivate ◼ 下流タスクへ適応させる Trainable 9
  10. 実験設定: 3種のシミュレータ + 実機4タスクで検証 ▪ データセット ▪ ▪ Meta-World: 50タスク

    × 50デモ = 2, 500 LIBERO : 10タスク × 4カテゴリ ▪ ▪ RoboTwin 2.0: 4タスク選択 (dual-arm) 実機: 4タスク (各タスク100テレオペ) ▪ 評価指標 ▪ タスク成功率 ▪ 各タスク10試行 ▪ ベースライン ▪ 大規模VL A: 𝜋 0 (3.5B), OpenVLA (7B), GR00T N1 (2B) ▪ ▪ 軽量VL A: SmolVL A (2.25B), TinyV LA (1.3B) 非VLM: Diffusion Policy, ACT, RDT ▪ 学習環境・時間 ▪ 訓練GPU: NVIDIA A100 × 8 ▪ 推論GPU: RTX 4090d (実機実験) 10
  11. 定量的結果(2/2): 実機における性能評価 ☺ 実機4タスクAvg 78% でベースライン手法を全て上回る ☺ GPUメモリ 2.3GB、推論周波数16.4Hzで、ベースライン手法を全て上回り、効率と性能を両立 ☺

    Pick & Place Can / Hand Delivery で95%、 Pour Foam from Cupで70%、Can Stackingで50% →大規模事前学習なしで複雑なタスクにも対応 Pick and Place Can Pour Foam from Cup Hand Delivery Can Stacking average 12
  12. 追試およびエラー分析 ▪ LIBEROでの実験 ▪ 各suite: 10 tasks × 10 episodesで評価

     Longのような長期タスクで成功率が低下 成功例 成功例 失敗例 Put both the alphabet soup and the tomato sauce in the basket. Open the middle drawer of the cabinet. Put both moka pots on the stove. 14
  13. 所感 ▪ Strength ▪ 0.77B という軽量モデルながらも大規模モデルを実機・シミュレーションで上回った ▪ 実機4タスク 78%、推論16.4Hz・GPU 2.3GBで効率と性能を両立

    ▪ Weakness ▪ RoboTwinのタスクが4つに限定され、 data-augumentationを使用している ▪ 二段階学習によって意味空間が保たれるから効能が上がると記述されているが、 検証されたのは二段階学習を使うと性能が上がるということのみ ▪ コメント ▪ タスクあたり100デモという少量データで実機78%も動くことに驚いた ▪ VLMの持つ事前知識を活かすためにに段階の学習を導入している点が興味深かった 15
  14. まとめ ▪ 背景 ▪ 既存VLAは数十億パラメータ、大規模ロボットデータ事前学習に依存し、実機への導入が困難 ▪ end-to-end 学習がVLMの意味空間を破壊し、下流タスクへの過学習を招く ▪ 提案:Evo-1

    ▪ 軽量なバックボーンを採用したVLAを構築し、訓練コストを削減 ▪ 二段階学習(VLM凍結→全体fine-tune)でVLMの意味空間を保持 ▪ 結果 ▪ Meta-World, RoboTwin, LIBEROでベースライン手法を上回る ▪ 実機4タスクでベースライン手法を上回り、高い推論速度と性能を両立 16
  15. Appendix (1/3): 訓練集合の分布外の環境における性能評価 ▪ 設定 ▪ Pick and Place Canタスクをbase

    ▪ 4種類の分布外の環境を導入 (各20試行) 1. 訓練時に見たことのない物体を配置 2. 背景色を変更 3. ターゲットを後方に移動 4. ターゲットを上方に移動 ☺ 全disturbance settingでSmolVLAを上回る 17
  16. Appendix (2/3): Integration Moduleが有効 提案手法 cross-attn層とself-attn層を交互挿入 各層からの特徴を対応するDiT層に注入 𝐴𝜏𝑡 をkey-valueに追加 ▪

    Module B-Dはself-attention挿入や層別conditioning ▪ LIBERO-Longのみで実施 ☺ 提案手法のModule Aが他のModuleを上回る 18
  17. Appendix (3/3): 二段階学習が有効 ☺ MetaWorld 全難易度で二段階学習が一段階学習を上回る A tten tion map

    (a) (a) 一 段一 階で 学 習既 し存 た手 時の Attention maps 段 階( 法 )で 学習した 時 (b) 二 段 階で た 時の (提 (b ) 学 二習 段し 階(提 案Attention 手法 ) で 学maps 習 した 時案 手法 ) 19