Upgrade to Pro — share decks privately, control downloads, hide ads and more …

第67回コンピュータビジョン勉強会論文紹介「RoboWheel: A Data Engine ...

第67回コンピュータビジョン勉強会論文紹介「RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning」

Avatar for Tatsuya Suzuki

Tatsuya Suzuki

July 18, 2026

More Decks by Tatsuya Suzuki

Other Decks in Science

Transcript

  1. © DeNA Co., Ltd. 1 論文紹介「RoboWheel: A Data Engine from

    Real-World Human Demonstrations for Cross-Embodiment Robotic Learning」 2026/7/18 第67回 コンピュータビジョン勉強会@関東(前編) CVPR2026読み会 株式会社ディー・エヌ・エー 鈴木達哉
  2. © DeNA Co., Ltd. 2 自己紹介 鈴木達哉 / Suzuki Tatsuya

    DeNA AI技術開発部ビジョン・スポーツグループ • 2020.4 ~ DeNA AIエンジニア ◦ ドライブレコーダー映像の画像認識 ◦ 各種コンピュータビジョン案件 • 2025.1 「Data-centric AI入門」(共著、技術評論社) • 2025.4 ~ ワンダリア横浜リードAIエンジニア
  3. © DeNA Co., Ltd. 3 • 手と物体の相互作用(HOI)動画を、ロボットアーム学習用データに変換する手法 • 入力は単眼RGB動画なので過去の動画も利用可能 •

    大量に用意すればテレオペ(=人間によるロボット操作)同等の学習効果 • 約15万エピソードのデータセットHORAを構築・公開 どんな論文? 論文Figure 1 HOI: hand–object interaction [paper] [arXiv] [プロジェクトページ] 💭読んだ理由:  CVPRにもPhysical AIの波来てそうだけどどんな感じ?データをスケールさせる手法気になる  CV手法たくさん使われてて楽しそう
  4. © DeNA Co., Ltd. 4 相互作用動画からの変換例 プロジェクトページより 入力:単眼RGB動画 出力:ロボット学習に必要な各種情報 ・軌道データ

    ・カメラ映像(手首+三人称)のシミュレーション ・成功ラベル ・言語ラベル 図のような「グリッパー」を主に扱う
  5. © DeNA Co., Ltd. 5 • 画像・言語はインターネットのデータで学習できたがロボットにはない • テレオペレーション・モーションキャプチャ・シミュレータ合成良し悪しあり 課題:ロボット学習データは作成コストが高い

    テレオペレーション 人間がロボット実機を直接/遠隔操作 ◯利点 • 記録がロボット軌道そのもの • 変換不要で高品質 ✕ 弱点 • 実機+操作が必要 • 1エピソードごとに人手必要 共通課題:どの手法も人手ボトルネックあり → 既存動画から抽出したい モーションキャプチャ センサ装着した人間の動きを高精度記録 ◯利点 • ロボット実機は不要 • 高精度な人間動作データが取れる ✕ 弱点 • 機材が高価で運用が大変 • 1エピソードごとに人手必要 • 変換必要 シミュレータ合成 物理エンジン+スクリプトで自動生成 ◯利点 • スケール可能・コスト低 • 物理法則に沿った軌道 ✕ 弱点 • シーン/物体/動作の設計に人手 • sim-to-realギャップ(視覚・接触) 論文の記載内容+一般論を記載
  6. © DeNA Co., Ltd. 7 提案手法 多段階のパイプラインで動画から学習データを作成 出力: ロボット学習に必要な各種情報 ・アームの姿勢,

    軌道データ ・シミュレータ映像(手首,三人称) ・成功 / 失敗判定情報 ・言語ラベル 1. 再構成 2. 物理最適化 3. リターゲティング 4. データ拡張 入力: RGB動画 ◯利点 • 人間由来の自然な動きが得られる • 単眼カメラ1台で足りて特殊機材や操作は不要 • ネット上などの多様な過去動画も使える • シミュレータ上でデータ拡張も可能 ✕ 弱点 • 視覚のsim-to-realギャップはある • 復元による情報欠落はある • 物体が剛体のみの制約あり
  7. © DeNA Co., Ltd. 8 提案手法 論文Figure 2 1 再構成

    2 物理最適化 3 リターゲティング 4 データ拡張
  8. © DeNA Co., Ltd. 9 提案手法:(1) 再構成 手の再構成 HaMeR [28]

    カメラ座標系での 手の姿勢 手のパラメトリック モデルMANO RGB動画 補足 • 全身の動画の場合はMotion-X++ [49]を使いSMPL-Hを推定、手の部分のみを利用 • 入力がRGB-D動画の場合は深度推定をスキップ 深度推定 UniDepth [29] RGB-D動画 物体3Dメッシュ生成 Hunyuan3D [52] [28] G. Pavlakos et al. Reconstructing hands in 3d with transformers. In CVPR, 2024. [paper] [project page] [29] L. Piccinelli et al. Unidepthv2: Universal monocular metric depth estimation made simpler. arXiv:2502.20110, 2025. [arXiv] [34] Z. Teed and J. Deng. Droid-slam: Deep visual slam for monocular, stereo, and rgb-d cameras. In NeurIPS, 2021. [paper] [39] B. Wen et al. Foundationpose: Unified 6d pose estimation and tracking of novel objects. In CVPR, 2024. [paper] [project page] [49] Y. Zhang et al. Motion-x++: A large-scale multi-modal 3d whole-body human motion dataset. arXiv:2501.05098, 2025. [arXiv] [project page] [52] Z. Zhao et al. Hunyuan3d 2.0: Scaling diffusion models for high resolution textured 3d assets generation. arXiv:2501.12202, 2025. [arXiv] 物体 3Dメッシュ bbox比で スケール 回復 6D姿勢推定 FoundationPose [39] マスク検出 (具体手法言及なし) 手の領域 物体 の領域 カメラ座標系での 物体の姿勢 DROID-SLAM [34] カメラ姿勢 世界座標系での 手・物体の姿勢 💭かなり多数の手法の  組み合わせで実現
  9. © DeNA Co., Ltd. 10 HaMeR:画像から手を再構成する手法 [28] G. Pavlakos et

    al. Reconstructing hands in 3d with transformers. In CVPR, 2024. [Paper] [Project Page]
  10. © DeNA Co., Ltd. 11 提案手法:(2) 物理最適化 貫通を防ぐ 手と物体が貫通していない状態に修正 手・物体

    の姿勢 手と物体の貫通を防ぐために TSDF (Truncated Signed Distance Function)で 手と物体の距離を計算し 手の並行移動&回転を最適化 修正された手 ・物体の姿勢 論文Figure 2 一部
  11. © DeNA Co., Ltd. 12 提案手法:(2) 物理最適化 強化学習で妥当に掴む シミュレータ(Isaac Sim)上での強化学習により物理的に妥当な動き・掴み方に修正

    強化学習手法ManipTrans [22] シミュレータ上で数式2の報酬を最大化 姿勢・速度をあわせつつ、掴めているかを評価 修正された手 ・物体の姿勢 さらに 修正された手 ・物体の姿勢 [22] K. Li et al. Maniptrans: Efficient dexterous bimanual manipulation transfer via residual learning. In CVPR, 2025. [paper] [project page] 姿勢誤差項 (誤差0で最大) 速度誤差項 (誤差0で最大) 接触力項 (掴めているほど大) 前段で求めた姿勢 / 速度と シミュレーション上の姿勢 / 速度を比較 💭本手法の主な  工夫ポイントと思われる
  12. © DeNA Co., Ltd. 13 提案手法:(3) リターゲティング 手からロボットアームへ 手の姿勢情報をロボットアームのグリッパー姿勢情報に変換する Step1:

    姿勢情報からkNN分類器で把持タイプを判定([21]の手法ベース) Step2: • Whole-hand(手全体使用)の場合:手のひらの向きを使い変換 • Finger-only(指先だけ使用)の場合:指先の位置を使い変換 論文Figure 3 一部 [21] H. Kjellstrom et al. Visual recognition of grasps for human-to-robot mapping. In IROS, 2008. [paper] グリッパー以外の 多指ハンドなどは検証段階
  13. © DeNA Co., Ltd. 14 提案手法:(3) リターゲティング グリッパー開閉判定 手の掴む /

    掴んでいない状態を判定しロボットアームのグリッパーの開閉情報に反映 • CoTracker3 [17]を使いRGB動画からキーポイントを取得、物体の静止 or 移動を判定 • 物体が静止→Open / 物体が移動→Hold [17] N. Karaev et al. Cotracker3: Simpler and better point tracking by pseudo-labelling real videos. arXiv:2410.11831, 2024. [arXiv] [project page] 論文Figure 3 一部 CoTracker3の例 project pageより 💭静止・移動では判定できない場面も  ありそうだが、本論文ではこの手法
  14. © DeNA Co., Ltd. 15 提案手法:(3) リターゲティング 成功ラベル・言語ラベル シミュレーション(Isaac Sim)上で実行しVLMによりラベルを付与

    • Qwen2.5-VL [1]でタスクの成功/失敗を二値判定し、成功ラベルを付与 ◦ 成功したエピソードのみをデータセットに追加 • GPT系 [16]で言語ラベルを作成・付与 [1] S. Bai et al. Qwen2.5-vl technical report. arXiv:2502.13923, 2025. [arXiv] [16] A. Hurst et al. GPT-4o system card. arXiv:2410.21276, 2024. [arXiv]
  15. © DeNA Co., Ltd. 16 提案手法:(4) データ拡張 シミュレーション上でデータ拡張し、視覚と軌道の多様性を広げる • アームの種類:5種類(UR5/UR5e,

    Franka, KUKA iiwa, Kinova, Sawyer) • 物体の差し替え:形状/サイズ/意味の3類似度で代替物体をtop-K検索し置き換える • 軌道:グリッパーのOpen / Hold状態それぞれで変換 • 背景:背景テクスチャの変化、周囲に無関係な物体の配置など 論文Figure 4
  16. © DeNA Co., Ltd. 17 • 本手法は物体が剛体であることを前提とした手法である • 局所的な修正では非剛体(布、ケーブル、生体組織など)への対応は無理 •

    手も非剛体だが低次元で表現したパラメトリックモデル(手の場合MANO)があり、 HaMeRのようなRGBからのフィッティング手法があるため使えている 【論文外の話】本手法は非剛体には使えない
  17. © DeNA Co., Ltd. 18 • 約15万軌道 • Hugging Faceで公開

    データセット:HORA (Hand-Object to Robot Action dataset) 論文Figure 5 論文Table 1 Recordings(独自動画):単眼RGBから作成。本手法で作成可能なデータ Mocap(モーションキャプチャ):多カメラ+触覚グローブで作成。高品質 Public Dataset:既存の公開HOIデータセットから作成。多様なデータ
  18. © DeNA Co., Ltd. 19 データセット:Mocap(モーションキャプチャ) 論文Figure 6 • 独自Mocap設備で高精度なHOIデータを収集(63,141軌道)

    • 3台のRealSense D455 + 8台のRGBカメラの計11視点(図左) • Paxini EVT2グローブ:29関節エンコーダ+16触覚センサ(図右) 💭高精度データ嬉しいが  論文の手法から脱線  検証にも特に活用されていない
  19. © DeNA Co., Ltd. 21 実験:HOI再構成品質の評価 • HO-Capデータセット[37]でHORT[8], DiffHOI[43], HOLD[11]と比較し高性能

    論文Table 2 [8] Z. Chen et al. Hort: Monocular hand-held objects reconstruction with transformers. arXiv:2503.21313, 2025. [arXiv] [project page] [11] Z. Fan et al. Hold: Category-agnostic 3d reconstruction of interacting hands and objects from video. In CVPR, 2024. [arXiv] [37] J. Wang et al. Ho-cap: A capture system and dataset for 3d reconstruction and pose tracking of hand-object interaction. arXiv:2406.06843, 2024. [arXiv] [43] J. Yang et al. Boosting human-object interaction detection with text-to-image diffusion model. arXiv:2305.12252, 2023. [arXiv] • CD (Chamfer Distance、チャンファ距離):点群の類似度 • F5 / F10 (F-score at 5mm / 10mm):正解表面から5mm(または10mm)以内にある点の割合 • Hand jitter:手の加速度の時間平均 • W-MPJPE (World-frame Mean Per Joint Position Error):世界座標系での関節位置誤差の平均 • Rel. pose consistency(相対姿勢の一貫性):小さいほど「掴んでいる間の手と物体の相対関係が安定している」 💭物理最適化を含む  提案手法のパイプラインが強そう
  20. © DeNA Co., Ltd. 22 実験:VLA / 模倣学習での検証 • ACT、DP、RDT、Pi0の手法で各種タスクを評価

    • (1) テレオペ10本でFT, (2)HORA10本でFT, (3)HORA5k本で事前学習 + HORA10本でFT • 概ね3 > 1 > 2の結果。テレオペできなくても動画がたくさんあれば性能超えられる 論文Table 3, 数値は成功率(試行回数不明だが20か?) 事前学習の仕組みがあるRDT & Pi0のみで3を実験し高精度 💭一部2 > 1の箇所もある  HORAの多様性が効果あり? 💭HORAのモーションキャプチャデータが  含まれていたら不適切だが特に記載はない
  21. © DeNA Co., Ltd. 24 実験:リターゲティング品質の検証 生成した軌跡通りに実ロボットを動かした場合のタスク成功率で評価 リターゲティングの要素を持つ既存手法GAT-Grasp[38], yoto[52]よりも高い成功率 論文Table

    5 論文Figure 8 [38] R. Wang et al. Gat-grasp: Gesture-driven affordance transfer for task-aware robotic grasping. arXiv:2503.06227, 2025. [arXiv] [52] H. Zhou et al. You only teach once: Learn one-shot bimanual robotic manipulation from video demonstrations. arXiv:2501.14208, 2025. [arXiv]
  22. © DeNA Co., Ltd. 25 RoboWheelを読んでみて • 手と物体の相互作用(HOI)動画を、ロボットアーム学習用データに変換する手法 • さまざまな既存技術を組み合わせることで、RGB動画から変換できてスケーラブル

    • 論文Figure 1 論文Figure 4 💭所感: • 制約はあるがデータセット作成のひとつの方向性として重要そう • テレオペなどのアプローチの価値は変わらず高いと言えそう • パイプラインとしての貢献が主なので、構成要素としての新規性は限定的か
  23. © DeNA Co., Ltd. 26 CVPR2026 他のPhysical AI × データ系論文を簡単に紹介

    1/3 • RGB-Dエゴセントリック動画から多指ハンドデータを作る • 点群を入力するVLA利用前提で、点群を直接利用(3次元再構成はしない) • 自由度が異なる8種のハンドに対応するため、機能ベースの中間表現にマッピング • リターゲティングの初期キャリブレーションではGUIで人力調整 G. Zhang et al. UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos. In CVPR, 2026. [paper] UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos.
  24. © DeNA Co., Ltd. 27 CVPR2026 他のPhysical AI × データ系論文を簡単に紹介

    2/3 • 産業現場の連続動画から行動を自動で分割 • RoboWheel/UniDexが担う「1動画→1学習データ」の前段を担当 • CoTracker3で動きを追跡し、その動きが安定→活発→安定と変化する切れ目を検出 • 画像そのものの変化ではなく、動きのパターンから区切り目を判定 J. Zhang et al. From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings. In CVPR, 2026. [paper] N. Karaev et al. Cotracker3: Simpler and better point tracking by pseudo-labelling real videos. arXiv:2410.11831, 2024. [arXiv] [project page] From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings
  25. © DeNA Co., Ltd. 28 CVPR2026 他のPhysical AI × データ系論文を簡単に紹介

    3/3 • 姿勢と物体メッシュだけを入力にリアルなHOI動画を丸ごと生成 • 実写画像不要でシミュレータから直接データを作れるSim-to-Realを実現 M. Gao et al. PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation. In CVPR, 2026. [paper] PAM: A Pose–Appearance–Motion Engine for Sim-to-Real HOI Video Generation