Upgrade to Pro — share decks privately, control downloads, hide ads and more …

[MIRU26] Open-Vocabulary Intention-Guided Objec...

Sponsored · SiteGround - Reliable hosting with speed, security, and support you can count on.

[MIRU26] Open-Vocabulary Intention-Guided Object Detection in Diverse Scenes

More Decks by Semantic Machine Intelligence Lab., Keio Univ.

Other Decks in Technology

Transcript

  1. Motivation: 物体名ではなくユーザの意図から対象物体を検出 ▪ 生活支援ロボットとの対話では、ユーザが物体名を明示しない場面が多い ▪ ユーザの目的・意図に基づき、必要な物体を推論する必要 ▪ 本研究: 自由形式指示文に基づく、多様なシーンでの物体検出 Intention

    Description: I need to make sure I won’t lose track of time while I’m out. ☺ “watch”が 明示されない 既存ベンチマーク[Sawatzky+, CVPR19; Qu+, NeurIPS23; Sun+, ICCV25]  フレーズ/テンプレート表現が中心  一人称視点シーンに限定 serve wine 2
  2. 問題設定: Open-Vocabulary Intention-Guided Object Detection ▪ 入力: 画像 𝒙𝐢𝐦𝐠 と自由形式の指示文

    𝒙𝐢𝐧𝐭 ▪ 出力: 意図を満たす物体領域 𝒚𝐛𝐛𝐨𝐱 “My phone is almost out of battery 𝑥int and I need to charge it in [164.10, 264.96, 303.24, 382.12] before it shuts off.” VLM 入力 𝑥img 出力 𝑦bbox 3
  3. 手法Intent-R1(2/2): Dual Rewardによる報酬設計 : GT bbox と予測 bbox の 𝐈𝐨𝐔

    に基づき、bbox の局所化精度を評価 ☺ 空間的に正しいだけでなく、 意図に合う領域を高く評価 : 予測領域と意図文の 𝐅𝐆-𝐂𝐋𝐈𝐏 類似度に基づき、 意図整合性を評価 6
  4. 実験設定: TriIntentBenchを構築 ▪ 34,692 枚の画像と 35,070 個の自由形式指示文 ▪ 一人称視点、屋内の第三者視点、屋外の第三者視点を含む ▪

    EgoObjects [Zhu+, ICCV23]、ScanNet [Dai+, CVPR17]、COCO [Lin+, ECCV14]から画像とbboxを利用 ▪ GPT-5.1 を用いてシーン理解、意図文生成を実施 ☺ 物体名を明示しない実用的な 指示文を、多様なシーンで評価 TriIntentBench “My phone is almost out of battery and I need to charge it in before it shuts off.” Egocentric Indoor Outdoor 7
  5. 定量的結果 (1/2): 一人称視点シーンで既存手法を上回る 手法 mIoU↑ AP@50↑ AP@75↑ 64.12 68.44 60.13

    Intent-R1(提案手法) SAM 3 [Carion+, ICLR 2026] Rex-Thinker [Jiang+, ICLR 2026] Qwen3-VL-8B [Bai+, 2025] GLM-4.1V-9B [GLM-V Team, 2025] GPT-5.2 [OpenAI, 2025] +11.66 AP@50:95↑ 56.95 16.38 13.25 10.52 10.28 47.73 50.37 45.33 43.31 51.93 54.57 48.47 46.02 52.46 55.73 48.47 45.60 37.71 39.25 30.56 29.63 8
  6. 定量的結果 (2/2): 第三者視点シーンでも多くの既存手法を上回る 手法 Intent-R1(提案手法) SAM 3 [Carion+, ICLR 2026]

    Rex-Thinker [Jiang+, ICLR 2026] Qwen3-VL-8B [Bai+, 2025] GLM-4.1V-9B [GLM-V Team, 2025] GPT-5.2 [OpenAI, 2025] 屋内 屋外 mIoU↑ 56.35 65.87 11.93 12.20 +14.79 37.20 44.10 38.69 48.69 41.56 47.78 30.21 45.79 +17.18 9
  7. 定性的結果: distractorに惑わされず対象物を検出 I want to slice this orange to have

    some fresh pieces with my tea. Ground truth GPT-5.2  GPT-5.2/GLM-4.1V は明示的に 言及された物体に影響を受けやすい GLM-4.1V-9B Intent-R1(提案手法) ☺ Intent-R1 は affordance や 文脈的役割から正しい対象を推定 10
  8. 定性的結果: distractorに惑わされず対象物を検出 I want to slice this orange to have

    some fresh pieces with my tea. Ground truth GPT-5.2  GPT-5.2 と GLM-4.1V-9B は、指示文中で 明示された orange に注意が偏り、誤検出する GLM-4.1V-9B Intent-R1(提案手法) ☺ Intent-R1 は、「切る」という意図から 必要な knife を正確に検出している 11
  9. 実機実験: ロボットを用いたzero-shot設定でも有効 ▪ HSR [Yamamoto+, ROBOMECH J.19]による実環境 RGB 観測で評価 ▪

    64 episodes、100 人手作成指示文 ▪ zero-shot 設定で検証 ▪ ☺ Intent-R1 は Qwen3-VL-8B を大きく上回る 手法 Intent-R1(提案手法) Qwen3-VL-8B [Bai+, 2025] mIoU↑ 83.45 +23.27 60.18 10x 12
  10. まとめ: 指示文に基づく物体検出のためのDual-Reward強化学習 ▪ 背景 ▪ ユーザは物体名ではなく、目的・意図で依頼することが多い ▪ 提案: Intent-R1 ▪

    SFT + Dual-Reward GRPO による二段階 post-training ▪ Geometry Reward と Intention-Alignment Reward を統合 ▪ 多様なシーンを含む TriIntentBench を構築 ▪ 結果 ▪ 3種類のシーンと実機実験で有効性を確認 13