Upgrade to Pro — share decks privately, control downloads, hide ads and more …

[Spatial AI 勉強会] Cov2Pose: Leveraging Spatial C...

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.

[Spatial AI 勉強会] Cov2Pose: Leveraging Spatial Covariance for Direct Manifold-aware 6-DoF Object Pose Estimation

Avatar for o.token

o.token

July 19, 2026

Other Decks in Technology

Transcript

  1. Cov2Pose Leveraging Spatial Covariance for Direct Manifold-aware 6-DoF Object Pose

    Estimation Nassim Ali Ousalah, Peyman Rostami, Vincent Gaudillière, Emmanuel Koumandakis, Anis Kacem, Enjie Ghorbel, Djamila Aouada arXiv:2603.19961v2, 26 March 2026
  2. Table of Content 1. 背景 2. 問題設定と仮説 3. 提案手法 4.

    実験と結果 5. アブレーション、限界、まとめ 3
  3. 背景: 既存手法と本論文の位置づけ RGBベースの6-DoF姿勢推定は、主に次の3系統に整理できる。 PnP / 対応点ベース: 2D–3D対応点や物体座標を推定してPnPを解く。精度は高いが、対応推定と幾 何ソルバを必要とする。 Render-and-compare: 仮説姿勢で物体をレンダリングし、入力との整合を反復的に最適化する。

    3Dモデルと反復処理を要する。 直接回帰: RGB画像から姿勢を単一forward passで回帰する。高速だが、一般に精度で不利である。 直接回帰は計算負荷で他に優る一方、精度で劣る Cov2Poseは直接回帰に属する。CADモデル・PnP・反復レンダリングを使わず、空間共分散とSPD多様 体上の処理で直接回帰を強化する。 出典: Sec. 1, 2 5
  4. 実験設定 LineMOD (LM): 13物体カテゴリ、約16k画像。標準BOP splitを用いる。 Occlusion LineMOD (LM-O): 8物体カテゴリ、重い遮蔽を含む。PBR画像を学習に使用する。 YCB-Video

    (YCB-V): 21物体カテゴリ、約100k実画像。実画像とPBR画像を用いる。 評価指標はADDと対称物体に対するADD-Sである。 LM / LM-Oでは平均ADD(-S)を、YCB-VではADD-SとADD(-S)のAUCも報告する。 ADD(-S)では、平均距離が物体直径の10%未満なら正解として集計する。 ImageNet事前学習済みEfficientNet-B6をbackboneとし、LM/LM-Oは30 epochs、YCB-Vは20 epochsで学習する。 出典: Sec. 5.1, 5.2 13
  5. アブレーション: SPDヘッドと姿勢復号 Table 5(元論文より引用) 。LM-Oの平均ADD(-S)。(A) Euclidean回帰ヘッド、(B) チャネル共分散、(C) Choleskyを除いたlog接空間での学習との 比較。 (A):

    共分散行列から2つのFC layerで回帰 (B): Covariance poolingをspatialからchannel方向に変える (C): コレスキーの代わりに、圧縮後のSPD行列の対数写像と、SPDのポーズラベルのFrobeniusノル ムで学習した. 出典: Table 5, Sec. 5.5 19
  6. 推論時間 Table 6(元論文より引用) 。同一ハードウェア(AMD 3.30GHz CPU、NVIDIA A100 GPU)での推論時間とADD(-S)。 Cov2Poseは46.9 msである。

    内訳は、backbone 22.6 ms、共分散プーリング 0.5 ms、SPDヘッドと姿勢回帰 23.8 msである。 出典: Table 6, Sec. 5.6 20