D.A. Nguyen1, Tuan Duc Ngo1,4, Evangelos Kalogerakis4, Chuang Gan2,4, Anh Tran1, Cuong Pham1,3, Khoi Nguyen1 1Vin AI Research, 2MIT-IBM Watson AI Lab, 3Posts & Telecommunications Inst. Of Tech., 4UMASS Amherst Phuc D. A. Nguyen, Tuan Duc Ngo, Evangelos Kalogerakis, Chuang Gan, Anh Tran, Cuong Pham, and Khoi Nguyen. Open3dis: Open-vocabulary 3d instance segmentation with 2d mask guidance. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR),2024.6 慶應義塾⼤学 杉浦孔明研究室 鈴⽊駿太郎 CVPR 2024
L ⼩物体や幾何学的に曖昧な物体はsegment困難 L 2D基盤モデル利⽤では3D → 2D投影で特徴量が ずれてしまう n 既存OV-3DIS⼿法 ① 3DISモデルで点群をsegment → 2Dに投影して 特徴量埋め込み n OpenMask3D [Takmaz+, NeurIPS23] n OpenIns3D [Huang+, 23] ② 多視点画像で特徴量埋め込み → 3D点群に投影 n OVIR-3D [Lu+, CoRL23] n SAM3D [Yang+, 23] L OpenMask3D [Takmaz+, NeurIPS23] ではタオルの検出に失敗
n Replica [Straub+, 19] n S3DIS [Armeni+, 17] n 評価指標 n AP (IoU 25%, 50%) n mAP (IoU 50~95%) n Backbone n 3D Segmenter ISBNet [Ngo+, CVPR23], Mask3D [Schult+, ICRA] n 2D Segmenter Grounded-SAM [Ren+, ICCV23] n CLIP特徴量 ViT-L/14 [Dosovitsky+, 20] ScanNet200 [Rozenberszki+, ECCV22] Replica [Straub+, 19]
Segmentationは ⼩物体や幾何学的に曖昧な物体への対応× n 2D基盤モデルの3D流⽤は特徴量投影がずれてしまう n 提案⼿法:Open-3DIS n 既存3DISモデルによる⾼精度な3D Instance Mask⽣成 を2D基盤モデルで拡張 n ⼩物体へのSegmentationが可能 n 結果 n OV-3DISタスクにおいて全てのデータセットでSOTA n ⼩物体に対するSegmentationはFully-Supervised モデルをも凌駕
n Weakness n ⼤物体へのSegmentationは3DISモデル依存である n 実験環境の記載がない n Open-Vocabularyと謳っているのに使⽤したText Encoderの記載がない n Comment n 2D Instance Segmentationの3D投影によるずれをSuperpointsで防いでいる点が ⾯⽩かった n 3D投影はDepth予測モデルを使⽤したアプローチも可能?
ScaneNet[Dai+, CVPR17]のクラス数を200クラスに拡張したデータセット n 200クラスは出現頻度に応じてHead, Common, Tailに分類される n Replica[Straub+, 19] n HDR形式の3D屋内環境18シーン,88クラス n S3DIS [Armeni+, 17] n Stanfordの3D屋内環境,6区画271部屋,13クラス
C D 𝑝 𝑟 𝑑𝑟 (p: Precison, r: Recall) n mAP n クラスベルごとのAPの平均 n Intersection over Union(IoU) n 正解Instance領域および予測Instance領域間の重複度 n A:正解領域,B:予測領域 𝐼𝑜𝑈 = 𝐴 ∩ 𝐵 𝐴 ∪ 𝐵