Upgrade to Pro — share decks privately, control downloads, hide ads and more …

GaussianGPT: Towards Autoregressive 3D Gaussian...

GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation

3DGSをコンパクトな離散トークン列に変換し、自己回帰型Transformerで物体や屋内シーンを生成する「GaussianGPT」を提案。次のトークンを逐次予測することで、シーンの新規生成に加え、既存空間を条件とする補完や拡張(outpainting)を同一のモデルで実現する。物体・シーン生成の定量評価と補完・拡張の実験を通じて、3DGS生成における自己回帰型アプローチの有効性を示している。

Avatar for Spatial AI Network

Spatial AI Network

October 06, 2026

More Decks by Spatial AI Network

Other Decks in Research

Transcript

  1. 2026/09/08 Spatial AI 勉強会 GaussianGPT: Towards Autoregressive 3D Gaussian Scene

    Generation Nicolas von Lützow, Barbara Rössle, Katharina Schmid, and Matthias Nießner ECCV 2026 (Oral) 発表者: 橋本泰輔 (Preferred Networks)
  2. 関連研究: L3DG Latent 3D Gaussian Diffusion [B.Roessle et al., SIGGRAPH

    Asia 2024] (同じ研究室) • 3DGS を疎なVQ-VAEで圧縮し、潜在空間で拡散生成 • GaussianGPTとの関係 ◦ 共通点:疎な Grid への圧縮 ◦ 違い:潜在拡散から、離散トークンの自己回帰生成へ 5
  3. 手法 - Stage1: 3D Gaussian Compression • Encoder ◦ ◦

    ◦ Gaussian を位置に基づいてボクセルへ割り当て ボクセル内の Gaussian のパラメータ (色, 透過度, サイズなど) から特徴を抽出 Sparse 3D CNN で空間的に圧縮た潜在ボクセルに ▪ 既存研究 L3DG に準拠 ▪ 入力ボクセル: 2.5cm → 3段階の圧縮 → 潜在ボクセル: 約20cm 8
  4. 手法 - Stage1: 3D Gaussian Compression • LFQ (Lookup-Free Quantization)

    で潜在特徴を離散化 ◦ 各成分の符号をビットに対応づけ、コードIDを得る [-0.6, +0.2, +1.1, -0.3] → [0, 1, 1, 0] → ID 6 ◦ ▪ 4次元の模式例。符号判定により、最近傍コードの探索が不要 ▪ 実験では4,096通りのコードを使用。entropy項でコードの利用を促す L3DG とは異なる離散化方法 9
  5. 手法 - Stage1: 3D Gaussian Compression • Decorder ◦ ◦

    Sparse 3D CNN でボクセルレベルの特徴量にアップサンプリング ▪ 既存研究 L3DG に準拠 各ボクセルの特徴量から Gaussian シーンを再構成 10
  6. 手法 - Stage2: Autoregressive Generation • GPT による次のトークンの予測 ◦ ◦

    シーン全体ではなくチャンク単位で予測することで必要なコンテキストサイズを制限 共通のバックボーンを用いるが、位置と特徴は別のHead を切り替えて処理 ▪ 位置 Head:次の占有ボクセルのインデックスを予測 ▪ 特徴 Head:その位置における特徴を予測 ▪ この構造により空間的特徴と意味的特徴の競合を防止することが可能 13
  7. 手法 - Stage2: Autoregressive Generation • 3D RoPE (3D Rotary

    Positional Encoding) ◦ ◦ ◦ GPT では標準的に1次元インデックスに沿って位置情報が注入されるが、 今回は xyz の走査順序で1次元化しているため、3D空間での近さが保証されない そこで実際のボクセル座標を 3D RoPE により符号化する 相対的な位置関係を attention に反映 14
  8. 手法 - Stage2: Autoregressive Generation • 学習 ◦ • 正解系列を条件に、次トークンの交差エントロピーを最小化

    推論 ◦ ◦ ◦ 生成:開始トークン (BOS) を起点として、位置・特徴トークンを交互に予測 補完:既知の潜在トークンを入力として、続きを予測 拡張:既存領域の局所文脈を入力として、窓の位置をずらして補完を反復 ※ 生成・補完はEOSまで。拡張は局所窓の生成を繰り返して指定範囲へ 15
  9. 実験 - 椅子の生成 • 定量評価:FID・KID・COVが改善、MMDは同程度 ◦ ◦ 見た目:レンダリング画像の分布をFID / KIDで評価

    幾何:抽出メッシュ表面からサンプルした点のChamfer Distanceで評価 ▪ COVは多様性、MMDは幾何分布との近さを測る 18
  10. まとめ 提案手法 • • 3DGSを圧縮・離散化し、位置と特徴のトークン列として表現 次トークン予測により、シーンの生成・補完・拡張を統一的に実現 有効性 • • L3DGと比較し、見た目・レイアウトの評価指標が改善

    シーン補完では、幾何指標(MMD)も改善 課題 • • 逐次生成による計算コストと、広範囲への拡張に伴う品質低下 実スキャンにおける細部の再現性と、未観測領域の不確実性への対応 25