Upgrade to Pro — share decks privately, control downloads, hide ads and more …

MIRU2026 チュートリアル講演2:三次元データ処理の動向

Avatar for Naoya Chiba Naoya Chiba
August 02, 2026

MIRU2026 チュートリアル講演2:三次元データ処理の動向

第29回 画像の認識・理解シンポジウム MIRU2026におけるチュートリアル講演の資料です.

Avatar for Naoya Chiba

Naoya Chiba

August 02, 2026

More Decks by Naoya Chiba

Other Decks in Research

Transcript

  1. 自己紹介 • 名前:千葉 直也 (Naoya Chiba) • 所属:大阪大学D3センター サイバーメディア教育研究部門 浦西研究室

    • 専門:三次元データ処理 • 経歴: • 2020.03: 東北大学 博士(情報科学)取得 • 2020.04-2023.03: ポスドク x2 早稲田大学 尾形研究室と オムロンサイニックエックス株式会社 • 2023.04-2024.08: 東北大学情報科学研究科 助教 • 2024.09-: 大阪大学 サイバーメディアセンター → D3センター • 3D関係の書籍/記事執筆・資料公開など → ここ数年は Speaker Deck にアップしています 2
  2. ロボットビジョン センシング 応用 需要 ばら積みピッキング Human-in-the-Loop in VR 2D学習済モデルの 産業ビジョン活用

    3D計測 少数データでのインスタンス セグメンテーション 生物トラッキング 工場点群セグメンテーション 3D生成モデル x 計算力学 非剛体自己教師点群位置合わせ 3Dラベリングツール 画像ヤコビアン x 拡散モデル アバターコミュニケーション 書籍執筆 興味 基礎 代数幾何 x 点群処理 Symbolic Regression (表 → 数式の推定) 点群深層学習の事前学習 少頂点な3Dメッシュ生成 ニューラル3Dデータ表現の解析 結晶構造デコーダー 触覚センサ x 3D認識 3
  3. はじめに • 3Dコンピュータビジョンに深層学習が広まって以降, それぞれの構成要素の境界が曖昧に • この10年ほどの大まかな研究動向を俯瞰的に紹介 • 表現 • 明示的な3Dデータ表現への深層学習の適用,Neural

    Fieldやプリミティブベースの表現の発展 • 再構成 • 計測への深層学習の適用,複数タスクを統合したFeed-Forwardモデルへ • 生成 • 直接各種3D表現を生成する手法の発展,2Dやビデオの生成を3D生成に利用 • 言語・タスク • 言語特徴量や各種タスク向けの特徴量と3Dを紐づける 4
  4. アウトライン • 3D表現の発展 • 古典的な3D表現と処理 • Neural Fieldの導入 • 微分可能レンダリング・NeRF/3DGS

    • 変形・4D・物理 • 計測と再構成 • 計測・対応づけ・再構成の学習化 • Feed-Forward 3D再構成 • Feed-Forward 4D再構成 • 生成と接地 • 3D生成モデル • 2D基盤モデルからのマッピング • 言語・LLMと空間理解 6
  5. アウトライン • 3D表現の発展 • 古典的な3D表現と処理 • Neural Fieldの導入 • 微分可能レンダリング・NeRF/3DGS

    • 変形・4D・物理 • 計測と再構成 • 計測・対応づけ・再構成の学習化 • Feed-Forward 3D再構成 • Feed-Forward 4D再構成 • 生成と接地 • 3D生成モデル • 2D基盤モデルからのマッピング • 言語・LLMと空間理解 7
  6. 既存の3Dデータ表現 古典的な3Dデータ表現:深度画像・ボクセル・点群・メッシュなど • 陽なデータ表現で計測・データ処理がしやすい • とはいえデータ構造はやや複雑(画像・テキストなどと比べて) 空間座標:離散 サンプル点:離散 接続・トポロジー:明示 空間座標:離散

    サンプル点:離散 接続・トポロジー:明示 空間座標:連続 サンプル点:離散 接続・トポロジー:なし 空間座標:連続 サンプル点:離散 接続・トポロジー:明示 深度画像: 2Dグリッド・表面のみ ボクセル: 3Dグリッド 点群: 離散な点集合 メッシュ: 頂点・辺・面 8
  7. 古典的なデータ表現の処理 各データ表現に応じて深層学習が適用 • ボクセルデータ処理 • VoxNet [D. Maturana+, IROS2015]: 3D畳み込みでボクセルデータを処理

    • OctNet [G. Riegler+, CVPR2017],O-CNN [P.-S. Wang+, SIGGRAPH2017]: Octreeでスパース化,ツリー構造を辿って畳み込み • Sparse Convolutional Networks [G. Graham+, CVPR2018], MinkowskiNet [C. Choy+, CVPR2019]: スパースボクセル上で畳み込み D. Maturana+, VoxNet: A 3D Convolutional Neural Network for real-time object recognition, IROS2015. G. Riegler+, OctNet: Learning Deep 3D Representations at High Resolutions, CVPR2017. B. Graham+, 3D Semantic Segmentation with Submanifold Sparse Convolutional Networks, CVPR2018. 9
  8. 古典的なデータ表現の処理 各データ表現に応じて深層学習が適用 • 点群データ処理 • PointNet [C. R. Qi+, CVPR2017],Deep

    Sets [M. Zaheer+, NIPS2017]:順不同なデータにSymmetric Function • 点群畳み込み(KPConv [H. Thomas+, ICCV2019],EdgeConv [Y. Wang+, ToG (2019)]など): 近傍・カーネルを非グリッドで定義し学習可能な畳み込みを実現 • Transformerベースに(PointTransformer V3 [X. Wu+, CVPR2024]など):点群を一列に並べてトークン化 • 事前学習の発達・複数データセットを併用・PEFTでファインチューニング H. Thomas+, KPConv: Flexible and Deformable Convolution for Point Clouds, ICCV2019. Y. Wang+, Dynamic Graph CNN for Learning on Point Clouds, ToG (2019). 10
  9. 古典的なデータ表現の処理 各データ表現に応じて深層学習が適用 • 点群データ処理 • PointNet [C. R. Qi+, CVPR2017],Deep

    Sets [M. Zaheer+, NIPS2017]:順不同なデータにSymmetric Function • 点群畳み込み(KPConv [H. Thomas+, ICCV2019],EdgeConv [Y. Wang+, ToG (2019)]など): 近傍・カーネルを非グリッドで定義し学習可能な畳み込みを実現 • Transformerベースに(PointTransformer V3 [X. Wu+, CVPR2024]など):点群を一列に並べてトークン化 • 事前学習の発達・複数データセットを併用・PEFTでファインチューニング X. Wu+, Point Transformer V3: Simpler, Faster, Stronger, CVPR2024. X. Wu+, Sonata: Self-Supervised Learning of Reliable Point Representations, CVPR2025. 11
  10. 古典的なデータ表現の処理 各データ表現に応じて深層学習が適用 • メッシュデータ処理 • Geodesic CNN [J. Masci+, ICCV2015-WS]:メッシュ上の畳み込み

    • MeshCNN [R. Hanocka+, SIGGRAPH2019]:メッシュのエッジを使った畳み込み • DiffusionNet [N. Sharp+, SIGGRAPH2022]:熱拡散で空間伝搬をモデル化 R. Hanocka+, MeshCNN: A Network with an Edge, SIGGRAPH2019. 12
  11. 3Dデータに合わせた設計は必要か 3Dで何度も繰り返されている問い:設計 vs データ 幾何的な性質(同変性など)を組み込んだネットワークにするべきか, 自由度が高いモデルに対して大量のデータを見せるべきか → 揺れながら発展,大きなトレンドとしてはデータ側に Does equivariance

    matter at scale? [J. Brehmer+, TMLR (2025)] / Rapidash [S. Vadgama+, NeurIPS2025] • データ・計算コストを度外視したとき, 構造や対称性を反映したアーキテクチャを 設計する意味はあるのか • 結論の一部: • 等変モデルはデータ効率が高いが, データ拡張が差をほぼ埋める • モデル容量を増やしても性能差は完全には消えない • 幾何的参照フレームによる明示的な対称性破りで性能向上 J. Brehmer+, Does equivariance matter at scale?, TMLR (2025). 13
  12. パラメトリックなモデル 人体を中心に,パラメトリックな3Dモデルも発展 • 3DMM [V. Blanz+, SIGGRAPH1999],FLAME [T. Li+, SIGGRAPH

    Asia2017]:顔 • SMPL [M. Loper+, SIGGRAPH Asia2015]:全身 • MANO [J. Romero+, SIGGRAPH Asia2017]:手 • SMPL-X [G. Pavlakos+, CVPR2019]:全身を統合 V. Blanz+, A Morphable Model For The Synthesis Of 3D Faces, SIGGRAPH1999. T. Li+, Learning a model of facial shape and expression from 4D scans, SIGGRAPH Asia2017. 14
  13. パラメトリックなモデル 人体を中心に,パラメトリックな3Dモデルも発展 • 3DMM [V. Blanz+, SIGGRAPH1999],FLAME [T. Li+, SIGGRAPH

    Asia2017]:顔 • SMPL [M. Loper+, SIGGRAPH Asia2015]:全身 • MANO [J. Romero+, SIGGRAPH Asia2017]:手 • SMPL-X [G. Pavlakos+, CVPR2019]:全身を統合 M. Loper+, SMPL: A Skinned Multi-Person Linear Model, SIGGRAPH Asia2015. 15
  14. パラメトリックなモデル 人体を中心に,パラメトリックな3Dモデルも発展 • 3DMM [V. Blanz+, SIGGRAPH1999],FLAME [T. Li+, SIGGRAPH

    Asia2017]:顔 • SMPL [M. Loper+, SIGGRAPH Asia2015]:全身 • MANO [J. Romero+, SIGGRAPH Asia2017]:手 • SMPL-X [G. Pavlakos+, CVPR2019]:全身を統合 J. Romero+, Embodied Hands: Modeling and Capturing Hands and Bodies Together, SIGGRAPH Asia2017. 16
  15. パラメトリックなモデル 人体を中心に,パラメトリックな3Dモデルも発展 • 3DMM [V. Blanz+, SIGGRAPH1999],FLAME [T. Li+, SIGGRAPH

    Asia2017]:顔 • SMPL [M. Loper+, SIGGRAPH Asia2015]:全身 • MANO [J. Romero+, SIGGRAPH Asia2017]:手 • SMPL-X [G. Pavlakos+, CVPR2019]:全身を統合 G. Pavlakos+, Expressive Body Capture: 3D Hands, Face, and Body from a Single Image, CVPR2019. 17
  16. Fieldによる表面形状表現 Fieldによる表面形状の記述とは 空間中の各点での値を返す関数の等高面で形状を記述 𝑓𝑓 𝑥𝑥; 𝜃𝜃 = 𝜏𝜏 • 𝜃𝜃:

    形状を表すパラメータ • 𝑥𝑥: 座標 • 𝜏𝜏: 等高面の高さ 𝑓𝑓𝜃𝜃 𝜏𝜏 Neural Fieldを用いた表面モデル • DeepSDF [J. J. Park+, CVPR2019] • Occupancy Network [L. Mescheder+, CVPR2019] • IM-Net [Z. Chen+, CVPR2019] 記述したい形状 20
  17. DeepSDFの紹介 形状のSigned Distance Function (SDF)をNeural Fieldで学習 シンプルなネットワークで三次元形状が記述できる Neural Fieldが座標間でパラメータを共有・・・ 整合した連続表面を表現しやすい

    Signed Distance Function (SDF) > 0(物体の外側) 𝑓𝑓 𝒙𝒙 �= 0(物体の表面) < 0(物体の内側) J. J. Park+. DeepSDF: Learning Continuous Signed Distance Functions for Shape Representation. CVPR2019. 21
  18. 表面点群のみからSDFを学習 Implicit Geometric Regularization [A. Gropp+, ICML2020] • 表面点群(=SDFのゼロ面上の点)から Neural

    FieldでSDFをモデル化・最適化 • 適切な初期化と空間中での勾配に関するアイコナール制約 (SDFの勾配の大きさがあらゆる点で1になる)を用いて学習 A. Gropp+, Implicit Geometric Regularization for Learning Shapes, ICML2020. 26
  19. 3D教師から多視点2D教師へ • Neural Fieldのアイデアが3D表現を革新 • シンプルなネットワークで複雑な形状をモデル化できるようになった • DeepSDF・表面モデルの限界 • 体積効果・半透明・鏡面反射・視点依存外観は

    単純な表面+色だけでは扱いにくい • 初期のDeepSDFなどでは,3Dサンプルや表面教師が必要 → NeRF (Neural Radiance Field) [B. Mildenhall+, ECCV2020]の登場 • 体積(Volumetric)ベースのモデル,視点依存性にも対応 • 多視点画像のみから任意視点画像生成を可能に • シーンごとに最適化する(:DeepSDFのようにCodeで制御しない) 27
  20. 微分可能レンダリング レンダリングを通して画像での差分 → 3D表現に勾配を流す ・・・勾配ベースで3D表現が最適化できるように • OpenDR [M. M. Loper+,

    ECCV2014]:微分可能レンダリングの草分け • Neural 3D Mesh Renderer [H. Kato+, CVPR2018]: メッシュラスタライズの勾配近似 • メッシュをニューラルネットワークの構成要素として組み込めるように • ラスタライズが離散で勾配が止まってしまう → 近似勾配 を定義 • シルエット教師のみによるメッシュ再構成,2D-to-3Dスタイル変換, 3D DeepDreamを2D教師で実現 • SoftRas [S. Liu+, ICCV2019]: 確率的ソフト化 • レンダリング=確率的寄与をピクセルごとに 集約する微分可能な過程 H. Kato+, Neural 3D Mesh Renderer, CVPR2018. S. Liu+, Soft Rasterizer: A Differentiable Renderer for Image-based 3D Reasoning, ICCV2019. 28
  21. NeRFの紹介 NeRF (Neural Radiance Field) [B. Mildenhall+, ECCV2020] • 新規視点画像生成(Novel

    View Synthesis)を行う あるシーンの多視点画像を学習しておき, そのシーンの任意視点での画像を推定できるように • アプローチ • Radiance Field (放射輝度場)をNNでモデル化 • Volume Renderingを深層学習フレームワーク上で計算, シーンごとに勾配ベースで最適化 B. Mildenhall+, NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis, ECCV2020. 29
  22. Volume Rendering 画像=光線に対応した画素の輝度値を並べたもの 画素の輝度値 =光線上の放射輝度を足し合わせたもの 𝑡𝑡𝑓𝑓 𝐶𝐶 𝐫𝐫 = �

    𝑇𝑇 𝑡𝑡 𝜎𝜎 𝐫𝐫 𝑡𝑡 𝑐𝑐 𝐫𝐫 𝑡𝑡 , 𝐝𝐝 𝑑𝑑𝑑𝑑 画素の色 𝑡𝑡𝑛𝑛 その点の密度 その点の色 (方向を考慮) 𝑡𝑡 𝑇𝑇 𝑡𝑡 = exp − � 𝜎𝜎 𝐫𝐫 𝑠𝑠 𝑑𝑑𝑑𝑑 遮られずに 到達する度合い 𝑡𝑡𝑛𝑛 そこまでの密度 これを深層学習フレームワークで実装し 微分可能なボリュームレンダリングを実現, NeRFの最適化が可能になった B. Mildenhall+, NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis, ECCV2020. 32
  23. ネットワーク構造 シンプルなMLPでRadiance Fieldをモデル化 光線上の各点についてクエリし Volume Renderingする 座標の入力 (Positional Encoding) 密度の出力

    色の出力 視点角度の入力 B. Mildenhall+, NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis, ECCV2020. 34
  24. 出力の例 シーン 正解 出力 シーン 正解 出力 B. Mildenhall+, NeRF:

    Representing Scenes as Neural Radiance Fields for View Synthesis, ECCV2020. 35
  25. Neural Fieldによる表面モデル 画像による誤差から表面モデルを微分可能に最適化 • NeuS [P. Wang+, NeurIPS2021]:SDFのゼロ等高面をVolume Renderingで学習 •

    VolSDF [L. Yariv+, NeurIPS2021]:SDFを累積密度に変換して体積密度を定義 P. Wang+, NeuS: Learning Neural Implicit Surfaces by Volume Rendering for Multi-view Reconstruction, NeurIPS2021. 36
  26. NeRF+空間で構造化したデータ構造 • 部分ごとに分割して情報を保持することで, レンダリング・最適化(両方 or 片方)の高速化 • 場合によっては(Plenoxelsなど), ニューラルネットワークを一切使わない手法まで登場 座標

    𝑥𝑥 MLP 視点 𝑑𝑑 座標 𝑥𝑥 視点 𝑑𝑑 �密度 𝜎𝜎 色 𝑐𝑐 NeRFの模式図 うまい データ構造 MLP等 空間に紐づく特徴マップを用いたRFの模式図 �密度 𝜎𝜎 色 𝑐𝑐 38
  27. NeRF+空間で構造化したデータ構造 • 明示的なグリッド上での空間特徴 • グリッド:KiloNeRF [C. Reiser+, ICCV2021],FastNeRF [S. J.

    Garbin+, ICCV2021] など • (スパース)ボクセル:NSVF [L. Liu+, NeurIPS2020],SNeRG [P. Hedman+, ICCV2021], DVGO [C. Sun+, CVPR2022],Plenoxels [S. Fridovich-Keil+, CVPR2022]など • Octree:NGLOD [T. Takikawa+, CVPR2021],PlenOctree [A. Yu+, ICCV2021]など S. Fridovich-Keil+, Plenoxels: Radiance Fields without Neural Networks, CVPR2022. 39
  28. NeRF+空間で構造化したデータ構造 • 複数解像度での符号化 • Instant-NGP [T. Müller+, SIGGRAPH2022],VQ-AD [T. Takikawa+,

    SIGGRAPH2022]など T. Müller+, Instant Neural Graphics Primitives with a Multiresolution Hash Encoding, SIGGRAPH2022. 40
  29. NeRFの高品質化 NeRFのレンダリング品質向上・表現できるシーンの拡大 • Mip-NeRF [J. T. Barron+, ICCV2021]:円錐台サンプリング • mipmapの発想をNeRFに持ち込み,円錐台領域を近似して積分

    • Mip-NeRF 360 [J. T. Barron+, CVPR2022]:全周シーンにNeRF/mip-NeRFを適用 • 非線形なシーンパラメータ化 ,オンライン蒸留,歪みの正則化 • Zip-NeRF [J. T. Barron+, ICCV2023]:グリッド+mipの統合 • mip-NeRF 360とInstant NGPのハッシュグリッドによる高速な学習を統合 J. T. Barron+, Mip-NeRF: A Multiscale Representation for Anti-Aliasing Neural Radiance Fields, ICCV2021. 42
  30. NeRFから3D Gaussian Splattingへ NeRFの登場とその後の発展 • NeRF:シーンを微分可能にレンダリングできる形で持てば、 多視点画像との再構成誤差だけで 3D が最適化できる •

    その後の研究:シーンの持ち方はMLPでなくてもよい → ニューラル表現であることは必須ではなく,レンダリングが 微分可能・2D教師からシーンを最適化できることが重要 残った課題:1画素ごとに光線を積分する遅さ → 3D Gaussian Splatting (3DGS) [B. Kerbl+, SIGGRAPH2023] の登場 43
  31. Gaussian Splattingのアイデア • Radiance Fieldをガウス分布の集合(=3D Gaussian)で近似 ニューラルネットワークは使用しない • 3D Gaussianのための最適化/レンダリング手法を提案

    任意視点画像生成に利用できるように • ガウス分布の集合としてRadiance Fieldを記述 • 各構成要素には位置,共分散行列,不透明度,色を割り当て • 色は球面調和関数で視線方向依存性を記述 B. Kerbl+, 3D Gaussian Splatting for Real-Time Radiance Field Rendering, SIGGRAPH2023. 44
  32. シーンの最適化 3DGSでのシーン最適化の流れ 1. SfMで初期化 2. 以下を反復して最適化 1. 2. 3. 4.

    レンダリング 正解画像と比較 パラメータの最適化 (定期的に)密度の最適化 B. Kerbl+, 3D Gaussian Splatting for Real-Time Radiance Field Rendering, SIGGRAPH2023. 45
  33. レンダリング 高速にレンダリングするためにいくつかの工夫を導入 • 画面を分割し,対応する視錐台領域だけ扱う • 深度でソートして2Dでアルファブレンディング(若干の近似) • 累積透過率が十分小さくなったらその先を無視(隠れ) 最適化の工夫 •

    解像度のウォームアップ:徐々に画像解像度を上げる • 色のウォームアップ:視線方向依存性が偏りやすい 球面調和関数の0次(拡散反射)から,徐々に次数を追加 B. Kerbl+, 3D Gaussian Splatting for Real-Time Radiance Field Rendering, SIGGRAPH2023. 47
  34. プリミティブベースのシーン表現 • プリミティブの選択:表面を意識したGaussian表現 • SuGaR [A. Guédon+, CVPR2024] • 3D

    Gaussianをシーン表面に整列・分布させる正則化項を導入 • 抽出したメッシュ三角形に新たなGaussianを束縛して同時最適化 • 2DGS [B. Huang+, SIGGRAPH2024] • 2Dのsurfel(surface element)を微分可能・最適化可能な枠組みに乗せる • 疎な点群と多視点RGBのみから外観と幾何を同時復元 A. Guédon+, SuGaR: Surface-Aligned Gaussian Splatting for Efficient 3D Mesh Reconstruction and High-Quality 50 Mesh Rendering, CVPR2024.
  35. プリミティブベースのシーン表現 • プリミティブの選択:三角形メッシュ • Triangle Splatting [J. Held+, 3DV2026] •

    三角形の集合を微分可能レンダリングで直接最適化 • 各三角形を微分可能なsplatとしてスクリーン空間にレンダリングしつつ勾配で最適化 • MeshSplatting [J. Held+, CVPR2026] • 連結三角形メッシュを微分可能レンダリングで直接最適化 • 頂点共有によって幾何と外観をend-to-endで最適化 J. Held+, Triangle Splatting for Real-Time Radiance Field Rendering, 3DV2026. J. Held+, MeshSplatting: Differentiable Rendering with Opaque Meshes, CVPR2026. 51
  36. プリミティブベースのシーン表現 • その他 • 凸形状プリミティブ:3D Convex Splatting [J. Held+, CVPR2025]

    • GaussianのProjectionを改良: 3DGUT [Q. Wu+, CVPR2025] • Gaussianの構造化(+軽量MLP): Scaffold-GS [T. Lu+, CVPR2024], Neural Gabor [H. Watanabe+, CVPR2026]など J. Held+, 3D Convex Splatting: Radiance Field Rendering with 3D Smooth Convexes, CVPR2025. 52
  37. 3DGSの高品質化・洗練 3DGSも高品質化・理論の整理,より一般のシーンへの汎化が進む • Mip-Splatting [Z. Yu+, CVPR2024] Mip-NeRF 360同様のエイリアス問題 →

    サンプリング定理を参照し3D 平滑化+2D Mipフィルタ • HAC [Y. Chen+, ECCV2024] ハッシュグリッド文脈のエントロピー符号化で圧縮 • 3DGS as MCMC [S. Kheradmand+, NeurIPS2024] Gaussianの生成・消去をMCMCサンプリングとして理論化 Z. Yu+, Mip-Splatting: Alias-free 3D Gaussian Splatting, CVPR2024. Y. Chen+, HAC: Hash-grid Assisted Context for 3D Gaussian Splatting Compression, ECCV2024. 53
  38. 構造化NeRFの時間拡張 時刻に沿って変形するシーンをNeRFでモデル化 • 正準シーン+変形:D-NeRF [A. Pumarola+, CVPR2021],Nerfies [K. Park+, ICCV2021],

    HyperNeRF [K. Park+, ToG (2021)]など • 低次元に分解:HexPlane [A. Cao+, CVPR2023] A. Pumarola+, D-NeRF: Neural Radiance Fields for Dynamic Scenes, CVPR2021. 56
  39. 3DGSの時間拡張 時刻に沿って変形するシーンを3DGSでモデル化 • 3DGS+位置・姿勢の時間変化:Dynamic 3D Gaussians [J. Luiten+, 3DV2024] •

    3DGS+Hexplane変形場:4D Gaussian Splatting [G. Wu+, CVPR2024] • Gaussianを4Dに拡張:4D Gaussian Splatting [Z. Yang+, ICLR2024] G. Wu+, 4D Gaussian Splatting for Real-Time Dynamic Scene Rendering, CVPR2024. 57
  40. 動的シーンと動画と物理モデル 動的シーンの分解を通じてシーン理解・物理につなげる • PAC-NeRF [X. Li+, ICLR2023]:NeRF+微分可能シミュレーション • PhysGaussian [T.

    Xie+, CVPR2024]:3DGS+物理シミュレーション • PhysDreamer [T. Zhang+, ECCV2024]:3DGS+微分可能シミュレーション+動画生成 T. Zhang+, PhysDreamer: Physics-Based Interaction with 3D Objects via Video Generation, ECCV2024. 59
  41. パラメトリックなモデルと動的シーン ポーズ・メッシュ・人体モーション・トーキングヘッドなど アニメーション可能でフォトリアルな任意視点画像として発展 • Neural Body [S. Peng+, CVPR2021]:多視点ビデオから人物のNVSと3D再構成 •

    SMPLの頂点に潜在ベクトルを与えてフレームをまたいで共有 • HumanNeRF [C.-Y. Weng+, CVPR2022]:単眼動画から人物の自由視点映像 • 人物をCanonical T-poseでモデル化,Motion Fieldを最適化 • Motion Fieldはスケルトンベースの剛体変換と非剛体変換に分ける S. Peng+, Neural Body: Implicit Neural Representations with Structured Latent Codes for Novel View Synthesis of Dynamic Humans, CVPR2021. C.-Y. Weng+, HumanNeRF: Free-viewpoint Rendering of Moving People from Monocular Video, CVPR2022. 60
  42. パラメトリックなモデルと動的シーン ポーズ・メッシュ・人体モーション・トーキングヘッドなど: アニメーション可能でフォトリアルな任意視点画像として発展 • GaussianAvatars [S. Qian+, CVPR2024]:3DGSをFLAME顔モデルにリギング 各フレームのFLAMEメッシュに3D Gaussianを紐づける

    • Animatable Gaussians [Z. Li+, CVPR2024/拡張版がarXiv]: 前面・背面のCanonical Gaussian Mapにパラメータ化,物理ベースレンダリングに拡張 S. Qian+, GaussianAvatars: Photorealistic Head Avatars with Rigged 3D Gaussians, CVPR2024. Z. Li+, Animatable Gaussians: Learning Pose-dependent Gaussian Maps for High-fidelity Human Avatar Modeling, CVPR2024. 61
  43. Neural Fieldのデータ化 データ表現が拡張される → それを入力・処理するニューラルネットワークが登場する • Functa [E. Dupont+, ICML2022]:Neural

    Fieldを処理 • フィット済みのNeural Fieldを一つのデータ点とみなす • 生成モデリング・データ補完・novel view synthesis・分類といった下流タスクを直接解く E. Dupont+, From data to functa: Your data point is a function and you can treat it like one, ICML2022. 62
  44. 3DGSのデータ化 データ表現が拡張される → それを入力・処理するニューラルネットワークが登場する • ShapeSplat [Q. Ma+, 3DV2025]:3DGSを処理 •

    ShapeNet・ModelNet を3DGS 化した大規模データセットを構築 • Gaussian-MAE:Gaussian パラメータから直接masked autoencoderで事前学習 • 点群として素朴に扱うのは不十分,Gaussianの全パラメータを利用 Q. Ma+, ShapeSplat: A Large-scale Dataset of Gaussian Splats and Their Self-Supervised Pretraining, 3DV2025.63
  45. アウトライン • 3D表現の発展 • 古典的な3D表現と処理 • Neural Fieldの導入 • 微分可能レンダリング・NeRF/3DGS

    • 変形・4D・物理 • 計測と再構成 • 計測・対応づけ・再構成の学習化 • Feed-Forward 3D再構成 • Feed-Forward 4D再構成 • 生成と接地 • 3D生成モデル • 2D基盤モデルからのマッピング • 言語・LLMと空間理解 64
  46. アクティブステレオ計測と深層学習 学習による計測信号の復号などの形で, 三次元計測にも深層学習が利用されるように • 位相シフト+CNN [S. Feng+, Advanced Photonics (2019)]

    arctanの分子・分母を中間表現として推定 • DCFPP [Y. Li+, OEA (2022)] 高周波と低周波を1枚に重畳しU-Netで位相復元 • SSSR-FPP [B. Wang+, Light: Science & Applications (2025)] 高速撮影+低解像度・低SNR・モザイク化をCNNで位相復元・アンラップ S. Feng+, Fringe pattern analysis using deep learning, Advanced Photonics (2019). 65
  47. 計測システム・光学系と深層学習 光学系や計測システムを考慮 / 微分可能な3Dシーン表現の活用 • Neural Field+ランダム投影 [A. Shandilya+, ICCV2023]

    • 多視点Intel RealSense D435(内蔵のIRランダムドットプロジェクタ)を想定 • Neural Volume Renderingでシーンの幾何と外観を少数視点から復元 • Deep Optics [J. Chang+, ICCV2019]:光学系とネットワークを同時に設計 • コード化デフォーカスブラー・色収差・非点収差を深度依存のPSFとして符号化,CNNで復号 • 微分可能なモデルで物理的な設計パラメータも最適化 A. Shandilya+, Neural Fields for Structured Lighting, ICCV2023. J. Chang+, Deep Optics for Monocular Depth Estimation and 3D Object Detection, ICCV2019. 66
  48. パッシブ計測・多視点ステレオの学習化 (多視点)ステレオでの対応づけが学習に置き換わる: マッチングコスト → Cost Volume → 多視点 • MC-CNN

    [J. Žbontar+, JMLR (2016)]:パッチ類似度をCNNで学習 • GC-Net [A. Kendall+, ICCV2017]:3D CNN+Soft-argminでCost Volumeの学習 • MVSNet [Y. Yao+, ECCV2018]:多視点ステレオへ拡張 J. Žbontar+, Stereo Matching by Training a Convolutional Neural Network to Compare Image Patches, JMLR (2016). 68
  49. パッシブ計測・多視点ステレオの学習化 (多視点)ステレオでの対応づけが学習に置き換わる: マッチングコスト → Cost Volume → 多視点 • MC-CNN

    [J. Žbontar+, JMLR (2016)]:パッチ類似度をCNNで学習 • GC-Net [A. Kendall+, ICCV2017]:3D CNN+Soft-argminでCost Volumeの学習 • MVSNet [Y. Yao+, ECCV2018]:多視点ステレオへ拡張 A. Kendall+, End-to-End Learning of Geometry and Context for Deep Stereo Regression, ICCV2017. 69
  50. パッシブ計測・多視点ステレオの学習化 (多視点)ステレオでの対応づけが学習に置き換わる: マッチングコスト → Cost Volume → 多視点 • MC-CNN

    [J. Žbontar+, JMLR (2016)]:パッチ類似度をCNNで学習 • GC-Net [A. Kendall+, ICCV2017]:3D CNN+Soft-argminでCost Volumeの学習 • MVSNet [Y. Yao+, ECCV2018]:多視点ステレオへ拡張 Y. Yao+, MVSNet: Depth Inference for Unstructured Multi-view Stereo, ECCV2018. 70
  51. 単眼深度推定の進化 • 並行して単眼深度推定も発展 • MiDaS [R. Ranftl+, TPAMI (2022)]: スケール・シフト差を吸収するロス+異種データセットを混合学習

    • Depth Anything [L. Yang+, CVPR2024] / Depth Anything V2 [L. Yang+, NeurIPS2024]: データ品質と蒸留で性能向上 • 相対深度で学習,スケールはファインチューニング • Marigold [B. Ke+, CVPR2024]: 拡散モデルの利用 • 学習済みの2D拡散モデルを 単眼深度推定にファインチューニング L. Yang+, Depth Anything V2, NeurIPS2024. 71
  52. Feed-Forwardで任意視点画像生成 NeRF/3DGSなどのシーンごとに最適化する新規視点画像生成は 観測との整合性を直接最適化 → 計算コストが大きく,未観測領域には対応しづらい 反復的な再構成なしで任意視点画像生成を行う手法が登場 • 一度のForward計算なので高速 • 学習済みの事前分布から予測

    学習への依存が大きい・観測されていない幾何をもっともらしく埋めることは要注意 • 補完は比較的得意 A. Yu+, pixelNeRF: Neural Radiance Fields from One or Few Images, CVPR2021. Y. Hong+, LRM: Large Reconstruction Model for Single Image to 3D, ICLR2024. 72
  53. Feed-Forwardで任意視点画像生成 反復的な再構成なしでFeed-Forwardで任意視点画像生成 • pixelNeRF [A. Yu+, CVPR2021]:1枚~数枚の画像・カメラ既知 → NeRF •

    pixelSplat [D. Charatan+, CVPR2024]:画像ペア・カメラ既知 → 3DGS • MVSplat [Y. Chen+, ECCV2024]:2枚~・カメラ既知 → Cost Volume → 3DGS • LRM [Y. Hong+, ICLR2024]:1枚 → Triplane-NeRF(補完が主) A. Yu+, pixelNeRF: Neural Radiance Fields from One or Few Images, CVPR2021. Y. Hong+, LRM: Large Reconstruction Model for Single Image to 3D, ICLR2024. 73
  54. Feed-Forwardで任意視点画像生成 反復的な再構成なしでFeed-Forwardで任意視点画像生成 • Scene Representation Transformer (SRT) [M. S. M.

    Sajjadi+, CVPR2022]: 数枚・カメラ未知or既知 → 任意視点画像 • 少数画像をTransformerでエンコード, Query RayへのAttentionだけでFeed-Forwardで新規視点合成 • 入力画像は姿勢付き・なしのどちらも提案 M. S. M. Sajjadi+, Scene Representation Transformer: Geometry-Free Novel View Synthesis Through Set-Latent 74 Scene Representations, CVPR2022.
  55. Feed-Forward 3D再構成へ 古典SfM/MVSはサブ問題が多い • 特徴点 → マッチング → 基礎行列 →

    三角測量 → バンドル調整 → MVS • Feed Forwardで任意視点画像生成ができるなら, これらのサブ問題も学習可能なはず 1つのTransformerで全部やればいいのでは? → DUSt3R [S. Wang+, CVPR2024]の登場 • 画像ペアを入力として,1つの共通座標系でのPointmapを予測 • 多視点をペアで推定 → 全体で最適化することで多視点にも応用可能 75
  56. DUSt3Rの派生研究 DUSt3R以降の発展:性能向上と多視点同時入力に • MASt3R [V. Leroy+, ECCV2024]:ロス追加+明示的に密なマッチングを予測 • Fast3R [J.

    Yang+, CVPR2025]: All-to-All Attentionで大量枚数を同時に入力 • CUT3R [Q. Wang+, CVPR2025]:状態を追加し可変長対応+不可視部分も予測 Q. Wang+, Continuous 3D Perception Model with Persistent State, CVPR2025. 78
  57. VGGTが3Dの基盤モデルへ VGGT (Visual Geometry Grounded Transformer) [J. Wang+, CVPR2025] 多視点の画像入力・複数の3D幾何タスクの同時学習で優れた性能を達成:

    主要な3D幾何推定タスクが一つのTransformerで解けるように J. Wang+, VGGT: Visual Geometry Grounded Transformer, CVPR2025. 79
  58. DUSt3R/VGGT以降の幾何モデル DUSt3R/VGGT以降の発展:タスクやバイアスを調整 • 𝜋𝜋 3 [Y. Wang+, ICLR2026]:置換同変にして固定参照視点の依存を排除 • Depth

    Anything 3 [H. Lin+, ICLR2026]:アーキテクチャ・予測タスクの単純化 • MapAnything [N. Keetha+, 3DV2026]:表現を分解し多彩なタスクで学習&推論 • RayZer [H. Jiang+, ICCV2025]:カメラ姿勢・3D教師なしで2D画像だけから学習 H. Lin+, Depth Anything 3: Recovering the Visual Space from Any Views, ICLR2026. 82
  59. DUSt3R/VGGT以降の幾何モデル DUSt3R/VGGT以降の発展:タスクやバイアスを調整 • 𝜋𝜋 3 [Y. Wang+, ICLR2026]:置換同変にして固定参照視点の依存を排除 • Depth

    Anything 3 [H. Lin+, ICLR2026]:アーキテクチャ・予測タスクの単純化 • MapAnything [N. Keetha+, 3DV2026]:表現を分解し多彩なタスクで学習&推論 • RayZer [H. Jiang+, ICCV2025]:カメラ姿勢・3D教師なしで2D画像だけから学習 N. Keetha+, MapAnything: Universal Feed-Forward Metric 3D Reconstruction, 3DV2026. 83
  60. VGGTを活用した任意視点画像生成 Off The Grid [A. Moreau+, CVPR2026]: カメラ姿勢不要でFeed-Forwardで3DGSを再構成 • デコーダが画像パッチ内の3D

    Gaussianプリミティブを可変割当 • VGGTと組み合わせ,3D アノテーション無しでend-to-endで学習 A. Moreau+, Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splatting, CVPR2026. 84
  61. 動的シーンでのFeed-Forward再構成 静的なシーンのFeed-Forward推定ができるようになった → 動的シーンへの発展 D4RT [C. Zhang+, CVPR2026] を筆頭に,動画からFeed-Forwardで 任意時刻・視点での画像再構成を行う手法が登場

    • いずれも2Dや動画の事前学習済みBackboneの恩恵が大 • 時間表現の保持:Attention,メモリ,Test Time Training Layer,・・・ • 取り出し方(≒教師の与え方): 時系列Pointmap,Tracking,シーンフロー,明示的プリミティブ,・・・ • ネットワーク構成:幾何や時間の構造を活かす vs データと学習 85
  62. Feed-Forwardで時系列3D=4Dシーンに D4RT(Dynamic 4D Reconstruction and Tracking) [C. Zhang+, CVPR2026] •

    動画から任意の時空間点の3D位置をFeed-Forwardでクエリ → 深度・3D tracking・カメラ・4D再構成を統一 • 動画をエンコード → 軽量なデコーダーが任意の時空間点をクエリ C. Zhang+, Efficiently Reconstructing Dynamic Scenes One D4RT at a Time, CVPR2026. 86
  63. Feed-Forward幾何モデルでの4D再構成 4D再構成・新規視点画像生成のバリエーション • MonST3R [J. Zhang+, ICLR2025],MoRe [J. Fang+, CVPR2026]:時刻ごとにPointmap

    • Track4World [J. Lu+, ECCV2026],Flow4R [S. Qian+, ECCV2026]:Scene Flowなど4D表現 • 4DGT [Z. Xu+, NeurIPS2025],DGGT [X. Chen+, CVPR2026]:プリミティブで表現 J. Zhang+, MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion, ICLR2025. 87
  64. Feed-Forward幾何モデルでの4D再構成 4D再構成・新規視点画像生成のバリエーション • MonST3R [J. Zhang+, ICLR2025],MoRe [J. Fang+, CVPR2026]:時刻ごとにPointmap

    • Track4World [J. Lu+, ECCV2026],Flow4R [S. Qian+, ECCV2026]:Scene Flowなど4D表現 • 4DGT [Z. Xu+, NeurIPS2025],DGGT [X. Chen+, CVPR2026]:プリミティブで表現 S. Qian+, Flow4R: Unifying 4D Reconstruction and Tracking with Scene Flow, ECCV2026. 88
  65. Test Time Trainingによるシーンメモリ Test Time Training (TTT) によるシーンの保持により 既存モデルの解釈・Attentionの置き換え・時系列メモリ化 •

    TTT3R [X. Chen+, ICLR2026]:TTTとしてCUT3Rを理解・更新率を変更し性能向上 • VGG-T³ [S. Elflein+, CVPR2026]:TTTをVGGTのGlobal Attention代わりに利用 • tttLRM [C. Wang+, CVPR2026]:TTTをLRMの多視点のAttention代わりに利用 X. Chen+, TTT3R: 3D Reconstruction as Test-Time Training, ICLR2026. C. Wang+, tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction, CVPR2026. 89
  66. 構造 vs データ 幾何を考慮したネットワーク構成にするべきかは引き続き議論がある • MegaSaM [Z. Li+, CVPR2025]:幾何的な制約を活用 •

    深層visual SLAMフレームワーク(DROID-SLAM)と単眼深度推定と組み合わせ,不確かさを考慮した 微分可能バンドル調整として設計 • 頻繁に比較手法として挙げられる • LVSM (Large View Synthesis Model) [H. Jin+, ICLR2025]:構造を削る • 姿勢付きのカメラ入力画像とターゲットの光線群から直接画像を再構成 Z. Li+, MegaSaM: Accurate, Fast, and Robust Structure and Motion from Casual Dynamic Videos, CVPR2025. H. Jin+, LVSM: A Large View Synthesis Model with Minimal 3D Inductive Bias, ICLR2025. 91
  67. 3D再構成タスクでの事前学習 3D再構成を事前学習とみなすことができ,幾何タスクで性能向上 • CroCo [P. Weinzaepfel+, NeurIPS2022] クロスビュー補完というpretext taskを提案,単眼深度推定などの性能を向上 →

    後にDUSt3RなどFeed-Forward 3D再構成につながる • E-RayZer [Q. Zhao+, CVPR2026] 3D 再構成の自己教師だけで,空間タスクのprobingで2D基盤モデルを上回る視覚特徴 Q. Zhao+, E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training, CVPR2026. 92
  68. メカニズムの理解を目指す Feed-Forward 3D再構成モデルはカメラ幾何を捉えているか エピポーラ幾何(基礎行列)が内部表現に現れているかを分析 [J. Bratulić+, arXiv] • 2層MLPで中間層から基礎行列が復元できることを報告 •

    VGGT/DA3 では中間層(12–14 層付近)で誤差が急落,その直前でマッチングが出現 • 一方,多視点で見えていないとVGGTは対応を補完する J. Bratulić+, On Geometric Understanding and Learned Priors in Feed-forward 3D Reconstruction Models, arXiv. 93
  69. アウトライン • 3D表現の発展 • 古典的な3D表現と処理 • Neural Fieldの導入 • 微分可能レンダリング・NeRF/3DGS

    • 変形・4D・物理 • 計測と再構成 • 計測・対応づけ・再構成の学習化 • Feed-Forward 3D再構成 • Feed-Forward 4D再構成 • 生成と接地 • 3D生成モデル • 2D基盤モデルからのマッピング • 言語・LLMと空間理解 94
  70. NeRFをレンダリング・2DでGAN • pi-GAN [E. Chan+, CVPR2021] • 3Dシーン表現としてNeRFを利用・2DにレンダリングしてGANの枠組みで生成 • 潜在変数からRadiance

    Fieldを生成するGeneratorを,微分可能な Volume Renderingを通して敵対的に学習する E. Chan+, pi-GAN: Periodic Implicit Generative Adversarial Networks for 3D-Aware Image Synthesis, CVPR2021. 96
  71. 学習済みの2Dの拡散モデルを利用 • DreamFusion [B. Poole+, ICLR2023] • 画像拡散モデルをpriorとして用いてテキストから3Dを生成 • Score

    Distillation Sampling (SDS) を導入 ランダム視点からNeRFをレンダリング → ノイズを加えて拡散モデルでより良い画像への更新方向を推定 → NeRF パラメータへ逆伝播 B. Poole+, DreamFusion: Text-to-3D using 2D Diffusion, ICLR2023. 97
  72. 学習済みの2Dの拡散モデルを利用 Score Distillation Samplingの後続研究 • ProlificDreamer [Z. Wang+, NeurIPS2023], Score

    Distillation via Reparametrized DDIM [A. Lukoianov+, NeurIPS2024], Noise-free Score Distillation [O. Katzir+, ICLR2024] など:拡散モデルの使い方を改良 して品質向上 • DreamGaussian [J. Tang+, ICLR2024]:3D Gaussian Splatting+SDS A. Lukoianov+, Score Distillation via Reparametrized DDIM, NeurIPS2024. 98
  73. 2Dの拡散モデル+カメラ指示 • 2Dの拡散モデル+カメラ制御.3D表現を陽には持たない • Zero-1-to-3 [R. Liu+, ICCV2023] • 合成データで相対カメラ変換に条件付けて拡散モデルをファインチューニング

    • 視点を制御するメカニズムを外付け • 合成データのみで学習しながらゼロショット汎化 R. Liu+, Zero-1-to-3: Zero-shot One Image to 3D Object, ICCV2023. 99
  74. 一貫性のある多視点画像の生成 • 一貫性のある多視点画像を生成して再構成することで3D生成 • CAT3D [R. Gao+, NeurIPS2024]:多視点生成 → NeRF

    • MVDream [Y. Shi+, ICLR2024]:多視点生成 → Score Distillationのpriorとして使う • InstantMesh [J. Xu+, arXiv]:多視点生成 → triplane → 3Dメッシュ Y. Shi+, MVDream: Multi-view Diffusion for 3D Generation, ICLR2024. 100
  75. 3Dを直接生成 • 自己回帰ベースでの3D生成 • PolyGen [C. Nash+, ICML2020]:生のメッシュ • MeshGPT

    [Y. Siddiqui+, CVPR2024]:トークン化したメッシュ • GaussianGPT [N. von Lützow+, ECCV2026]:グリッドベースでトークン化した3DGS N. von Lützow+, GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation, ECCV2026. 101
  76. 3Dを直接生成 • 各種表現で3Dを直接生成 • Shap-E [H. Jun+, arXiv]:Neural Fieldのパラメータ •

    TRELLIS [J. Xiang+, CVPR2025]:スパースボクセル上の潜在表現+デコード • Hunyuan3D 2.0 [Hunyuan3D Team, arXiv],Seed3D 1.0 [ByteDance Seed, arXiv]: 順序不変なvector set(3DShape2VecSet)+SDF経由で再構成 J. Xiang+, Structured 3D Latents for Scalable and Versatile 3D Generation, CVPR2025. Hunyuan3D Team, Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generation, 102 arXiv.
  77. 生成と再構成 • 3D表現・再構成・生成が発展するにつれて, 3Dシーンの生成と再構成が近づいてきた • 多視点再構成:観測の拘束が強い • 少数視点・単眼再構成:事前分布への依存が増える • Text-to-3D:ほぼ生成事前分布から作る

    • 3D表現や再構成手法は幾何的な一貫性を与える • 観測だけで解が一意に定まらないときは生成が有効 • 再構成:基本は一つの点推定(確率的な手法も存在) • 生成モデル:可能な解の分布を扱う 103
  78. 生成と再構成が融合 生成と再構成は,同じ問題設定の別の側面に思える • Gen3R [J. Huang+, CVPR2026]:動画生成と再構成の同時分布を一つのモデルで扱う • VGGTとVideo Diffusion

    Modelをアダプターでつなぎ,3D生成とFeed-Forward再構成を統一 • 1-view / 2-view条件付き生成,camera条件あり/なし,Feed-Forward再構成を単一モデルで • CUPID [B. Huang+, CVPR2026]:3D生成モデルを使って再構成 • 二段階flow ベース生成で3D構造と2D-3D対応を生成 → PnP → pixel-aligned 特徴を生成過程に挿入 J. Huang+, Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction, CVPR2026. B. Huang+, CUPID: Generative 3D Reconstruction via Joint Object and Pose Modeling, CVPR2026. 104
  79. 言語と3D 3Dデータを言語に対応させる • PointCLIP [R. Zhang+, CVPR2022]:点群→深度画像→CLIP,ゼロショット推定 • ULIP [L.

    Xue+, CVPR2023]:3DエンコーダーでCLIPにアライン • ULIP-2 [L. Xue+, CVPR2024]:ULIP+BLIP-2でのキャプション自動生成 • Uni3D [J. Zhou+, ICLR2024]:3D backboneをViTと同じ構造&初期化にしてスケール R. Zhang+, PointCLIP: Point Cloud Understanding by CLIP, CVPR2022. 106
  80. 言語と3D 3Dデータを言語に対応させる • PointCLIP [R. Zhang+, CVPR2022]:点群→深度画像→CLIP,ゼロショット推定 • ULIP [L.

    Xue+, CVPR2023]:3DエンコーダーでCLIPにアライン • ULIP-2 [L. Xue+, CVPR2024]:ULIP+BLIP-2でのキャプション自動生成 • Uni3D [J. Zhou+, ICLR2024]:3D backboneをViTと同じ構造&初期化にしてスケール L. Xue+, ULIP: Learning a Unified Representation of Language, Images, and Point Clouds for 3D Understanding, CVPR2023. 107 L. Xue+, ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding, CVPR2024.
  81. 言語と3D 3Dデータを言語に対応させる • PointCLIP [R. Zhang+, CVPR2022]:点群→深度画像→CLIP,ゼロショット推定 • ULIP [L.

    Xue+, CVPR2023]:3DエンコーダーでCLIPにアライン • ULIP-2 [L. Xue+, CVPR2024]:ULIP+BLIP-2でのキャプション自動生成 • Uni3D [J. Zhou+, ICLR2024]:3D backboneをViTと同じ構造&初期化にしてスケール J. Zhou+, Uni3D: Exploring Unified 3D Representation at Scale, ICLR2024. 108
  82. 3Dに特徴をマッピング 2Dの特徴量を3Dにマッピングするアプローチ 各種タスクに使える2Dの基盤モデルの特徴量を3Dにマッピングする • DFF [S. Kobayashi+, NeurIPS2022]:NeRF+CLIP-LSeg/DINO • LERF

    [J. Kerr+, ICCV2023]:NeRF+マルチスケールCLIP • LangSplat [M. Qin+, CVPR2024]:3DGS+CLIP(+SAMセグメンテーション) J. Kerr+, LERF: Language Embedded Radiance Fields, ICCV2023. 109
  83. 3Dに特徴をマッピング(Feed-Forward) シーンごとの最適化から,Feed-Forwardで特徴量を含めた推論に • OpenScene [S. Peng+, CVPR2023]:点群 → オープン語彙セグメンテーション •

    Large Spatial Model [Z. Fan+, NeurIPS2024]:画像 → 3DGS+セマンティック特徴量 S. Peng+, OpenScene: 3D Scene Understanding with Open Vocabularies, CVPR2023. Z. Fan+, Large Spatial Model: End-to-end Unposed Images to Semantic 3D, NeurIPS2024. 110
  84. 3D-QAによるシーン理解の評価 3D-QA(3D Question Answering)タスク [D. Azuma+, CVPR2022] • 入力はRGB-Dスキャンから再構成された屋内シーン全体の点群と, そのシーンに関する自由形式の質問

    • モデルは回答と,質問が指す物体の3D bounding boxを同時に出力 • 3D-QAベースラインモデルScanQAを提案 D. Azuma+, ScanQA: 3D Question Answering for Spatial Scene Understanding, CVPR2022. 111
  85. LLMと3Dシーン理解の接続 3Dに紐付いたトークン・情報をLLMに渡してシーン理解 • 3D-LLM [Y. Hong+, NeurIPS2023]:多視点レンダリング+2D VLM+位置トークン • GPT4Scene

    [Z. Qi+, ICLR2026]:Video→BEV+位置対応マーカー,3Dなし • Spatial-MLLM [D. Wu+, NeurIPS2025]:言語特徴量+VGGT特徴量+追加学習 Y. Hong+, 3D-LLM: Injecting the 3D World into Large Language Models, NeurIPS2023. 112
  86. 強化学習を適用して性能向上 LLMに強化学習を入れると性能向上 3Dの場合は自己教師の信号が作りやすく,様々なアプローチが登場 • SpaceR [K. Ouyang+, arXiv] • RLVR

    (Reinforcement Learning with Verifiable Reward) のパラダイムを video spatial reasoningに • Spatial-SSRL [Y. Liu+, CVPR2026] • 2D/3D構造の内在的整合性で,追加アノテーションなしに空間理解を教師できる • Spatial-SSRL は RGB-D 入力のみから 5 つの pretext task を自動構成 • DR-MV3D [J. Choi+, ECCV2026] • マップ・視点計画・回答を分離, VGGT+SAM3で中間段階に教師信号 K. Ouyang+, SpaceR: Reinforcing MLLMs in Video Spatial Reasoning, arXiv. Y. Liu+, Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning, CVPR2026. 113 J. Choi+, Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views, ECCV2026.
  87. まとめ • 3Dコンピュータビジョンは計測・表現・処理・生成が融合 • さらに多くの要素とも接続・融合 • 動画,言語,モーション,音声,etc… • 常にいくつかの軸で揺れながら発展している •

    表現:離散 vs 連続 • 幾何の整合性:陽なモデリング vs データから獲得 • 決定的な再構成 vs 不確かさの考慮・生成 • 触れられなかった事項 • 実タスク,in-the-wild,SLAM,逆レンダリング,3D編集,動画との接続, 圧縮・ストリーミング.モーション,データセット,他分野応用,・・・ 114
  88. 参考文献 3D表現の発展 古典的な3D表現と処理 D. Maturana+, VoxNet: A 3D Convolutional Neural

    Network for real-time object recognition, IROS2015. G. Riegler+, OctNet: Learning Deep 3D Representations at High Resolutions, CVPR2017. P.-S. Wang+, O-CNN: Octree-based Convolutional Neural Networks for 3D Shape Analysis, SIGGRAPH2017. B. Graham+, 3D Semantic Segmentation with Submanifold Sparse Convolutional Networks, CVPR2018. C. Choy+, 4D Spatio-Temporal ConvNets: Minkowski Convolutional Neural Networks, CVPR2019. C. R. Qi+, PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation, CVPR2017. M. Zaheer+, Deep Sets, NIPS2017. H. Thomas+, KPConv: Flexible and Deformable Convolution for Point Clouds, ICCV2019. Y. Wang+, Dynamic Graph CNN for Learning on Point Clouds, ToG (2019). X. Wu+, Point Transformer V3: Simpler, Faster, Stronger, CVPR2024. J. Masci+, Geodesic convolutional neural networks on Riemannian manifolds, ICCV2015-WS. R. Hanocka+, MeshCNN: A Network with an Edge, SIGGRAPH2019. N. Sharp+, DiffusionNet: Discretization Agnostic Learning on Surfaces, SIGGRAPH2022. J. Brehmer+, Does equivariance matter at scale?, TMLR (2025). S. Vadgama+, Probing Equivariance and Symmetry Breaking in Convolutional Networks, NeurIPS2025. V. Blanz+, A Morphable Model For The Synthesis Of 3D Faces, SIGGRAPH1999. T. Li+, Learning a model of facial shape and expression from 4D scans, SIGGRAPH Asia2017. M. Loper+, SMPL: A Skinned Multi-Person Linear Model, SIGGRAPH Asia2015. J. Romero+, Embodied Hands: Modeling and Capturing Hands and Bodies Together, SIGGRAPH Asia2017. G. Pavlakos+, Expressive Body Capture: 3D Hands, Face, and Body from a Single Image, CVPR2019. 115
  89. 参考文献 3D表現の発展 Neural Field J. J. Park+, DeepSDF: Learning Continuous

    Signed Distance Functions for Shape Representation, CVPR2019. L. Mescheder+, Occupancy Networks: Learning 3D Reconstruction in Function Space, CVPR2019 Z. Chen+, Learning Implicit Fields for Generative Shape Modeling, CVPR2019 A. Gropp+, Implicit Geometric Regularization for Learning Shapes, ICML2020. M. M. Loper+, OpenDR: An Approximate Differentiable Renderer, ECCV2014. H. Kato+, Neural 3D Mesh Renderer, CVPR2018. S. Liu+, Soft Rasterizer: A Differentiable Renderer for Image-based 3D Reasoning, ICCV2019. B. Mildenhall+, NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis, ECCV2020. P. Wang+, NeuS: Learning Neural Implicit Surfaces by Volume Rendering for Multi-view Reconstruction, NeurIPS2021. L. Yariv+, Volume Rendering of Neural Implicit Surfaces, NeurIPS2021. C. Reiser+, KiloNeRF: Speeding up Neural Radiance Fields with Thousands of Tiny MLPs, ICCV2021. S. J. Garbin+, FastNeRF: High-Fidelity Neural Rendering at 200FPS, ICCV2021. L. Liu+, Neural Sparse Voxel Fields, NeurIPS2020. P. Hedman+, Baking Neural Radiance Fields for Real-Time View Synthesis, ICCV2021. C. Sun+, Direct Voxel Grid Optimization: Super-fast Convergence for Radiance Fields Reconstruction, CVPR2022. S. Fridovich-Keil+, Plenoxels: Radiance Fields without Neural Networks, CVPR2022. T. Takikawa+, Neural Geometric Level of Detail: Real-time Rendering with Implicit 3D Surfaces, CVPR2021. A. Yu+, PlenOctrees for Real-time Rendering of Neural Radiance Fields, ICCV2021. T. Müller+, Instant Neural Graphics Primitives with a Multiresolution Hash Encoding, SIGGRAPH2022. T. Takikawa+, Variable Bitrate Neural Fields, SIGGRAPH2022. E. R. Chan+, Efficient Geometry-aware 3D Generative Adversarial Networks, CVPR2022. A. Chen+, TensoRF: Tensorial Radiance Fields, ECCV2022. J. T. Barron+, Mip-NeRF: A Multiscale Representation for Anti-Aliasing Neural Radiance Fields, ICCV2021. J. T. Barron+, Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields, CVPR2022. J. T. Barron+, Zip-NeRF: Anti-Aliased Grid-Based Neural Radiance Fields, ICCV2023. 116
  90. 参考文献 3D表現の発展 3DGS B. Kerbl+, 3D Gaussian Splatting for Real-Time

    Radiance Field Rendering, SIGGRAPH2023. A. Guédon+, SuGaR: Surface-Aligned Gaussian Splatting for Efficient 3D Mesh Reconstruction and High-Quality Mesh Rendering, CVPR2024. B. Huang+, 2D Gaussian Splatting for Geometrically Accurate Radiance Fields, SIGGRAPH2024. Z. Yu+, Mip-Splatting: Alias-free 3D Gaussian Splatting, CVPR2024. Y. Chen+, HAC: Hash-grid Assisted Context for 3D Gaussian Splatting Compression, ECCV2024. S. Kheradmand+, 3D Gaussian Splatting as Markov Chain Monte Carlo, NeurIPS2024. J. Held+, Triangle Splatting for Real-Time Radiance Field Rendering, 3DV2026. J. Held+, MeshSplatting: Differentiable Rendering with Opaque Meshes, CVPR2026. J. Held+, 3D Convex Splatting: Radiance Field Rendering with 3D Smooth Convexes, CVPR2025. Q. Wu+, 3DGUT: Enabling Distorted Cameras and Secondary Rays in Gaussian Splatting, CVPR2025. T. Lu+, Scaffold-GS: Structured 3D Gaussians for View-Adaptive Rendering, CVPR2024. H. Watanabe+, Neural Gabor Splatting: Enhanced Gaussian Splatting with Neural Gabor for High-frequency Surface Reconstruction, CVPR2026. A. Ganeshan+, Residual Primitive Fitting of 3D Shapes with SuperFrusta, CVPR2026. K. Zhang+, NeRF++: Analyzing and Improving Neural Radiance Fields, arXiv. 117
  91. 参考文献 3D表現の発展 変形・4D・物理 A. Pumarola+, D-NeRF: Neural Radiance Fields for

    Dynamic Scenes, CVPR2021. K. Park+, Nerfies: Deformable Neural Radiance Fields, ICCV2021. A. Cao+, HexPlane: A Fast Representation for Dynamic Scenes, CVPR2023. J. Luiten+, Dynamic 3D Gaussians: Tracking by Persistent Dynamic View Synthesis, 3DV2024. G. Wu+, 4D Gaussian Splatting for Real-Time Dynamic Scene Rendering, CVPR2024. Z. Yang+, Real-time Photorealistic Dynamic Scene Representation and Rendering with 4D Gaussian Splatting, ICLR2024. J. Ost+, Neural Scene Graphs for Dynamic Scenes, CVPR2021. X. Li+, PAC-NeRF: Physics Augmented Continuum Neural Radiance Fields for Geometry-Agnostic System Identification, ICLR2023. T. Xie+, PhysGaussian: Physics-Integrated 3D Gaussians for Generative Dynamics, CVPR2024. T. Zhang+, PhysDreamer: Physics-Based Interaction with 3D Objects via Video Generation, ECCV2024. S. Peng+, Neural Body: Implicit Neural Representations with Structured Latent Codes for Novel View Synthesis of Dynamic Humans, CVPR2021. C.-Y. Weng+, HumanNeRF: Free-viewpoint Rendering of Moving People from Monocular Video, CVPR2022. S. Qian+, GaussianAvatars: Photorealistic Head Avatars with Rigged 3D Gaussians, CVPR2024. Z. Li+, Animatable Gaussians: Learning Pose-dependent Gaussian Maps for High-fidelity Human Avatar Modeling, CVPR2024,及び後拡張版がarXivに掲載. 表現のデータ化 E. Dupont+, From data to functa: Your data point is a function and you can treat it like one, ICML2022. Q. Ma+, ShapeSplat: A Large-scale Dataset of Gaussian Splats and Their Self-Supervised Pretraining, 3DV2025. 118
  92. 参考文献 計測と再構成 計測・対応づけ・再構成の学習化 A. Shandilya+, Neural Fields for Structured Lighting,

    ICCV2023. J. Chang+, Deep Optics for Monocular Depth Estimation and 3D Object Detection, ICCV2019. S. Feng+, Fringe pattern analysis using deep learning, Advanced Photonics (2019). Y. Li+, Deep-learning-enabled dual-frequency composite fringe projection profilometry for single-shot absolute 3D shape measurement, OEA (2022). B. Wang+, Single-shot super-resolved fringe projection profilometry (SSSR-FPP): 100,000 frames-per-second 3D imaging with deep learning, Light: Science & Applications (2025) A. Haroon+, Diagnosing and Repairing Shape-Prior Shortcuts in Long-Range Single-Shot Fringe Projection Profilometry, arXiv. J. Žbontar+, Stereo Matching by Training a Convolutional Neural Network to Compare Image Patches, JMLR (2016). A. Kendall+, End-to-End Learning of Geometry and Context for Deep Stereo Regression, ICCV2017. Y. Yao+, MVSNet: Depth Inference for Unstructured Multi-view Stereo, ECCV2018. R. Ranftl+, Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer, TPAMI(2022). L. Yang+, Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data, CVPR2024. L. Yang+, Depth Anything V2, NeurIPS2024. B. Ke+, Repurposing Diffusion-Based Image Generators for Monocular Depth Estimation, CVPR2024. Feed-Forwardモデル A. Yu+, pixelNeRF: Neural Radiance Fields from One or Few Images, CVPR2021. D. Charatan+, pixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable 3D Reconstruction, CVPR2024. Y. Chen+, MVSplat: Efficient 3D Gaussian Splatting from Sparse Multi-View Images, ECCV2024. Y. Hong+, LRM: Large Reconstruction Model for Single Image to 3D, ICLR2024. M. S. M. Sajjadi+, Scene Representation Transformer: Geometry-Free Novel View Synthesis Through Set-Latent Scene Representations, CVPR2022. S. Wang+, DUSt3R: Geometric 3D Vision Made Easy, CVPR2024. V. Leroy+, Grounding Image Matching in 3D with MASt3R, ECCV2024. J. Yang+, Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass, CVPR2025. Q. Wang+, Continuous 3D Perception Model with Persistent State, CVPR2025. 119
  93. 参考文献 計測と再構成 Feed-Forwardモデル(続き) Y. Wang+, 𝜋𝜋³: Permutation-Equivariant Visual Geometry Learning,

    ICLR2026. H. Lin+, Depth Anything 3: Recovering the Visual Space from Any Views, ICLR2026. N. Keetha+, MapAnything: Universal Feed-Forward Metric 3D Reconstruction, 3DV2026. H. Jiang+, RayZer: A Self-supervised Large View Synthesis Model, ICCV2025. A. Moreau+, Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splatting, CVPR2026. C. Zhang+, Efficiently Reconstructing Dynamic Scenes One D4RT at a Time, CVPR2026. J. Zhang+, MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion, ICLR2025. J. Fang+, MoRe: Motion-aware Feed-forward 4D Reconstruction Transformer, CVPR2026. J. Lu+, Track4World: Feedforward World-centric Dense 3D Tracking of All Pixels, ECCV2026. S. Qian+, Flow4R: Unifying 4D Reconstruction and Tracking with Scene Flow, ECCV2026. Z.Xu+, 4DGT: Learning a 4D Gaussian Transformer Using Real-World Monocular Videos, NeurIPS2025. X. Wang+, RetimeGS: Continuous-Time Reconstruction of 4D Gaussian Splatting, CVPR2026. X. Chen+, DGGT: Feedforward 4D Reconstruction of Dynamic Driving Scenes using Unposed Images, CVPR2026. X. Chen+, TTT3R: 3D Reconstruction as Test-Time Training, ICLR2026. S. Elflein+, VGG-T^3: Offline Feed-Forward 3D Reconstruction at Scale, CVPR2026. C. Wang+, tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction, CVPR2026. Z. Li+, MegaSaM: Accurate, Fast, and Robust Structure and Motion from Casual Dynamic Videos, CVPR2025. H. Jin+, LVSM: A Large View Synthesis Model with Minimal 3D Inductive Bias, ICLR2025. P. Weinzaepfel+, CroCo: Self-Supervised Pre-training for 3D Vision Tasks by Cross-View Completion, NeurIPS2022. Q. Zhao+, E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training, CVPR2026. J. Bratulić+, On Geometric Understanding and Learned Priors in Feed-forward 3D Reconstruction Models, arXiv. 120
  94. 参考文献 生成と接地 3D生成モデル E. Chan+, pi-GAN: Periodic Implicit Generative Adversarial

    Networks for 3D-Aware Image Synthesis, CVPR2021. B. Poole+, DreamFusion: Text-to-3D using 2D Diffusion, ICLR2023. Z. Wang+, ProlificDreamer: High-Fidelity and Diverse Text-to-3D Generation with Variational Score Distillation, NeurIPS2023. T. H. Nguyen+, SwiftBrush: One-Step Text-to-Image Diffusion Model with Variational Score Distillation, CVPR2024. A. Lukoianov+, Score Distillation via Reparametrized DDIM, NeurIPS2024. O. Katzir+, Noise-Free Score Distillation, ICLR2024. J. Tang+, DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation, ICLR2024. R. Liu+, Zero-1-to-3: Zero-shot One Image to 3D Object, ICCV2023. R. Gao+, CAT3D: Create Anything in 3D with Multi-View Diffusion Models, NeurIPS2024. Y. Shi+, MVDream: Multi-view Diffusion for 3D Generation, ICLR2024. J. Xu+, InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models, arXiv. H. Jun+, Shap-E: Generating Conditional 3D Implicit Functions, arXiv. J. Xiang+, Structured 3D Latents for Scalable and Versatile 3D Generation, CVPR2025. Hunyuan3D Team, Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generation, arXiv. ByteDance Seed, Seed3D 1.0: From Images to High-Fidelity Simulation-Ready 3D Assets, arXiv. C. Nash+, PolyGen: An Autoregressive Generative Model of 3D Meshes, ICML2020. Y. Siddiqui+, MeshGPT: Generating Triangle Meshes with Decoder-Only Transformers, CVPR2024. N. von Lützow+, GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation, ECCV2026. J. Huang+, Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction, CVPR2026. B. Huang+, CUPID: Generative 3D Reconstruction via Joint Object and Pose Modeling, CVPR2026. 121
  95. 参考文献 生成と接地 言語・タスクとの接続 R. Zhang+, PointCLIP: Point Cloud Understanding by

    CLIP, CVPR2022. L. Xue+, ULIP: Learning a Unified Representation of Language, Images, and Point Clouds for 3D Understanding, CVPR2023. L. Xue+, ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding, CVPR2024. J. Zhou+, Uni3D: Exploring Unified 3D Representation at Scale, ICLR2024. S. Kobayashi+, Decomposing NeRF for Editing via Feature Field Distillation, NeurIPS2022. J. Kerr+, LERF: Language Embedded Radiance Fields, ICCV2023. M. Qin+, LangSplat: 3D Language Gaussian Splatting, CVPR2024. S. Peng+, OpenScene: 3D Scene Understanding with Open Vocabularies, CVPR2023. Z. Fan+, Large Spatial Model: End-to-end Unposed Images to Semantic 3D, NeurIPS2024. D. Azuma+, ScanQA: 3D Question Answering for Spatial Scene Understanding, CVPR2022. Y. Hong+, 3D-LLM: Injecting the 3D World into Large Language Models, NeurIPS2023. Z. Qi+, GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models, ICLR2026. D. Wu+, Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence, NeurIPS2025. K. Ouyang+, SpaceR: Reinforcing MLLMs in Video Spatial Reasoning, arXiv. Y. Liu+, Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning, CVPR2026. J. Choi+, Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views, ECCV2026. 122