Upgrade to Pro — share decks privately, control downloads, hide ads and more …

【ECCV2026:Genception】映像生成に秘められた力

Avatar for 小島瑞貴 小島瑞貴
October 07, 2026
100

 【ECCV2026:Genception】映像生成に秘められた力

Avatar for 小島瑞貴

小島瑞貴

October 07, 2026

More Decks by 小島瑞貴

Transcript

  1. 論文情報 Genception: Video Generation Models are General-Purpose Vision Learners Letian

    Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu % 3
  2. まとめ ★論文名: Genception: Video Generation Models areGeneral-Purpose Vision Learners ★目的:

    言語のような,汎用的な視覚基盤モデルを作りたい ★言語側の学習: ❶事前学習❷ファインチューニング❸選好最適化 ★視覚モデルに必要な要件: ❶時空間理解 ❷ 言語との接続 ❸スケール可能性 ★Genception(本提案手法): ❶映像拡散モデルで事前学習 ❷様々な下流タスクで事後学習 ★下流タスク: 奥行き・法線・キーポイント・カメラ姿勢などなど ★事後学習のやりかた: ❶ノイズなし1ステップ出力❷言語でタスク指示 ★評価: すべてのタスクで(ほとんど)最高性能