Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
[論文紹介] Masked World Models for Visual Control
Search
tt1717
October 25, 2023
Research
75
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[論文紹介] Masked World Models for Visual Control
PDFファイルをダウンロードすると,スライド内のリンクを見ることができます.
tt1717
October 25, 2023
More Decks by tt1717
See All by tt1717
[勉強会] Decision Transformer
tt1717
0
83
[論文サーベイ] Survey on Google DeepMind’s Game AI 2
tt1717
0
65
[論文サーベイ] Survey on Google DeepMind’s Game AI
tt1717
0
52
[論文サーベイ] Survey on VLM for Video Game Quality Assurance
tt1717
0
53
[論文サーベイ] Survey on Pokemon AI 3
tt1717
0
92
[論文サーベイ] Survey on Pokemon AI 2
tt1717
0
91
[論文サーベイ] Survey on Pokemon AI
tt1717
0
130
[論文サーベイ] Survey on Minecraft AI in NeurIPS 2024
tt1717
0
150
[論文サーベイ] Survey on GPT for Games
tt1717
0
99
Other Decks in Research
See All in Research
COMETAを用いたデータ民主化運動の歴史
sazimai
0
130
羽田新ルート運用6年の検証
1manken
0
180
東京大学工学部計数工学科、計数工学特別講義の説明資料
kikuzo
0
580
[Fishers] DIVER OSINT CTF 2026 特化AIエージェントハーネスで挑戦するOSINT CTF
analokmaus
0
350
「AIとWhyを深堀る」をAIと深堀る
iflection
0
530
National high-resolution cropland classification of Japan with agricultural census information and multi-temporal multi-modality datasets
satai
3
390
研究室単位での自律的 IPv6接続性確立に向けたAS共同運用モデルの提案と実証
reokashiwa
PRO
0
170
GLIM とMegaParticles:正規分布近似の限界とタイトカップリング&パーティクルフィルタの進展 / GLIM and MegaParticles : Progress of the distribution representation in SLAM
koide3
0
630
【中間報告】国会議員の立法・政策実務を支える環境を巡る現状と課題
polipoli
0
360
Dual Quadric表現を用いた動的物体追跡とRGB-D・IMU制約の密結合によるオドメトリ推定
nanoshimarobot
0
460
LA-Bench 2025:実験指示から実行可能手順を生成するためのデータセット/LA-Bench 2025: A Dataset for Generating Executable Experimental Procedures from Experimental Instructions
stktu
0
110
Apache Gravitinoで実現する Icebergカタログ統合とアクセスの一元化
matsumooon
0
370
Featured
See All Featured
The Cost Of JavaScript in 2023
addyosmani
55
10k
The Organizational Zoo: Understanding Human Behavior Agility Through Metaphoric Constructive Conversations (based on the works of Arthur Shelley, Ph.D)
kimpetersen
PRO
0
390
Mind Mapping
helmedeiros
PRO
1
290
A designer walks into a library…
pauljervisheath
211
24k
Building the Perfect Custom Keyboard
takai
2
820
Game over? The fight for quality and originality in the time of robots
wayneb77
1
230
State of Search Keynote: SEO is Dead Long Live SEO
ryanjones
0
230
Optimizing for Happiness
mojombo
378
71k
DevOps and Value Stream Thinking: Enabling flow, efficiency and business value
helenjbeal
1
270
Avoiding the “Bad Training, Faster” Trap in the Age of AI
tmiket
0
200
A Modern Web Designer's Workflow
chriscoyier
698
190k
[RailsConf 2023] Rails as a piece of cake
palkan
59
6.8k
Transcript
どんなもの? 先行研究と比べて何がすごい? 技術の手法や肝は? どうやって有効だと検証した? ・報酬の予測によりタスクに適した表現を獲得 ・DreamerV2と比較して小さな物体を扱うタスクで大幅に性能改善 ・Meta-world,RLBench,DeepMind Control Suiteの環境で実験 ・特徴マスキング,マスキング比率,報酬予測に対してアブレー
ションスタディを実施 ・DreamerV2とMWMで予測画像を比較 ・MWM (Masked World Models) 1.畳み込み特徴マスキングと報酬予測によるAEの学習 2.AEから視覚表現を予測する潜在的ダイナミクスモデル学習を繰り 返し,「視覚表現」と「ダイナミクス」を別々に更新 3.「環境との相互作用から収集したサンプル」を用いて,AEと潜在 的なダイナミクスモデルを継続的に更新 ・世界モデルの画像表現学習に,「MAE」を使用 ・報酬の予測によりタスクに適した表現を獲得 Masked World Models for Visual Control (CoRL 2022) Younggyo Seo,Danijar Hafner,Hao Liu,Fangchen Liu,Stephen James,Kimin Lee,Pieter Abbeel https://arxiv.org/abs/2206.14244 2023/06/18 論文を表す画像 被引用数:19 1/10
背景:物体消失問題 ❏ 画像表現学習とタスクのギャップ ❏ 単純に再構成誤差でAEを学習し てもタスクに適した表現が得られ ない ❏ VAEのような再構成学習では面積 の小さい要素は無視してもLossが
下がる ❏ 一方で,タスクに必要なのは対象 物体の位置などの一部の情報 ❏ 学習コストの問題 ❏ 画像モデルと状態遷移モデルを同 時に学習すると,高次元データと なり計算量が増大 2/10 出典:https://arxiv.org/abs/2203.00494
Masked Autoencoder (MAE) ❏ パッチに分割された画像の75%を マスクしてViTに入力 ❏ 損失関数 ❏ マスクされたパッチの再構成誤差
(MSE) ❏ 画像分類タスクで高精度を達成 3/10 出典:https://arxiv.org/abs/2111.06377
Masked World Models (MWM) 4/10 ❏ 画像直接ではなく,中間層でマスキング(物体消失を防ぐ) ❏ パッチ内の細かいディテールを学習することが困難な場合がある ❏
再構成に加え報酬予測(報酬にかかわる情報を重視させる)
実験 5/10 ❏ Meta-world ❏ RLBench ❏ DeepMind Control Suite
結果 6/10 ❏ 性能・サンプル効率ともにDreamerV2から改善 ❏ Pick Placeタスクの小さな物体が重要なタスクでは差が顕著 ❏ Quadruped Walkタスクの小さな物体のないタスクでは同等程度
小さな物体を 扱うタスク 小さな物体を扱わ ないタスク
結果:Ablation Studies 7/10 画像直接ではなく特徴量 マスクで性能向上 75%のマスクで最高性能 報酬予測で性能向上 ❏ 特徴量マスク+マスク比率75%+報酬予測で最高性能
結果:予測画像比較 8/10 ❏ DreamerV2と比較してMWMは物体位置を予測できている 物体位置把 握 物体消失
まとめ 9/10 ❏ 世界モデルの画像表現学習にMAEを使用 ❏ 画像直接ではなく中間層でマスキング ❏ 報酬予測によりタスクに適した表現を獲得 ❏ DreamerV2と比較して小さな物体を扱うタスクで大幅に性能改善
参考文献 ❏ 松尾研究室スライド ❏ googleサイト 10/10