Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Deep Directed Generative Models with Energy-bas...
Search
Daisuke Yoneoka
November 14, 2023
Research
77
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Deep Directed Generative Models with Energy-based Probability Estimation
Daisuke Yoneoka
November 14, 2023
More Decks by Daisuke Yoneoka
See All by Daisuke Yoneoka
感染症の数理モデル15
kingqwert
0
120
感染症の数理モデル14
kingqwert
0
170
感染症の数理モデル13
kingqwert
0
84
感染症の数理モデル12
kingqwert
0
150
感染症の数理モデル11
kingqwert
0
170
感染症の数理セミナー_10_.pdf
kingqwert
0
180
感染症の数理モデル9
kingqwert
0
140
感染症の数理モデル8
kingqwert
0
150
感染症の数理モデル7
kingqwert
0
140
Other Decks in Research
See All in Research
Pretrain Where? Investigating How Pretraining Data Diversity Impacts Geospatial Foundation Model Performance
satai
3
130
【ローカルAIに向き合う展示会vol.2】液体時間定数型モジュールを用いた オリジナルの双方向エンコーダーモデルNexteraBERT 推論速度向上検討並びにダウンストリーム評価
rikkabotan7
0
190
Google Cloud Next 2026 DM Recap Agentic Data Cloudを添えて / Google Cloud Next 2026 DM Recap
nnaka2992
0
130
最先端NLP 2026 論文紹介: Wait, Wait, Wait... Why Do Reasoning Models Loop? / SNLP Paper Review: Wait, Wait, Wait... Why Do Reasoning Models Loop?
tkng
0
220
MM-OVSeg: Multimodal Optical–SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing
satai
3
130
[SNLP2026] Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
wataruuuuu
0
300
Cross-Media Human-Information Interaction
signer
PRO
0
230
SAM3を用いたコマ・吹き出しの 領域検出と分割構造からの読み順推定
kzmssk
0
120
データサイエンティストの就労意識~2015 → 2026 一般(個人)会員アンケートより
datascientistsociety
PRO
0
770
The story of RefactoringMiner. Slow research, long-term impact
tsantalis
0
150
SOTAのさらに先へ:厳しい推論制約下での高性能モデルのPost-Training
analokmaus
0
1.5k
JICA QUEST 共創×革新プログラム Impact Report(海ノ向こうコーヒー)
ontheslope
0
550
Featured
See All Featured
jQuery: Nuts, Bolts and Bling
dougneiner
66
8.6k
Build your cross-platform service in a week with App Engine
jlugia
234
19k
Building Better People: How to give real-time feedback that sticks.
wjessup
370
20k
Gemini Prompt Engineering: Practical Techniques for Tangible AI Outcomes
mfonobong
2
520
Refactoring Trust on Your Teams (GOTO; Chicago 2020)
rmw
35
3.8k
Performance Is Good for Brains [We Love Speed 2024]
tammyeverts
12
1.8k
The Organizational Zoo: Understanding Human Behavior Agility Through Metaphoric Constructive Conversations (based on the works of Arthur Shelley, Ph.D)
kimpetersen
PRO
0
440
Code Reviewing Like a Champion
maltzj
528
40k
AI in Enterprises - Java and Open Source to the Rescue
ivargrimstad
0
1.5k
How to build an LLM SEO readiness audit: a practical framework
nmsamuel
1
890
Measuring & Analyzing Core Web Vitals
bluesmoon
9
990
Music & Morning Musume
bryan
47
7.4k
Transcript
Deep Directed Generative Models with Energy-Based Probability Estimation 米岡 大輔
概要 • 世にはenergy functionを用いて生成プロセスを定義するモデル(生成モデ ル)が沢山ある • しかし,それらは一般的に分配関数の計算が難しい • MCMCなどの方法があるが,それも時間やコストがかかる •
GANのアイディアを援用し,classifierと同時にenergy functionをdeep learningで学習することで,MCMCを使わない方法を提案
Introduction • LeCun(1998)は画像分類において,予測誤差最小の基準 の代わ りにエネルギー関数 を定義すること提案 – エネルギーの大小とrandom variableを結びつけて考えることができる –
Boltzmann machine, Restricted Boltzmann machine, Hopfield modelなんかを 同一の枠組みで捉えられる • しかし,エネルギーを用いたモデルの最尤法は分配関数の計算が困難 – ガウス分布やベルヌーイ分布などの単純な分布を使う – MCMCを使う • 多峰すぎると困難
提案手法の概要 • MCMCの計算を避けるため(というか,分配関数の陽な計算を避ける ため)に以下(の2つの見方)を導入 • エネルギー関数 – 尤度関数(の勾配)をサンプルにより経験的に学習 – マルコフ連鎖からのサンプルではなく,生成モデルからのサンプルと
考 える • 生成関数 (generator) – GANと同じような枠組みで学習 • Discriminator (識別関数)がエネルギー関数としてみなせる • Low energy = real data • High energy = fake data – Discriminatorはエネルギー関数なので勾配も計算可能
Energy-Based model • 低いエネルギーほど確率としては起こりやすい • Product of Experts (PoE) –
ボルツマン分布(ギブス分布とも呼ばれる) – Expertsは • エネルギーを最適化するということは,分配関数を考えなくても良い ということ
GANのアイディア • まずはなんかすごい画像を見てください • Deep Convolutional GAN [Randford+, ‘16]
GANのイメージ 画像が本物か偽 物か識別 Discriminator (正確に識別し たい) Generator (本物に近い絵 を作りたい) 絵を生成
騙せ たか な? 識別 生成 識別,生成を交互に学習 して精度向上
Learning and Intractability • 真の(データ)分布 に近づけるように を訓練する • KLの最小化 = 尤度の最大化 • Loss関数:
• Empiricalに(6)を計算しようとすると,勾配は で定義される(∵ ) 真の分布による期待値をサン プル平均で置き換えることに より近似可能 計算困難でMCMC(他には平均場近似法やコン トラスティブダイバージェンス法)など使う →ここをneural netにしよう 勾配の update rule
Training models as a classification problem • [Bengio, ’09] [Hinton,
’99] は前スライドの勾配のupdate ruleはclassifierの 学習である,と提案 • yを用意して • Classifierはシグモイド関数σを用いて • 簡単のために • Ψの学習は ←(7)と同じupdate ruleに なる
Proposed model • Energy-based probabilistic model • エネルギー関数と生成関数(generator)という2つの視点 – 両者は同じになってほしいが,実際は交互に訓練
• 1st step: • 2nd step: • 最終的には ここをNeural net (Deep generative model)で推定 ここが一致するように訓練
Deep Energy model • Rule (7)と(9)でDeep energy modelを訓練 • (7)のnegative
phaseをdeep generative modelからのサンプルで代用
Deep Generative model • このモデルの目的 1. 効率的(non-iterative)なサンプルの生成 2. Deep energy
modelのnegative phaseを近似するためのサンプル生成 • サンプル生成は普通の伝承サンプル 1. からzをサンプル 2. zを (deep generative model)に放り込んで変換 3. で を構成 • KLを最小化することでモデル を訓練 – 第一項 – 第二項 Back-propagationで計算可能らしい ↓正則化項(エントロピー)として働く ↑Batch処理にしている
Relation to GAN • GANはdiscriminatorとgeneratorという2つのモデルを同時に訓練すると いうアイディア • 今回はdiscriminatorがenergy-functionであるモデルを提案 • 相違点
– GANのdiscriminatorはconstant outputに収束しがち • 結果として,どんなinputを入力しても,D=0.5を出しがち – GANは最初の方にどのような学習をしていたかを記憶していない – 提案手法はdiscriminatorはサンプルがtraining dataから来たものなのか,それ ともこれまでのgeneratorのいずれかから来たものなのかを判定する • GANのdiscriminatorはサンプルがtrainingか今現在のgeneratorから来たものなのか を判定する • 結果として,GANのdiscriminatorはtrivialな判別器を作ってしまいがちだが,提 案手法はこれを避けられる