Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Reinforcement Learning Second edition - Notes o...
Search
Sponsored
·
SiteGround - Reliable hosting with speed, security, and support you can count on.
→
Etsuji Nakai
December 05, 2019
Technology
130
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Reinforcement Learning Second edition - Notes on Chapter 6
Etsuji Nakai
December 05, 2019
More Decks by Etsuji Nakai
See All by Etsuji Nakai
強化学習「理論」入門
enakai00
3
3.6k
生成 AI の基礎 〜 サンプル実装で学ぶ基本原理
enakai00
7
4.7k
機械学習理論入門
enakai00
0
44
ディープラーニング入門
enakai00
0
30
ハミルトン・ヤコビ方程式の解の性質と物理的意味
enakai00
0
900
Agent Development Kit によるエージェント開発入門
enakai00
23
9.2k
GDG Tokyo 生成 AI 論文をわいわい読む会
enakai00
1
710
量子コンピューティングの開発課題と実用化へのロードマップ
enakai00
1
75
Lecture course on Microservices : Part 1
enakai00
1
3.8k
Other Decks in Technology
See All in Technology
サーバー常駐型の 簡易障害調査AI エージェントを作ってみた話
masayoshi
1
520
KAEN Company Deck
kaen
PRO
0
260
「重なり」は迎える側がつくる ― 人もAIエージェントも歓迎するプロダクトエンジニアリング ―
go0517go
PRO
0
150
本番に近いテストをもっと手軽に - Postmanで広がるAPIテストの世界 / Expanding the World of API Testing with Postman
yokawasa
1
220
いま、生成AIにKaggleをどこまで 任せられるか — ROGIIコンペでの進め方とTips
k951286
2
1.2k
[RSJ26] Flow as Flow: Modeling Robot Velocity Fields as Probability Velocity Fields
keio_smilab
PRO
0
180
Continuous Delivery! It is not what you think it is
tdpauw
0
180
Jetpack Compose で挑む新聞紙面UI ─ 複合ジェスチャー・ポリゴン記事領域・適応的ページ構成という3つの壁/droidkaigi2026
nikkei_engineer_recruiting
0
150
[RSJ26] Building a VLA Model Based on Self-Distilled Classification
keio_smilab
PRO
0
170
[RSJ26] NarrativeFlow: Flow-Based Vision-Language-Action Model Using Robot Velocity Fields
keio_smilab
PRO
0
140
Claude Codeで開発以外の業務も爆速化しよう!
minorun365
PRO
12
9.5k
20260903 Tokyo Jazug Night #62 | Azure エンジニアよ、 その環境は本当にセキュアか?
olivia_0707
1
560
Featured
See All Featured
Design and Strategy: How to Deal with People Who Don’t "Get" Design
morganepeng
133
19k
The Invisible Side of Design
smashingmag
301
52k
sira's awesome portfolio website redesign presentation
elsirapls
0
390
The Director’s Chair: Orchestrating AI for Truly Effective Learning
tmiket
1
290
Visualization
eitanlees
152
17k
Ecommerce SEO: The Keys for Success Now & Beyond - #SERPConf2024
aleyda
1
2.1k
JAMstack: Web Apps at Ludicrous Speed - All Things Open 2022
reverentgeek
1
590
The Illustrated Guide to Node.js - THAT Conference 2024
reverentgeek
1
460
How to optimise 3,500 product descriptions for ecommerce in one day using ChatGPT
katarinadahlin
PRO
2
3.8k
RailsConf & Balkan Ruby 2019: The Past, Present, and Future of Rails at GitHub
eileencodes
141
35k
Why You Should Never Use an ORM
jnunemaker
PRO
61
10k
The SEO Collaboration Effect
kristinabergwall1
1
550
Transcript
Reinforcement Learning Second edition - Notes on Chapter 6 Etsuji
Nakai (@enakai00)
Off-policy MC control with ε - greedy の課題 2 •
ゴールから逆向きにエピソードをスキャンして、Value Function を更新していく。 • Target policy π が Greedy(非確率的)なので、π と異なるアクションがあると、それ以前 を含むパスの確率は 0 になり、そこでスキャンは打ち切られる。 • スタートからゴールまで Target policy にしたがって行動するエピソードがないと、スター ト付近の価値関数が学習できない。 ◦ つまり、長距離にわたる学習が困難 ⇨「Bootstrapping でない手法」の課題
Temporal Difference Prediction 3 • ゴールに至るまでの Total Reward で Value
function を見積もるのではなく、DP Method と同様に、エピソードに含まれる個々のステップを個別に評価する。 • S → A → R → S' というステップに対して、S' 以降の Total Reward は、現在の V(S') の値で 近似すると、 という見積もりができる。 • 現状の V(S) とここで得られた見積もりとの差分を TD Error と呼ぶ。 • 一定の重み α で TD Error による修正を加えていく。
Temporal Difference Prediction 4 • 問題点:Greedy Policy を採用すると、その Policy では到達しない状態のサンプルが得られ
なくなる。
MC vs TD for random policy 5 • ・・・という問題は一旦置いておき、random policy
に対する Value function の評価を MC と TD で比較してみる。 https://github.com/enakai00/rl_book_solutions/blob/master/Chapter06/Exercise_6_4.ipynb
ポリシーの改善方法(Policy Iteration の復習) 6 ※ ここでは、 は既知とする。 ・任意のポリシー を1つ選択する ・Value function
を(何らかの方法で)計算する ・Action-Value function が決まる ・Greedy ポリシー ( が最大の a を確率 1 で選択する) この時、任意の s について が成り立つ。 つまり、π' は、π よりも優れたポリシーと言える。この改善処理を繰り返す。 TD の場合は、q π (s, a) を 求めておくことが必要
ポリシーの改善方法(SARSA) 7 • : 状態 S で Action A を取り、その後は、ポリシー
π で行動を続けた場合の Total Reward • ポリシー π の下に、 を取得して、Action-value function の見積もりを下記 でアップデートする。 • ポリシー π として、 を用いた Greedy policy を採用すると、 の更新に伴っ て、ポリシーも改善されていく。
ポリシーの改善方法(SARSA) 8 • 問題点:Greedy Policy を採用すると、その Policy では到達しない状態のサンプルが得られ なくなる!!!!!!! •
あきらめて、ε - greedy (一般には、 に基づいた何らかの Soft policy)を採用し て、ε を徐々に 0 に近づけるなどの工夫をする。 ⇨ これが、一般に SARSA (on-policy TD)と呼ばれる手法
ポリシーの改善方法(SARSA) 9
MC / TD の根本問題をもう一度よく考えてみよう 10 • 問題点:Greedy Policy を採用すると、その Policy
では到達しない状態のサンプルが得られ なくなる!!!!!!!と言ったけど・・・・ • Greedy でない Policy を採用すると、Greedy policy でその経路が得られる確率が 0 にな り、off-policy MC における Importance sampling ができないことが真の問題点 • あれ? じゃあ、TD の場合、上記の問題ってあるんだっけ・・・・?
MC / TD の根本問題をもう一度よく考えてみよう 11 • 下記のアップデートの根本原理は、 という関係式。 • :「 状態
S で Action A を取り、その後は、ポリシー π で行動を続けた場合の Total Reward」なので、上記のアップデートにおいて、Action A は、任意のポリシーで取得して 構わない。 • 一方、Action A' は、ポリシー π で取得したものを選択する必要がある。したがって、ここ で、Greedy policy を適用すれば、Greedy policy に基づいたポリシーの更新ができる。 ⇨ Q - Learning
• MC の場合 • Q - Learning の場合 MC と
Q-Learning の違い 12 この部分の Total reward をリアルなエピソードから取得する この部分の Total reward は、 で見積もる (なので、これ以降の経路は、 とは無関係で何でもよい。)
• 任意のポリシーでエピソードを集めまくれば、最適な Greedy ポリシーが決定できる。 • よって、エピソード収集用のポリシー(Behavior policy)を工夫することで、より長期的な経路のデー タを効率的に収集することができえる。 Q-Learning =
Off - policy TD 13
• Q - Learning : Q(S, A) は、Optimal path を学習していくが、Behavior
policy が Q(S, A) に 基づく ε - greedy なので、エピソードの収集中は、Cliff に落ちやすい。 • SARSA: Q(S, A) は、ε - greedy ポリシーに対する価値を学習するので、Cliff の近くは危険 (価値が低い)と学習されてしまう。 SARSA と Q - Learning の比較 14 Behavior policy は ε - greedy
• 前ページの例は、Q-Learning が不利になるように作為的に作った例で、一般には、 Q-Learning の方が効率的に学習が進む。 SARSA と Q - Learning
の比較 15 https://github.com/enakai00/rl_book_solutions/blob/master/Chapter06/SARSA_vs_Q_Learning_vs_MC.ipynb SARSA: 17 ############ # 901# # 2# # 8 3# #01 7 G 4# # 2 6 65# # 345 # # # ############ Q-Learning: 15 ############ # 6789# # 5 0# # 4 1# #0123 G 2# # 43# # # # # ############ MC: 15 ############ # 6789# # 5 0# # 4 1# #0123 G 2# # 43# # # # # ############ • この例では Q(S, A) の初期値が 0 なので、 Exploration がより積極的に行われる点に注意