Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Rustで強化学習アルゴリズムを実装する vol3
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
NearMeの技術発表資料です
PRO
May 09, 2025
120
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Rustで強化学習アルゴリズムを実装する vol3
NearMeの技術発表資料です
PRO
May 09, 2025
More Decks by NearMeの技術発表資料です
See All by NearMeの技術発表資料です
Claude Code × git worktree で並列開発 (続き) -差分のサービスだけを併設する-
nearme_tech
PRO
1
50
Claude Code × git worktree で並列開発 — サブモジュール構成のリポジトリで成立させる —
nearme_tech
PRO
0
54
LLM + 強化学習
nearme_tech
PRO
0
31
PosthogのA/Bテスト機能の紹介
nearme_tech
PRO
1
44
AIフレンドリーなプロダクトに向けて
nearme_tech
PRO
2
65
初めてのLean言語
nearme_tech
PRO
0
100
Apache Airflow Workflow orchestration without turning cron into spaghetti
nearme_tech
PRO
2
37
実務で役立つ幾何学 ボロノイ図の基礎から グラフ・ネットワーク応用まで
nearme_tech
PRO
1
76
SQL/ID抽出タスクから考える 実践的なハルシネーション対策
nearme_tech
PRO
1
88
Featured
See All Featured
Fashionably flexible responsive web design (full day workshop)
malarkey
408
67k
SEO in 2025: How to Prepare for the Future of Search
ipullrank
3
3.8k
The Anti-SEO Checklist Checklist. Pubcon Cyber Week
ryanjones
0
230
The Straight Up "How To Draw Better" Workshop
denniskardys
239
140k
Joys of Absence: A Defence of Solitary Play
codingconduct
1
480
From Legacy to Launchpad: Building Startup-Ready Communities
dugsong
0
320
SEO Brein meetup: CTRL+C is not how to scale international SEO
lindahogenes
1
2.9k
Intergalactic Javascript Robots from Outer Space
tanoku
273
27k
Unsuck your backbone
ammeep
672
58k
KATA
mclloyd
PRO
35
15k
WCS-LA-2024
lcolladotor
0
820
Ecommerce SEO: The Keys for Success Now & Beyond - #SERPConf2024
aleyda
1
2.1k
Transcript
0 2025-05-09 第121回NearMe技術勉強会 Takuma KAKINOUE Rustで強化学習アルゴリズムを実装する vol3
1 今回、実装するアルゴリズム • Proximal Policy Optimization (PPO) ◦ Actor-Critic系に分類される⼿法 ◦
効率的かつ安定した学習が可能で、オンポリシーな強化学習アルゴリズム ではデファクトスタンダード的な存在 ※論⽂(https://arxiv.org/abs/1707.06347) ※git (https://github.com/kakky-hacker/reinforcex) ※参考資料 →https://jp.mathworks.com/content/dam/mathworks/ebook/gated/jp-reinfor cement-learning-ebook-all-chapters.pdf
2 価値ベースと⽅策ベースの違い • 価値ベース ◦ ある状態において、ある⾏動を選択する価値を推定する ▪ 連続⾏動空間に対応できないという弱点がある • ⽅策ベース
← PPOはこっちに属する ◦ ある状態において、選択すべき⾏動の確率分布を推定する ▪ 連続⾏動空間に対応可能
3 ⽅策ベースの弱点 • 状態 → ⾏動の関数を直接モデル化するために選択する⾏動が⼤胆に変わりや すい ◦ → 学習が不安定
• PPOでは⾏動の選択確率が重みの更新前後で⼤きく変わらないようにclipする 仕組みを導⼊して上記の問題を解決している! ◦ 実装 https://github.com/kakky-hacker/reinforcex/blob/master/src/agents/p po.rs#L91
4 実装する上で詰まったところ • softmaxのlogitのスケールが⼤きすぎた ◦ logitのスケールが⼤きいほど決定論的な⾏動選択になり、探索が促進され にくくなる • logitを⼩さくするだけでは、逆に⾏動の確率分布の分散が中々⼩さくなら ず、学習の収束が遅い
◦ ⽬的関数に⾏動の確率分布のエントロピーも⼊れて、同時に最⼩化した ◦ https://github.com/kakky-hacker/reinforcex/blob/master/src/agents/p po.rs#L97
5 今後の展望 • 汎⽤的なよく使われるアルゴリズム(REINFORCE, DQN, PPO, SAC)は 実装できたので、並列化の実装を進める • 並列化は、Rustを使う⼀番のメリットが出てくるポイント
6 Thank you