Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
LLM + 強化学習
Search
NearMeの技術発表資料です
PRO
July 30, 2026
34
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
LLM + 強化学習
NearMeの技術発表資料です
PRO
July 30, 2026
More Decks by NearMeの技術発表資料です
See All by NearMeの技術発表資料です
Claude Code × git worktree で並列開発 (続き) -差分のサービスだけを併設する-
nearme_tech
PRO
1
60
Claude Code × git worktree で並列開発 — サブモジュール構成のリポジトリで成立させる —
nearme_tech
PRO
0
74
PosthogのA/Bテスト機能の紹介
nearme_tech
PRO
1
95
AIフレンドリーなプロダクトに向けて
nearme_tech
PRO
2
65
初めてのLean言語
nearme_tech
PRO
0
110
Apache Airflow Workflow orchestration without turning cron into spaghetti
nearme_tech
PRO
2
41
実務で役立つ幾何学 ボロノイ図の基礎から グラフ・ネットワーク応用まで
nearme_tech
PRO
1
81
SQL/ID抽出タスクから考える 実践的なハルシネーション対策
nearme_tech
PRO
1
92
OpenCode & Local LLM
nearme_tech
PRO
0
340
Featured
See All Featured
Responsive Adventures: Dirty Tricks From The Dark Corners of Front-End
smashingmag
254
22k
Beyond borders and beyond the search box: How to win the global "messy middle" with AI-driven SEO
davidcarrasco
3
270
Everyday Curiosity
cassininazir
0
330
The Web Performance Landscape in 2024 [PerfNow 2024]
tammyeverts
12
1.3k
How to train your dragon (web standard)
notwaldorf
97
6.8k
Future Trends and Review - Lecture 12 - Web Technologies (1019888BNR)
signer
PRO
0
3.8k
The MySQL Ecosystem @ GitHub 2015
samlambert
251
13k
How to Think Like a Performance Engineer
csswizardry
28
2.8k
Tips & Tricks on How to Get Your First Job In Tech
honzajavorek
1
770
SEO in 2025: How to Prepare for the Future of Search
ipullrank
3
3.8k
Tell your own story through comics
letsgokoyo
1
1.1k
svc-hook: hooking system calls on ARM64 by binary rewriting
retrage
2
590
Transcript
LLM + 強化学習 2025-07-30 第151回NearMe技術勉強会 Takuma KAKINOUE 0
はじめに • LLMを強化学習でチューニングする的な内容ではないので注意 今回は強化学習エージェントを訓練する上位AIとしてLLMを⽤いる 1
今のLLMに⾜りないもの • LLMは「頭脳」は持っている ◦ しかし、リアルタイム性のあるゲームやロボットの制御はできない ◦ なぜならLLMはダイナミックな「運動」の制御に適していないからである • 動物の脳に例えるなら、LLMが⾔語系だとすると、 運動野や⼩脳に当たる部分を作りたい
2
運動野としてのRLポリシー • ⼈間は、不慣れな間は動作を1つ1つ頭で考えながら実⾏するが、 熟練してくると無意識に体を動かせるようになることのアナロジーを考えた • LLMが上位AIになって、下位AIとして強化学習の⽅策ネットワークを訓練する のはどうだろうか ◦ ⽅策の訓練が完了すれば(技能を習得してしまえば)、 ⽅策ネットワークのみで⾼速に動くことができる
3
先⾏研究 • というわけで、同じようなことを試みている事例がないか調査してみた ◦ Eureka: Human-Level Reward Design via Coding
Large Language Models ▪ https://arxiv.org/abs/2310.12931 ▪ LLMを「RLポリシーを訓練するための報酬関数の設計者」として使う ◦ Voyager: An Open-Ended Embodied Agent with Large Language Models ▪ https://arxiv.org/abs/2305.16291 ▪ LLMでコード(ルールベース)を⽣成しながら、マインクラフトを攻略 4
以下のようなアーキテクチャを考えてみた • LLMに「環境コード」と「タスク記述」のみを渡し、訓練コードを出⼒させる • 強化学習のフレームワークはRustで実装したDLLを使う (https://github.com/kakky-hacker/reinforcex) ◦ FFIもAIに書かせれば様々な⾔語に対応可能 ◦ 並列訓練もサポート
• LLMが出⼒した訓練コードをシェルで実⾏し、 実際にLLMがプロセスのログを読みながら訓練コードを修正することを繰り返す。 5
トークン削減のために⼯夫したポイント • 強化学習フレームワークのヘッダファイルを⽤意することで⼊⼒トークンを削減 ◦ https://github.com/kakky-hacker/reinforcex/blob/master/ffi/include/reinforc ex.h • その他、強化学習で使いそうな機能は関数として事前に⽤意(エントロピー計算、 報酬に有意差があるかの検定など) •
強化学習のサンプルコードをいくつか⽤意しておいて、コピペ後に調整させる 6
環境 • Windows11 • Codex + ChatGPT 5.6 Sol •
Python 3.12 + gymnasium 7
実験1:まずは⼈間が書いたコードを元にハイパラ調整 • CartPole with DQN ◦ beforeは⼈⼿で適当にコード書いて訓練した結果 ◦ AIは何回か訓練プロセスを実⾏しながらハイパラを調整して改善に成功した 8
実験2:AIが0から強化学習 • Hopper with SAC ◦ 強化学習フレームワークのヘッダファイルと 「Hopperを訓練して」というチャットのみを⼊⼒ 9
おまけ • デスクトップとスマホをSSH接続し、 スマホから訓練を実⾏させてみる ◦ 実演 10
今後の展望 • gymnasium(https://gymnasium.farama.org/index.html)の環境を 全て上位LLM+下位RLポリシーに訓練させてみる ◦ 強化学習レシピ集みたいなものを作成して、 未知の環境に対しても知⾒を活かせないか 11
Thank you 12