Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
LLM + 強化学習
Search
NearMeの技術発表資料です
PRO
July 30, 2026
31
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
LLM + 強化学習
NearMeの技術発表資料です
PRO
July 30, 2026
More Decks by NearMeの技術発表資料です
See All by NearMeの技術発表資料です
Claude Code × git worktree で並列開発 (続き) -差分のサービスだけを併設する-
nearme_tech
PRO
1
45
Claude Code × git worktree で並列開発 — サブモジュール構成のリポジトリで成立させる —
nearme_tech
PRO
0
50
PosthogのA/Bテスト機能の紹介
nearme_tech
PRO
1
42
AIフレンドリーなプロダクトに向けて
nearme_tech
PRO
2
65
初めてのLean言語
nearme_tech
PRO
0
100
Apache Airflow Workflow orchestration without turning cron into spaghetti
nearme_tech
PRO
2
37
実務で役立つ幾何学 ボロノイ図の基礎から グラフ・ネットワーク応用まで
nearme_tech
PRO
1
74
SQL/ID抽出タスクから考える 実践的なハルシネーション対策
nearme_tech
PRO
1
87
OpenCode & Local LLM
nearme_tech
PRO
0
320
Featured
See All Featured
How to Grow Your eCommerce with AI & Automation
katarinadahlin
PRO
1
260
Mobile First: as difficult as doing things right
swwweet
225
10k
Leveraging LLMs for student feedback in introductory data science courses - posit::conf(2025)
minecr
1
370
How GitHub (no longer) Works
holman
316
150k
16th Malabo Montpellier Forum Presentation
akademiya2063
PRO
0
370
<Decoding/> the Language of Devs - We Love SEO 2024
nikkihalliwell
1
320
The Director’s Chair: Orchestrating AI for Truly Effective Learning
tmiket
1
290
Navigating Weather and Climate Data
rabernat
0
510
Agile Leadership in an Agile Organization
kimpetersen
PRO
0
220
Optimising Largest Contentful Paint
csswizardry
37
3.9k
Put a Button on it: Removing Barriers to Going Fast.
kastner
60
4.6k
Docker and Python
trallard
47
4.2k
Transcript
LLM + 強化学習 2025-07-30 第151回NearMe技術勉強会 Takuma KAKINOUE 0
はじめに • LLMを強化学習でチューニングする的な内容ではないので注意 今回は強化学習エージェントを訓練する上位AIとしてLLMを⽤いる 1
今のLLMに⾜りないもの • LLMは「頭脳」は持っている ◦ しかし、リアルタイム性のあるゲームやロボットの制御はできない ◦ なぜならLLMはダイナミックな「運動」の制御に適していないからである • 動物の脳に例えるなら、LLMが⾔語系だとすると、 運動野や⼩脳に当たる部分を作りたい
2
運動野としてのRLポリシー • ⼈間は、不慣れな間は動作を1つ1つ頭で考えながら実⾏するが、 熟練してくると無意識に体を動かせるようになることのアナロジーを考えた • LLMが上位AIになって、下位AIとして強化学習の⽅策ネットワークを訓練する のはどうだろうか ◦ ⽅策の訓練が完了すれば(技能を習得してしまえば)、 ⽅策ネットワークのみで⾼速に動くことができる
3
先⾏研究 • というわけで、同じようなことを試みている事例がないか調査してみた ◦ Eureka: Human-Level Reward Design via Coding
Large Language Models ▪ https://arxiv.org/abs/2310.12931 ▪ LLMを「RLポリシーを訓練するための報酬関数の設計者」として使う ◦ Voyager: An Open-Ended Embodied Agent with Large Language Models ▪ https://arxiv.org/abs/2305.16291 ▪ LLMでコード(ルールベース)を⽣成しながら、マインクラフトを攻略 4
以下のようなアーキテクチャを考えてみた • LLMに「環境コード」と「タスク記述」のみを渡し、訓練コードを出⼒させる • 強化学習のフレームワークはRustで実装したDLLを使う (https://github.com/kakky-hacker/reinforcex) ◦ FFIもAIに書かせれば様々な⾔語に対応可能 ◦ 並列訓練もサポート
• LLMが出⼒した訓練コードをシェルで実⾏し、 実際にLLMがプロセスのログを読みながら訓練コードを修正することを繰り返す。 5
トークン削減のために⼯夫したポイント • 強化学習フレームワークのヘッダファイルを⽤意することで⼊⼒トークンを削減 ◦ https://github.com/kakky-hacker/reinforcex/blob/master/ffi/include/reinforc ex.h • その他、強化学習で使いそうな機能は関数として事前に⽤意(エントロピー計算、 報酬に有意差があるかの検定など) •
強化学習のサンプルコードをいくつか⽤意しておいて、コピペ後に調整させる 6
環境 • Windows11 • Codex + ChatGPT 5.6 Sol •
Python 3.12 + gymnasium 7
実験1:まずは⼈間が書いたコードを元にハイパラ調整 • CartPole with DQN ◦ beforeは⼈⼿で適当にコード書いて訓練した結果 ◦ AIは何回か訓練プロセスを実⾏しながらハイパラを調整して改善に成功した 8
実験2:AIが0から強化学習 • Hopper with SAC ◦ 強化学習フレームワークのヘッダファイルと 「Hopperを訓練して」というチャットのみを⼊⼒ 9
おまけ • デスクトップとスマホをSSH接続し、 スマホから訓練を実⾏させてみる ◦ 実演 10
今後の展望 • gymnasium(https://gymnasium.farama.org/index.html)の環境を 全て上位LLM+下位RLポリシーに訓練させてみる ◦ 強化学習レシピ集みたいなものを作成して、 未知の環境に対しても知⾒を活かせないか 11
Thank you 12