Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
LLM + 強化学習
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
NearMeの技術発表資料です
PRO
July 30, 2026
22
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
LLM + 強化学習
NearMeの技術発表資料です
PRO
July 30, 2026
More Decks by NearMeの技術発表資料です
See All by NearMeの技術発表資料です
Claude Code × git worktree で並列開発 — サブモジュール構成のリポジトリで成立させる —
nearme_tech
PRO
0
34
PosthogのA/Bテスト機能の紹介
nearme_tech
PRO
1
30
AIフレンドリーなプロダクトに向けて
nearme_tech
PRO
2
59
初めてのLean言語
nearme_tech
PRO
0
92
Apache Airflow Workflow orchestration without turning cron into spaghetti
nearme_tech
PRO
2
33
実務で役立つ幾何学 ボロノイ図の基礎から グラフ・ネットワーク応用まで
nearme_tech
PRO
1
66
SQL/ID抽出タスクから考える 実践的なハルシネーション対策
nearme_tech
PRO
1
81
OpenCode & Local LLM
nearme_tech
PRO
0
270
OpenCode Introduction
nearme_tech
PRO
0
70
Featured
See All Featured
Imperfection Machines: The Place of Print at Facebook
scottboms
270
14k
Paper Plane
katiecoart
PRO
2
53k
Making the Leap to Tech Lead
cromwellryan
135
10k
Testing 201, or: Great Expectations
jmmastey
46
8.2k
The Art of Delivering Value - GDevCon NA Keynote
reverentgeek
16
2.1k
Music & Morning Musume
bryan
47
7.3k
Leveraging Curiosity to Care for An Aging Population
cassininazir
1
470
Designing Experiences People Love
moore
143
24k
The Straight Up "How To Draw Better" Workshop
denniskardys
239
140k
Reflections from 52 weeks, 52 projects
jeffersonlam
356
21k
Bioeconomy Workshop: Dr. Julius Ecuru, Opportunities for a Bioeconomy in West Africa
akademiya2063
PRO
1
250
Why Mistakes Are the Best Teachers: Turning Failure into a Pathway for Growth
auna
0
210
Transcript
LLM + 強化学習 2025-07-30 第151回NearMe技術勉強会 Takuma KAKINOUE 0
はじめに • LLMを強化学習でチューニングする的な内容ではないので注意 今回は強化学習エージェントを訓練する上位AIとしてLLMを⽤いる 1
今のLLMに⾜りないもの • LLMは「頭脳」は持っている ◦ しかし、リアルタイム性のあるゲームやロボットの制御はできない ◦ なぜならLLMはダイナミックな「運動」の制御に適していないからである • 動物の脳に例えるなら、LLMが⾔語系だとすると、 運動野や⼩脳に当たる部分を作りたい
2
運動野としてのRLポリシー • ⼈間は、不慣れな間は動作を1つ1つ頭で考えながら実⾏するが、 熟練してくると無意識に体を動かせるようになることのアナロジーを考えた • LLMが上位AIになって、下位AIとして強化学習の⽅策ネットワークを訓練する のはどうだろうか ◦ ⽅策の訓練が完了すれば(技能を習得してしまえば)、 ⽅策ネットワークのみで⾼速に動くことができる
3
先⾏研究 • というわけで、同じようなことを試みている事例がないか調査してみた ◦ Eureka: Human-Level Reward Design via Coding
Large Language Models ▪ https://arxiv.org/abs/2310.12931 ▪ LLMを「RLポリシーを訓練するための報酬関数の設計者」として使う ◦ Voyager: An Open-Ended Embodied Agent with Large Language Models ▪ https://arxiv.org/abs/2305.16291 ▪ LLMでコード(ルールベース)を⽣成しながら、マインクラフトを攻略 4
以下のようなアーキテクチャを考えてみた • LLMに「環境コード」と「タスク記述」のみを渡し、訓練コードを出⼒させる • 強化学習のフレームワークはRustで実装したDLLを使う (https://github.com/kakky-hacker/reinforcex) ◦ FFIもAIに書かせれば様々な⾔語に対応可能 ◦ 並列訓練もサポート
• LLMが出⼒した訓練コードをシェルで実⾏し、 実際にLLMがプロセスのログを読みながら訓練コードを修正することを繰り返す。 5
トークン削減のために⼯夫したポイント • 強化学習フレームワークのヘッダファイルを⽤意することで⼊⼒トークンを削減 ◦ https://github.com/kakky-hacker/reinforcex/blob/master/ffi/include/reinforc ex.h • その他、強化学習で使いそうな機能は関数として事前に⽤意(エントロピー計算、 報酬に有意差があるかの検定など) •
強化学習のサンプルコードをいくつか⽤意しておいて、コピペ後に調整させる 6
環境 • Windows11 • Codex + ChatGPT 5.6 Sol •
Python 3.12 + gymnasium 7
実験1:まずは⼈間が書いたコードを元にハイパラ調整 • CartPole with DQN ◦ beforeは⼈⼿で適当にコード書いて訓練した結果 ◦ AIは何回か訓練プロセスを実⾏しながらハイパラを調整して改善に成功した 8
実験2:AIが0から強化学習 • Hopper with SAC ◦ 強化学習フレームワークのヘッダファイルと 「Hopperを訓練して」というチャットのみを⼊⼒ 9
おまけ • デスクトップとスマホをSSH接続し、 スマホから訓練を実⾏させてみる ◦ 実演 10
今後の展望 • gymnasium(https://gymnasium.farama.org/index.html)の環境を 全て上位LLM+下位RLポリシーに訓練させてみる ◦ 強化学習レシピ集みたいなものを作成して、 未知の環境に対しても知⾒を活かせないか 11
Thank you 12