Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
ICLR2019読み会Solving the Rubik's Cube with Approx...
Search
rea_tea
June 02, 2019
Research
26
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
ICLR2019読み会Solving the Rubik's Cube with Approximate Policy Iteration
ライトニングトーク(LT)用スライド
rea_tea
June 02, 2019
More Decks by rea_tea
See All by rea_tea
CoRL2020論文詠み会 Multi-Resolution Graph Neural Network for Large-Scale Pointcloud Segmentation
red_tea
0
28
Other Decks in Research
See All in Research
【ローカルAIに向き合う展示会vol.2】液体時間定数型モジュールを用いた オリジナルの双方向エンコーダーモデルNexteraBERT 推論速度向上検討並びにダウンストリーム評価
rikkabotan7
0
190
大規模言語モデルは誰を覚えているか / Who Do Large Language Models Memorize?
upura
0
160
SAM3を用いたコマ・吹き出しの 領域検出と分割構造からの読み順推定
kzmssk
0
110
The story of RefactoringMiner. Slow research, long-term impact
tsantalis
0
140
Apache Gravitinoで実現する Icebergカタログ統合とアクセスの一元化
matsumooon
0
490
最先端NLP勉強会2026 論文紹介:Reasoning with Sampling: Your Base Model is Smarter Than You Think (ICLR 2026 paper)
kogoro
4
580
セマンティック通信勉強会 6Gに向けたデバイス間効率的な通信の技術紹介・課題・今後展望
satai
3
320
[Fishers] DIVER OSINT CTF 2026 特化AIエージェントハーネスで挑戦するOSINT CTF
analokmaus
0
550
SAKURAONE:An Open Ethernet-based AI HPC System And Its Observed Workload Dynamicsin a Single-Tenant LLM Development Environment
yuukit
1
580
論文読み会 SNLP2026 Tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
s_mizuki_nlp
0
230
研究室単位での自律的 IPv6接続性確立に向けたAS共同運用モデルの提案と実証
reokashiwa
PRO
0
210
Model Discovery and Graph Simulation: A Lightweight Gateway to Chaos Engineering
anatolykr
0
290
Featured
See All Featured
Measuring Dark Social's Impact On Conversion and Attribution
stephenakadiri
2
270
Discover your Explorer Soul
emna__ayadi
2
1.3k
Ruling the World: When Life Gets Gamed
codingconduct
0
320
Performance Is Good for Brains [We Love Speed 2024]
tammyeverts
12
1.8k
How to build a perfect <img>
jonoalderson
1
6k
We Analyzed 250 Million AI Search Results: Here's What I Found
joshbly
1
1.9k
Why Mistakes Are the Best Teachers: Turning Failure into a Pathway for Growth
auna
0
240
Large-scale JavaScript Application Architecture
addyosmani
515
110k
Redefining SEO in the New Era of Traffic Generation
szymonslowik
1
400
GraphQLとの向き合い方2022年版
quramy
50
15k
世界の人気アプリ100個を分析して見えたペイウォール設計の心得
akihiro_kokubo
PRO
74
42k
Fireside Chat
paigeccino
42
4k
Transcript
SOLVING THE RUBIK’S CUBE WITH APPROXIMATE POLICY ITERATION 2019年6月2日(日) ICLR2019
読み会 in 京都 廣田 敦士 1
概要 ⚫ 強化学習でルービックキューブを解く手法(Deep Cube)論文 ⚫ 人間の知識は一切使用しないで解く (Alpha Go Zero[1] と似た手法)
⚫ Alpha Go Zeroとの違い ⚫ 報酬を得るタイミングの少なさ ⚫ Autodidactic Iterationによる学習データの準備 ⚫ 基本的にはキューブの状態を記述した木を探索 ⚫ 木を効率よく探索するのにDeep Learningを用いる 2 [1]SILVER, David, et al. Mastering the game of go without human knowledge. Nature, 2017, 550.7676: 354. ルービックキューブのルール 揃える 完成 バラバラ ・・・・・・・・ ・・・ ・・・・・・・・ モンテカルロ木探索 ⚫ 3× 3× 3の立方体 ⚫ 外側の辺を回せる 各状態の価値がわかる、「価値関数」 がわかればOK
手法 ⚫ Value Network+Policy network + 探索木 ⚫ 報酬は完成状態で1、その他で-1とする ⚫
Value Network: ⚫ 入力:キューブの状態 ⚫ 出力:その状態の価値(あと何手で解けるか 的な) ⚫ この関数を元にモンテカルロ木探索 ⚫ Policy Network: ⚫ 入力:キューブの状態 ⚫ 出力:各行動(キューブの回転)に対する筋 の良さ ⚫ モンテカルロ木探索の探索“幅“を減らす ⚫ Value Network を元に作られる 3 Autodidactic Iteration (ADI) 学習データの作り方 完成状態からスタートすることで、 完成状態を経やすくする キューブを回していく
結果と考察 4 赤点線は神の数字(どんな状態からも26, 15手あれば解ける) ※半回転は2手として数える ⚫ 報酬が得られる確証のないタスクで、純粋な強化学 習ができた ⚫ 将来は計画問題(ロボットの操作、2プレイヤーゲー
ム、経路探索等)に適応したい ⚫ Baseline ⚫ Kociemba: 人間の知識あり ⚫ Korf: ヒューリスティック手法。優秀だが時間が かかりすぎる ⚫ DeepCubeは分散は大きいが、 人間の知識を使った手法に匹敵
APPENDIX: Network Architecture 5 ⚫ 入力は図の白色部分(20か所) ⚫ 1cubletにつき24通りの入り方が存在 ⚫ 12通り
⚫ 6(辺)×2(時計回り・反時計回り) ⚫ 完成までの手数