Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
[論文紹介] 状態遷移差分の学習による耐故障ロボットのための強化学習
Search
tt1717
January 26, 2024
Research
76
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[論文紹介] 状態遷移差分の学習による耐故障ロボットのための強化学習
PDFファイルをダウンロードすると,スライド内のリンクを見ることができます.
tt1717
January 26, 2024
More Decks by tt1717
See All by tt1717
[勉強会] Decision Transformer
tt1717
0
110
[論文サーベイ] Survey on Google DeepMind’s Game AI 2
tt1717
0
86
[論文サーベイ] Survey on Google DeepMind’s Game AI
tt1717
0
66
[論文サーベイ] Survey on VLM for Video Game Quality Assurance
tt1717
0
64
[論文サーベイ] Survey on Pokemon AI 3
tt1717
0
110
[論文サーベイ] Survey on Pokemon AI 2
tt1717
0
100
[論文サーベイ] Survey on Pokemon AI
tt1717
0
140
[論文サーベイ] Survey on Minecraft AI in NeurIPS 2024
tt1717
0
160
[論文サーベイ] Survey on GPT for Games
tt1717
0
110
Other Decks in Research
See All in Research
Karkada さんの論文 × 2 の紹介: (1) Closed-Form Training Dynamics Reveal Learned Features and Linear Structure in Word2Vec-like Models, (2) Symmetry in language statistics shapes the geometry of model representations
eumesy
PRO
1
780
論文紹介:Doc-to-LoRA: Learning to Instantly Internalize Contexts
yukako_nakano
0
180
Google Cloud Next 2026 DM Recap Agentic Data Cloudを添えて / Google Cloud Next 2026 DM Recap
nnaka2992
0
140
某助成金プロジェクト採択に向けて企業研究所のアウトリーチ専任者がやったこと
afroscript
0
190
[ACL 2026 Demo] Fast-MIA: Efficient and Scalable Membership Inference for LLMs
upura
0
130
OWASP AISVS - C7
shiell
2
790
[SNLP2026] Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
wataruuuuu
0
320
IA for theory
gpeyre
1
440
視覚若手の会LENSって何??
mickey_0226
0
300
2025年度秋葉原ウォーカブルプロジェクト調査報告 「アキバらしいウォーカブル」とは何か
izumiyama_lab
1
230
プレイス・ワークショップ秋葉原
izumiyama_lab
1
110
Apache Gravitinoで実現する Icebergカタログ統合とアクセスの一元化
matsumooon
0
540
Featured
See All Featured
AI Search: Where Are We & What Can We Do About It?
aleyda
0
8k
A brief & incomplete history of UX Design for the World Wide Web: 1989–2019
jct
2
510
Designing Dashboards & Data Visualisations in Web Apps
destraynor
232
55k
The Art of Delivering Value - GDevCon NA Keynote
reverentgeek
16
2.2k
Leveraging Curiosity to Care for An Aging Population
cassininazir
1
520
How to Create Impact in a Changing Tech Landscape [PerfNow 2023]
tammyeverts
56
3.5k
Thoughts on Productivity
jonyablonski
76
5.4k
Java REST API Framework Comparison - PWX 2021
mraible
34
9.7k
Code Review Best Practice
trishagee
74
20k
HDC tutorial
michielstock
2
910
Impact Scores and Hybrid Strategies: The future of link building
tamaranovitovic
0
440
Paper Plane (Part 1)
katiecoart
PRO
2
11k
Transcript
・walker2Dを使用 ・3通りの訓練で検証 1.正常なロボットのみで訓練 (normal policy) 2.ロボットをランダムに故障させながら訓練 (robust policy) 3.状態遷移の差分を用いて故障させながら訓練 (our
policy) どんなもの? 先行研究と比べて何がすごい? 技術の手法や肝は? どうやって有効だと検証した? ・故障度合いが大きいとき,our policyとrubust policyで高い収益を 得られた ・故障度合いが小さいとき,our policyで高い収益を得られた 故障の表現 ・故障する関節をランダムに選択し,関節アクチュエータのトルク に対して,故障係数kをかける ・故障係数kは一様分布U(0.0,2.0)からサンプリングする ・MDPにおける遷移関数に対して,正常時の遷移関数と故障時の遷 移関数の差分を利用して故障度合いを表現する手法を提案 状態遷移差分の学習による耐故障ロボットのための強化学習 (JSAI 2020)大里 虹平, 川本 一彦 https://www.jstage.jst.go.jp/article/pjsai/JSAI2020/0/JSAI2020_4Rin134/_pdf 2024/01/26 論文を表す画像 被引用数:- 1/4
故障の表現 ❏ 正常時の遷移関数Tnormalと故障時の遷移関数Tbrokenが異なることを 利用 ❏ Tnormalと遷移関数Tが等しければ正常,そうでなければ故障とみなす ❏ Stdiff:ロボットの故障度合いを反映したパラメータ ❏ St:t時刻の状態
❏ Stnormal:正常時ロボットを仮定してt時刻の状態 ❏ Tnormalは未知関数なのでニューラルネットワークで表現する ❏ 定常環境でStnormalを収集し,これを教師データとして遷移予測ネッ トワークを訓練する ❏ St^normalとSt^diffは予測値を意味する 2/4
実験結果 ❏ 結果 ❏ 故障度合いが大きいとき,our policyとrobust policyで高い収益 ❏ 故障度合いが小さいとき,our policyで高い収益
3/4 ❏ 実験設定 ❏ 正常なロボットのみで訓練 (normal policy) ❏ ロボットをランダムに故障させな がら訓練 (robust policy) ❏ 状態遷移の差分を用いて故障させ ながら訓練 (our policy) ❏ hip,knee,ankleに対してkを0.25刻 みで故障させて評価する ❏ 各手法に対して3つのシード値で 3200万ステップ訓練する
❏ まとめ ❏ 正常時の遷移関数を学習する ❏ 予測される状態遷移と実際の状態遷移の差分を方策ネットワークに加える ❏ これにより,故障度合いを識別しながら学習する手法を提案 ❏ 提案手法では,正常時および故障時に遷移関数を利用しない方策より高い
収益を獲得した ❏ 感想 ❏ 提案手法の概要とイメージを掴むことができたが,方策ネットワークに入 力される「StとSt^diff」の2つを入力するのをどのように実装しているの か気になる (通常,t時刻に対する状態は1つだけいれる) ❏ 他のロボット (hopper,halfcheetah,ant)による実験でも,同様の結果が得 られるのか気になる ❏ この研究では,オンライン強化学習の設定で行っているが,オフライン強 化学習の設定で行った場合,結果に変化があるのか見てみたい まとめと感想 4/4