Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
令和のミニ四駆!? AWS DeepRacer で強化学習に入門してみた
Search
ryu-ki
May 01, 2025
430
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
令和のミニ四駆!? AWS DeepRacer で強化学習に入門してみた
ryu-ki
May 01, 2025
More Decks by ryu-ki
See All by ryu-ki
AgentCore Harness × AgentCore Browser × Live View
ryuki0947
1
110
VPCとも向き合いたい2026(年度)
ryuki0947
0
330
Strands Agents × AWS DevOps Agent 〜自作エージェントに組み込んでみた〜
ryuki0947
0
88
AI-DLCを試してみて困ったことを共有したい
ryuki0947
0
460
Claude Codeに要件をヒアリングしてもらった体験がかなり良かった(2026年版)
ryuki0947
0
500
Qiita 週1投稿を1年間完走した感想
ryuki0947
0
61
AWS × LINE で始める FinOps ~Terraform を添えて~
ryuki0947
0
160
A2A のトレース事情 〜親子エージェントの動きをLangfuseで可視化してみる〜
ryuki0947
1
630
A2A においてエージェント同士はどのようにやりとりしているのか
ryuki0947
0
370
Featured
See All Featured
Agile Actions for Facilitating Distributed Teams - ADO2019
mkilby
0
240
Fashionably flexible responsive web design (full day workshop)
malarkey
408
67k
Chrome DevTools: State of the Union 2024 - Debugging React & Beyond
addyosmani
10
1.3k
Why You Should Never Use an ORM
jnunemaker
PRO
61
10k
WENDY [Excerpt]
tessaabrams
11
39k
Making the Leap to Tech Lead
cromwellryan
135
10k
実際に使うSQLの書き方 徹底解説 / pgcon21j-tutorial
soudai
PRO
201
75k
GitHub's CSS Performance
jonrohan
1033
470k
What does AI have to do with Human Rights?
axbom
PRO
1
2.3k
Kristin Tynski - Automating Marketing Tasks With AI
techseoconnect
PRO
0
440
Design of three-dimensional binary manipulators for pick-and-place task avoiding obstacles (IECON2024)
konakalab
0
530
How to Think Like a Performance Engineer
csswizardry
28
2.7k
Transcript
令和のミニ四駆!? AWS DeepRacerで強化学習に入門してみた 2025/05/10(土) JAWS-UG 彩の国埼玉支部#1 ~AWS Summit前のウォームアップ~ 知識をアップデート!
自己紹介 ┃所属:TIS株式会社 ‐ 年次:2年目(24卒) ‐ 担当業務:社内サービス(AWS/Terraform/React) ┃大宮初上陸です! ┃好きなAWSサービス:AWS Lambda 2
井町 瑠貴 (umitsu) 昨年末からQiitaへの記事投稿を 始めました!(AWS・生成AIなど)
はじめに ┃本日お話しすること 3 AWS DeepRacerについて 強化学習の概要について
はじめに ┃本日お話しすること 4 AWS DeepRacerについて 強化学習の概要について ・サービス概要 ・使い方 ・学習結果の確認(デモ) ・基本要素
・学習の流れ(プロセス)
5 AWS DeepRacer をご存じでしょうか?
AWS DeepRacer ┃公式より引用[1] 6 強化学習を楽しく、実践的に学べる プラットフォーム あらゆるレベルレベルのデベロッパーが、クラウドベースの3Dレーシング シミュレーター、強化学習により駆動する1/18スケールの 完全自走型レーシングカーを通じて機械学習を実践的に学べます。 [1]
https://aws.amazon.com/jp/deepracer/
AWS DeepRacer ┃公式より引用[1] 7 強化学習を楽しく、実践的に学べる プラットフォーム あらゆるレベルレベルのデベロッパーが、クラウドベースの3Dレーシング シミュレーター、強化学習により駆動する1/18スケールの 完全自走型レーシングカーを通じて機械学習を実践的に学べます。 [1]
https://aws.amazon.com/jp/deepracer/ ※2025/12 で終了予定
AWS DeepRacer ┃昨年のAWS Summit Japanでは日本一決定戦も実施[2] 8 [2] https://aws.amazon.com/jp/builders-flash/202408/deepracer-jp-championship/
9 強化学習とはなんでしょうか?
(おまけ)機械学習 10 大量のデータを分析し パターンやルールを抽出する
強化学習|概要 11 試行錯誤を繰り返して、最適な行動を 決定していく 行動 状態・報酬 エージェント 環境
強化学習|基本要素 12 1. エージェント:レーシングカー 2. 環境:レーストラック 3. 状態:トラックの様子・車両の位置 4. 行動:車両の速度や角度の調整
5. 報酬:報酬関数による評価結果
強化学習|プロセス 13 1. エージェントが環境の現在の状態を観察 2. 何らかの行動を選択(環境・状態が変化) 3. 行動の結果として報酬を受け取る 4. よりよい行動を選べるよう学習
14 実際にDeepRacerを触ってみましょう
モデル作成 15 モデル名・説明の入力
モデル作成|環境設定 16 コースの選択
モデル作成|レースタイプ 17 レースタイプの選択
モデル作成|アクションスペース 18 “Continuous action space” を選択
モデル作成|アクションスペース 19 “Continuous action space” の範囲を設定
モデル作成|マシンの設定 20
モデル作成|報酬関数の設定 21 車体がコースの中央から 逸れるほど報酬が少なくなる
モデル作成|トレーニングの設定 22 最大トレーニング時間を設定
トレーニングの実施 23
モデルの評価 24
25 報酬関数を改善してみましょう
報酬関数の改善|改善前 26 def reward_function(params): track_width = params['track_width'] distance_from_center = params['distance_from_center']
marker_1 = 0.1 * track_width marker_2 = 0.25 * track_width marker_3 = 0.5 * track_width if distance_from_center <= marker_1: reward = 1.0 elif distance_from_center <= marker_2: reward = 0.5 elif distance_from_center <= marker_3: reward = 0.1 else: reward = 1e-3 return float(reward)
報酬関数の改善|改善前 27 def reward_function(params): track_width = params['track_width'] distance_from_center = params['distance_from_center']
marker_1 = 0.1 * track_width marker_2 = 0.25 * track_width marker_3 = 0.5 * track_width if distance_from_center <= marker_1: reward = 1.0 elif distance_from_center <= marker_2: reward = 0.5 elif distance_from_center <= marker_3: reward = 0.1 else: reward = 1e-3 return float(reward) 車体がコースの中央から 逸れるほど報酬が少なくなる
報酬関数の改善|改善後 28 speed_reward = speed / 2.0 reward += speed_reward
ABS_STEERING_THRESHOLD = 30 steering_penalty = steering_angle / ABS_STEERING_THRESHOLD reward *= (1 - steering_penalty) return float(reward)
報酬関数の改善|改善後 29 speed_reward = speed / 2.0 reward += speed_reward
ABS_STEERING_THRESHOLD = 30 steering_penalty = steering_angle / ABS_STEERING_THRESHOLD reward *= (1 - steering_penalty) return float(reward) 速度が速いほど報酬が大きくなる
報酬関数の改善|改善後 30 speed_reward = speed / 2.0 reward += speed_reward
ABS_STEERING_THRESHOLD = 30 steering_penalty = steering_angle / ABS_STEERING_THRESHOLD reward *= (1 - steering_penalty) return float(reward) 角度が小さいほど報酬が大きくなる
報酬関数の改善|改善後 31
まとめ ┃本日お話ししたこと 32 AWS DeepRacerについて 強化学習の概要について 強化学習を楽しく、実践的に学べる プラットフォーム 試行錯誤を繰り返して最適な行動を決定
おわりに|感想 33 ┃AWS DeepRacerで気軽に強化学習に入門できる ┃報酬関数を調整する形でタイム向上に挑戦 ┃報酬関数を調整し始めたときは、挙動が大きく 変わったのでおもしろい 一度触ってみませんか?