Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
令和のミニ四駆!? AWS DeepRacer で強化学習に入門してみた
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
ryu-ki
May 01, 2025
420
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
令和のミニ四駆!? AWS DeepRacer で強化学習に入門してみた
ryu-ki
May 01, 2025
More Decks by ryu-ki
See All by ryu-ki
VPCとも向き合いたい2026(年度)
ryuki0947
0
200
Strands Agents × AWS DevOps Agent 〜自作エージェントに組み込んでみた〜
ryuki0947
0
83
AI-DLCを試してみて困ったことを共有したい
ryuki0947
0
420
Claude Codeに要件をヒアリングしてもらった体験がかなり良かった(2026年版)
ryuki0947
0
480
Qiita 週1投稿を1年間完走した感想
ryuki0947
0
60
AWS × LINE で始める FinOps ~Terraform を添えて~
ryuki0947
0
160
A2A のトレース事情 〜親子エージェントの動きをLangfuseで可視化してみる〜
ryuki0947
1
620
A2A においてエージェント同士はどのようにやりとりしているのか
ryuki0947
0
350
継続してアウトプットするヒントになる...かもしれない話
ryuki0947
0
110
Featured
See All Featured
Why Mistakes Are the Best Teachers: Turning Failure into a Pathway for Growth
auna
0
180
Paper Plane (Part 1)
katiecoart
PRO
1
9.7k
[SF Ruby Conf 2025] Rails X
palkan
2
1.2k
So, you think you're a good person
axbom
PRO
2
2.1k
実際に使うSQLの書き方 徹底解説 / pgcon21j-tutorial
soudai
PRO
201
75k
How Fast Is Fast Enough? [PerfNow 2025]
tammyeverts
3
650
Raft: Consensus for Rubyists
vanstee
141
7.6k
BBQ
matthewcrist
89
10k
Templates, Plugins, & Blocks: Oh My! Creating the theme that thinks of everything
marktimemedia
31
2.8k
Why Our Code Smells
bkeepers
PRO
340
58k
GraphQLとの向き合い方2022年版
quramy
50
15k
Intergalactic Javascript Robots from Outer Space
tanoku
273
27k
Transcript
令和のミニ四駆!? AWS DeepRacerで強化学習に入門してみた 2025/05/10(土) JAWS-UG 彩の国埼玉支部#1 ~AWS Summit前のウォームアップ~ 知識をアップデート!
自己紹介 ┃所属:TIS株式会社 ‐ 年次:2年目(24卒) ‐ 担当業務:社内サービス(AWS/Terraform/React) ┃大宮初上陸です! ┃好きなAWSサービス:AWS Lambda 2
井町 瑠貴 (umitsu) 昨年末からQiitaへの記事投稿を 始めました!(AWS・生成AIなど)
はじめに ┃本日お話しすること 3 AWS DeepRacerについて 強化学習の概要について
はじめに ┃本日お話しすること 4 AWS DeepRacerについて 強化学習の概要について ・サービス概要 ・使い方 ・学習結果の確認(デモ) ・基本要素
・学習の流れ(プロセス)
5 AWS DeepRacer をご存じでしょうか?
AWS DeepRacer ┃公式より引用[1] 6 強化学習を楽しく、実践的に学べる プラットフォーム あらゆるレベルレベルのデベロッパーが、クラウドベースの3Dレーシング シミュレーター、強化学習により駆動する1/18スケールの 完全自走型レーシングカーを通じて機械学習を実践的に学べます。 [1]
https://aws.amazon.com/jp/deepracer/
AWS DeepRacer ┃公式より引用[1] 7 強化学習を楽しく、実践的に学べる プラットフォーム あらゆるレベルレベルのデベロッパーが、クラウドベースの3Dレーシング シミュレーター、強化学習により駆動する1/18スケールの 完全自走型レーシングカーを通じて機械学習を実践的に学べます。 [1]
https://aws.amazon.com/jp/deepracer/ ※2025/12 で終了予定
AWS DeepRacer ┃昨年のAWS Summit Japanでは日本一決定戦も実施[2] 8 [2] https://aws.amazon.com/jp/builders-flash/202408/deepracer-jp-championship/
9 強化学習とはなんでしょうか?
(おまけ)機械学習 10 大量のデータを分析し パターンやルールを抽出する
強化学習|概要 11 試行錯誤を繰り返して、最適な行動を 決定していく 行動 状態・報酬 エージェント 環境
強化学習|基本要素 12 1. エージェント:レーシングカー 2. 環境:レーストラック 3. 状態:トラックの様子・車両の位置 4. 行動:車両の速度や角度の調整
5. 報酬:報酬関数による評価結果
強化学習|プロセス 13 1. エージェントが環境の現在の状態を観察 2. 何らかの行動を選択(環境・状態が変化) 3. 行動の結果として報酬を受け取る 4. よりよい行動を選べるよう学習
14 実際にDeepRacerを触ってみましょう
モデル作成 15 モデル名・説明の入力
モデル作成|環境設定 16 コースの選択
モデル作成|レースタイプ 17 レースタイプの選択
モデル作成|アクションスペース 18 “Continuous action space” を選択
モデル作成|アクションスペース 19 “Continuous action space” の範囲を設定
モデル作成|マシンの設定 20
モデル作成|報酬関数の設定 21 車体がコースの中央から 逸れるほど報酬が少なくなる
モデル作成|トレーニングの設定 22 最大トレーニング時間を設定
トレーニングの実施 23
モデルの評価 24
25 報酬関数を改善してみましょう
報酬関数の改善|改善前 26 def reward_function(params): track_width = params['track_width'] distance_from_center = params['distance_from_center']
marker_1 = 0.1 * track_width marker_2 = 0.25 * track_width marker_3 = 0.5 * track_width if distance_from_center <= marker_1: reward = 1.0 elif distance_from_center <= marker_2: reward = 0.5 elif distance_from_center <= marker_3: reward = 0.1 else: reward = 1e-3 return float(reward)
報酬関数の改善|改善前 27 def reward_function(params): track_width = params['track_width'] distance_from_center = params['distance_from_center']
marker_1 = 0.1 * track_width marker_2 = 0.25 * track_width marker_3 = 0.5 * track_width if distance_from_center <= marker_1: reward = 1.0 elif distance_from_center <= marker_2: reward = 0.5 elif distance_from_center <= marker_3: reward = 0.1 else: reward = 1e-3 return float(reward) 車体がコースの中央から 逸れるほど報酬が少なくなる
報酬関数の改善|改善後 28 speed_reward = speed / 2.0 reward += speed_reward
ABS_STEERING_THRESHOLD = 30 steering_penalty = steering_angle / ABS_STEERING_THRESHOLD reward *= (1 - steering_penalty) return float(reward)
報酬関数の改善|改善後 29 speed_reward = speed / 2.0 reward += speed_reward
ABS_STEERING_THRESHOLD = 30 steering_penalty = steering_angle / ABS_STEERING_THRESHOLD reward *= (1 - steering_penalty) return float(reward) 速度が速いほど報酬が大きくなる
報酬関数の改善|改善後 30 speed_reward = speed / 2.0 reward += speed_reward
ABS_STEERING_THRESHOLD = 30 steering_penalty = steering_angle / ABS_STEERING_THRESHOLD reward *= (1 - steering_penalty) return float(reward) 角度が小さいほど報酬が大きくなる
報酬関数の改善|改善後 31
まとめ ┃本日お話ししたこと 32 AWS DeepRacerについて 強化学習の概要について 強化学習を楽しく、実践的に学べる プラットフォーム 試行錯誤を繰り返して最適な行動を決定
おわりに|感想 33 ┃AWS DeepRacerで気軽に強化学習に入門できる ┃報酬関数を調整する形でタイム向上に挑戦 ┃報酬関数を調整し始めたときは、挙動が大きく 変わったのでおもしろい 一度触ってみませんか?