Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
GKE上でオセロの強化学習やってみた
Search
Daisuke Akagawa (Akasan)
July 28, 2026
Science
81
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
GKE上でオセロの強化学習やってみた
Daisuke Akagawa (Akasan)
July 28, 2026
More Decks by Daisuke Akagawa (Akasan)
See All by Daisuke Akagawa (Akasan)
バランスって大事だね
akasan
1
110
生成AI時代のエンジニア育成について考えてみた
akasan
0
210
How_to_create_MLOps_Team.pdf
akasan
0
37
MLOps導入のための組織作りの第一歩
akasan
0
640
NVIDIA GTC2026 AI技術トレンドレポート
akasan
0
130
NVIDIA NIMによるモデルのサービングと NVIDIA NeMo Guardrailsによる安全性の担保
akasan
0
250
言語モデルに対する攻撃とその予防策について
akasan
0
43
Other Decks in Science
See All in Science
機械学習 - pandas入門
trycycle
PRO
0
680
AIPシンポジウム 2025年度 成果報告会 「因果推論チーム」
sshimizu2006
3
590
人生を変えた一冊「独学大全」のはなし / Self-study ENCYCLOPEDIA: The Book Which Change My Life #独学大全 #EM推し本
expajp
0
190
AlgorithAlgorihms for Decision Making
mickey_kubo
0
120
機械学習 - SVM
trycycle
PRO
2
1.2k
因果推論と機械学習
sshimizu2006
1
1.3k
[第67回 CV勉強会@関東] CV × Scientific Figures / kantoCV 67th CVPR 2026
lychee1223
0
170
機械学習 - 授業概要
trycycle
PRO
0
590
プロジェクト「Azayaka」のSARの数式とジオメトリ
syuchimu
0
430
Conversation is the New Dashboard: 属人性を排除する第4世代BIツールの勢力図
shomaekawa
1
630
大黒市で発生した大規模インシデント の ポストモーテムから読み解く、 記憶媒体消去の大切さ
shucho0103
0
230
テンソル分解を用いたVisiumデータの高精度・高速デコンボリューション手法
tagtag
PRO
0
110
Featured
See All Featured
10 Git Anti Patterns You Should be Aware of
lemiorhan
PRO
659
62k
AI Search: Where Are We & What Can We Do About It?
aleyda
0
7.8k
Unlocking the hidden potential of vector embeddings in international SEO
frankvandijk
0
890
Art, The Web, and Tiny UX
lynnandtonic
304
22k
Bridging the Design Gap: How Collaborative Modelling removes blockers to flow between stakeholders and teams @FastFlow conf
baasie
0
650
Why You Should Never Use an ORM
jnunemaker
PRO
61
10k
The Success of Rails: Ensuring Growth for the Next 100 Years
eileencodes
47
8.3k
Java REST API Framework Comparison - PWX 2021
mraible
34
9.6k
Odyssey Design
rkendrick25
PRO
2
760
Exploring the Power of Turbo Streams & Action Cable | RailsConf2023
kevinliebholz
37
6.6k
Navigating the moral maze — ethical principles for Al-driven product design
skipperchong
2
490
Conquering PDFs: document understanding beyond plain text
inesmontani
PRO
4
3k
Transcript
GKE上でオセロの強化学習やってみた 株式会社スリーシェイク Sreake事業部 赤川 大空 Copyright © 3-shake, Inc. Al
l Right s Reserved.
自己紹介 - 赤川大空(Akasan) - 株式会社スリーシェイク Sreake事業部 アプリチームの中で、特にML領域を担当 - - MLOpsの構築支援や生成AIアプリケーションの実装
- NVIDIA Inceptionパートナーとしての活動のリード 最近の興味 - MLOps - ML/AI - クラウド(Google Cloudを中心) 2
アジェンダ 1. オセロの強化学習について 2. GKEで環境構築 3. フロントエンドからアクセスしてみる 3
01 オセロの強化学習について Copyright © 3-shake, Inc. Al l Right s
Reserved. 4
オセロとは 説明する必要はないかと思いますが、超有名なゲームです • 2人のプレイヤーでするゲーム • 黒と白のコマをルールに則り置いていき、最終的に自分の色のコマが多い方がかち • 先行は黒、後攻は白 • 盤は8x8で、最初に中心に交差する形で黒と白が2x2のサイズで置かれる
• 違う色で挟まれると、その間の色を変えることができる • 縦横斜めどの方向でも挟むことができれば色を変えられる 5
強化学習とは 強化学習とは、試行錯誤して成功や失敗を経験し、 頭を良くしていく人工知能の学習方法の一つです • エージェントは環境とやりとりする能力がある(オセロで言うとプレイヤー) • エージェントは環境を認識することができる(盤面を知る) • エージェントは独自のルールに則って行動をすることができる(コマを置く) •
どのような行動をしたか、最終的に成功したかなどさまざまな要因によってエージェン トは報酬を得ることができる 強化学習の方法は、報酬を少しでも多くゲットできるように独自ルールを鍛える作業です 6
今回作ったモデル 今回モデルの実装も全てAIにやらせてみました 7
02 GKEで環境構築 Copyright © 3-shake, Inc. Al l Right s
Reserved. 8
GKEとは 今回はGKEを使って強化学習基盤を作ります GKEとは以下のようなサービスです • Kubernetesオープンソースコンテナオーケストレーションプラットフォーム • Autopilot:自動でリソースを管理し、アプリケーションの実装に集中できる • Standard:手動で柔軟な設計を実現 •
Google Cloudのロギングなど各種サービスとの連携 https://docs.cloud.google.com/kubernetesengine/docs/concepts/kubernetes-engine- 9 overview?hl=ja
なぜGKEで?? 今回実現しようとしていることはローカルPCでも実現可能です 今回は以下のような理由によりGKEでやってみました • 多くの学習を同時に実行したく、ローカルPCだとリソースが心配 • 必要に応じてスケーリングできるような仕組みにしたかった • GKEを単純に使いたかった なお今回は利用しませんでしたが、大規模なディープラーニングモデルを利用したモ
デルを使うときはGPUを利用できるPodを作成することもできます 大規模なワークロードを実現したい方にももってこいなサービスです! ※ ローカルPC(macbook)で動かしたらファンが爆音で回ってましたw 10
今回のアーキテクチャ 今回構築するにあたり要件は以下のように定義しました • A開発するモデルの種類は以下(内部でいくつかあります) マスの位置に対してスコアを手動定義 探索アルゴリズムにより深い探索を実現 ニューラルネットワークによる打ち手の計算 • Podの用途:フロントエンド、バックエンド、モデル学習、モデル評価 •
モデルファイルはCloud Storageに配置し、gcsfuseを利用してマウント 11
全体アーキテクチャ 12
Pod構成 13
ノードプール 14
モデル学習 学習Podは学習用のバイナリを継続して実行し続け学習をひたすら行なっています 15
技術スタック 16
デプロイ手順 以下の手順でデプロイしました 1. TerraformによりリソースをGoogle Cloud上に作成 2. ローカルでサーバイメージをビルドし、Artifact Registryにアップロード 3. Terraformのoutputを元に、kubectl等でGKE上のK8s環境を更新
17
03 フロントからアクセスしてみる Copyright © 3-shake, Inc. Al l Right s
Reserved. 18
AIと戦う機能 19
モデルの学習状況の可視化 20
対他モデルとの戦績 21
内部で学習がどんな感じで動いているか 22
他のモデルとの対戦成績 23
任意のモデルの対戦も見れます 24
CPUとメモリ使用量 25
まとめ Copyright © 3-shake, Inc. Al l Right s Reserved.
26
まとめ • オセロの強化学習モデルをAIに考えさせたから、次は学習機能自体も自分で作りたい • GKEの構成はもっと工夫できるところがありそうなので、パフォーマンス上げたい • 盤面データを集めて学習に利用できるような環境は用意してないので今後やってみたい • Rayを使って分散コンピューティングを実現して、よりリソースをうまく使いながらデー タ基盤構築・モデルの学習をさせてみたい
触ってみたい人は右のQRかリンクからGitHubみてください! https://github.com/Akasan/Othello_k8s 27