Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
事業を横断したSRE組織の課題解決を加速する取り組み
Search
homirun
April 14, 2023
Technology
1.4k
0
Share
事業を横断したSRE組織の課題解決を加速する取り組み
Pepabo Tech Conference #20 春のSREまつり(
https://pepabo.connpass.com/event/276927/
)
homirun
April 14, 2023
More Decks by homirun
See All by homirun
tusで受けて、SFTPで流す: ファイル転送を支える構成と実装
homirun
0
240
プライベートクラウドで動くKubernetesクラスタの運用とこれから
homirun
0
220
カラーミーショップの改善におけるSRE活動について
homirun
0
1.7k
バックエンド志望だった新卒がSREになるまで
homirun
0
2.5k
謎の拡張子.ipynb_てうLT1
homirun
0
220
Other Decks in Technology
See All in Technology
QAエンジニアはどうやって プロダクト議論の場に入れるのか?
moritamasami
2
410
freeeで運用しているAIQAについて
qatonchan
0
470
Purview 勉強会報告 Microsoft Purview 入門しようとしてみた
masakichixo
1
250
生成AIはソフトウェア開発の革命か、ソフトウェア工学の宿題再提出なのか -ソフトウェア品質特性の追加提案-
kyonmm
PRO
2
870
Building Production-Ready Agents Microsoft Agent Framework
_mertmetin
0
160
Oracle Cloud Infrastructure presents managed, serverless MCP Servers for Oracle AI Database
thatjeffsmith
0
210
サンプリングは「作る」のか「使う」のか? 分散トレースのコストと運用を両立する実践的戦略 / Why you need the tail sampling and why you don't want it
ymotongpoo
3
160
試作とデモンストレーション / Prototyping and Demonstrations
ks91
PRO
0
200
カオナビに Suspenseを導入するまで / The Road to Suspense at kaonavi
kaonavi
1
440
Oracle Base Database Service 技術詳細
oracle4engineer
PRO
15
100k
フロントエンドの相手が変わった - AIが加わったWebの新しいインターフェース設計
azukiazusa1
33
11k
全社統制を維持しながら現場負担をどう減らすか〜プラットフォームチームとセキュリティチームで進めたSecurity Hub活用によるAWS統制の見直し〜/secjaws-security-hub-custom-insights
mhrtech
1
260
Featured
See All Featured
The Hidden Cost of Media on the Web [PixelPalooza 2025]
tammyeverts
2
290
HU Berlin: Industrial-Strength Natural Language Processing with spaCy and Prodigy
inesmontani
PRO
0
370
Side Projects
sachag
455
43k
Become a Pro
speakerdeck
PRO
31
5.9k
Ethics towards AI in product and experience design
skipperchong
2
270
Building the Perfect Custom Keyboard
takai
2
750
The Success of Rails: Ensuring Growth for the Next 100 Years
eileencodes
47
8.1k
The Art of Programming - Codeland 2020
erikaheidi
57
14k
A Soul's Torment
seathinner
6
2.8k
We Have a Design System, Now What?
morganepeng
55
8.1k
Hiding What from Whom? A Critical Review of the History of Programming languages for Music
tomoyanonymous
2
800
Understanding Cognitive Biases in Performance Measurement
bluesmoon
32
2.9k
Transcript
1 事業を横断したSRE組織の 課題解決を加速する取り組み ほみるん a.k.a 新宮 隆太 / GMO PEPABO
inc. 2023.04.14 Pepabo Tech Conference #20 春のSREまつり
技術部 プラットフォームグループ 2021年 新卒入社 2 自己紹介 新宮 隆太 Shingu Ryuta •
あだ名: ほみるん • 新卒3年目 • 自宅にKubernetesクラスタを飼ってます • Twitter : @h0mirun_deux
3 アジェンダ 1. 事業を横断したSRE組織について 2. 取り組みの紹介 3. まとめ
4 1. 事業を横断したSRE組織について
5 基本的にサービスは事業部で開発している GMOペパボのエンジニア組織 1. 事業を横断したSRE組織について 採用目的2021 技術部編 https://tech.pepabo.com/2021/06/25/hiring-tech-division-2021/
6 横断組織である技術部 GMOペパボのエンジニア組織 1. 事業を横断したSRE組織について Pepabo Tech Talk -入社1年以内のメンバーが語る、ペパボの SREチームの取り組み
- ペパボのSREについて https://tech.pepabo.com/pdf/pepabo-sre-202104.pdf
7 技術部 プラットフォームグループ 普段担当するサービスごとでチームが別れている 1. 事業を横断したSRE組織について プラットフォームグループ minneチーム SUZURIチーム ECチーム
8 技術部 プラットフォームグループ サービスから独立したSREチーム • 各サービスのSLI/SLOの策定・運用 • ソフトウェアエンジニアリングを用いたサービス運用効率化 • メトリクスを元にしたパフォーマンスチューニング
• インフラ周り • オンコール対応 1. 事業を横断したSRE組織について より具体的なSRE活動はPHP Conference 2022の動画を御覧ください!
9 2. 取り組みの紹介
10 勉強会 定期的な読書会・勉強会の実施 2. 取り組みの紹介
定期的な読書会・勉強会の実施 11 勉強会 2. 取り組みの紹介
定期的な読書会・勉強会の実施 12 勉強会 2. 取り組みの紹介
定期的な読書会・勉強会の実施 13 勉強会 2. 取り組みの紹介 など... 弊社テックブログに過去の記録があるのでぜひ見てください!
14 SoS会(スクラム・オブ・スクラム) 各事業部担当チーム間の情報共有の場 • 各チーム近況報告 • オンコール対応の共有 • 困りごとの相談 2.
取り組みの紹介
15 全員オンコール 夜間・休日のオンコールは担当チームの枠を超えて全サービスを見る体制 2. 取り組みの紹介 プラットフォームグループ minneチーム SUZURIチーム ECチーム minne事業部の
サービス SUZURI事業部の サービス EC事業部の サービス 平日昼
16 全員オンコール 夜間・休日のオンコールは担当チームの枠を超えて全サービスを見る体制 2. 取り組みの紹介 プラットフォームグループ minneチーム SUZURIチーム ECチーム minne事業部の
サービス SUZURI事業部の サービス EC事業部の サービス 夜間・休日
17 全員オンコール 夜間・休日のオンコールは担当チームの枠を超えて全サービスを見る体制 • オンコール負荷の軽減 • オンコール待機時間が平均化されるように • 不要なアラートの精査・自動化の優先度が上昇 •
サービス特有の事情はドキュメント化 詳しくは、弊社テックブログを見てください! 2. 取り組みの紹介
18 オンコールトレーニング 過去のアラートを使って、どのように解決していくとよいかを考えるトレーニング • チームにジョインしたばかりのメンバーがオンコールに入りやすくなる • 普段担当していないサービスへの理解が進む 2. 取り組みの紹介
19 オンコールトレーニング - レギュレーション 出題者と回答者に分かれて実施する 1. 出題者は発生した事象例を回答者に説明 2. 取り組みの紹介 この監視が落ちたら
まず何をしますか? 出題者 回答者
20 オンコールトレーニング - レギュレーション 出題者と回答者に分かれて実施する 1. 出題者は発生した事象例を回答者に説明 2. 回答者は自分の考えを説明して原因と対策を回答 2.
取り組みの紹介 まずユーザー影響を確認していきます! 具体的には... 出題者 回答者
21 オンコールトレーニング - レギュレーション 出題者と回答者に分かれて実施する 1. 出題者は発生した事象例を回答者に説明 2. 回答者は自分の考えを説明して原因と対策を回答 3.
出題者が回答者の回答に対してフィードバック 2. 取り組みの紹介 よさそうです! 更に良くするなら.... 出題者 回答者
22 3. まとめ
23 今回お話したこと • サービスを横断したSRE組織が各サービスのエンジニアと協力して、サービスの 信頼性を向上させている。 • サービス横断組織の強みを活かすために、様々な取り組みを行っている。 3. まとめ
ご静聴ありがとうございました! 24