Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
SREのエッセンスを運用・保守に無理矢理入れようとして失敗した話
Search
Sponsored
·
SiteGround - Reliable hosting with speed, security, and support you can count on.
→
土井淳
August 25, 2022
Technology
610
1
Share
SREのエッセンスを運用・保守に無理矢理入れようとして失敗した話
土井淳
August 25, 2022
Other Decks in Technology
See All in Technology
2026-04-02 IBM Bobオンボーディング入門
yutanonaka
0
210
I ran an automated simulation of fake news spread using OpenClaw.
zzzzico
1
930
チームで育てるAI自走環境_20260409
fuktig
0
720
OCI技術資料 : ロード・バランサ 概要 - FLB・NLB共通
ocise
4
27k
レガシーシステムをどう次世代に受け継ぐか
tachiiri
0
260
自分をひらくと次のチャレンジの敷居が下がる
sudoakiy
5
1.8k
不確実性と戦いながら見積もりを作成するプロセス/mitsumori-process
hirodragon112
1
190
会社紹介資料 / Sansan Company Profile
sansan33
PRO
16
410k
ZOZOTOWNリプレイスでのSkills導入までの流れとこれから
zozotech
PRO
4
2.5k
BIツール「Omni」の紹介 @Snowflake中部UG
sagara
0
190
Kubernetes基盤における開発者体験 とセキュリティの両⽴ / Balancing developer experience and security in a Kubernetes-based environment
chmikata
0
170
今年60歳のおっさんCBになる
kentapapa
1
160
Featured
See All Featured
The Limits of Empathy - UXLibs8
cassininazir
1
280
The Director’s Chair: Orchestrating AI for Truly Effective Learning
tmiket
1
140
Designing Experiences People Love
moore
143
24k
The Impact of AI in SEO - AI Overviews June 2024 Edition
aleyda
5
780
Put a Button on it: Removing Barriers to Going Fast.
kastner
60
4.2k
Measuring & Analyzing Core Web Vitals
bluesmoon
9
800
Context Engineering - Making Every Token Count
addyosmani
9
790
Visual Storytelling: How to be a Superhuman Communicator
reverentgeek
2
490
Refactoring Trust on Your Teams (GOTO; Chicago 2020)
rmw
35
3.4k
Color Theory Basics | Prateek | Gurzu
gurzu
0
280
Exploring the relationship between traditional SERPs and Gen AI search
raygrieselhuber
PRO
2
3.8k
Practical Tips for Bootstrapping Information Extraction Pipelines
honnibal
25
1.8k
Transcript
SREのエッセンスを運用・保 守に無理矢理入れようとして 失敗した話 株式会社mediba テクノロジーセンター 土井
自己紹介 土井 淳 (Jun Doi) 職業: 株式会社mediba テクノロジーセンター テクノロジー統合 UNIT
業務内容: SREチーム リーダー・インフラ開発・運用 メモ: AWS歴5年 GCP歴: 1年程度 好きなサービスはAWS LambdaとStep Functions Twitter: @zuuundayo 2 2
注意 本発表並びにスライドに記載されている内容はあくまで個人の見解・発表であり、 所属する会社の公式な見解・発表ではございません。 3
目次 1. 何を行ったのか 2. SLI/SLOを運用・保守に取り入れてみてど うだった? 3. SLI/SLOを導入するための教訓 4
1. 何を行ったのか 5
1. 何を行ったのか • 弊社のSRE組織の起源はインフラストラクチャー部 ◦ これからの時代はインフラだけでは喰っていけない ◦ インフラ以外にも領域を広げていこう ◦ 部名がSRE推進部に変更
6
1. 何を行ったのか • SREという名前になったが... ◦ 活動内容はインフラストラクチャー部のまま ▪ 運用・保守に我々の活動指標としてSLI/SLOを取り入れよう Service Level
Indicator (SLI) システムの状態・パフォーマンスを把握するための指標 Service Level Objective (SLO) SLIの目標値・範囲 ex.) レイテンシー, エラー率, スループット, 稼働率 ユーザから見た時にあるべきシステム状態の目標(こういう状態であるべき) SLOによって仕事の優先順位を判断することもあり得ます(修繕か改善か 7
1. 何を行ったのか • なぜSLI/SLOを導入するのか? ◦ 様々なサービスのシステムがあるため俯瞰して状況を見づらい ▪ ダッシュボードを作ることで確認しやすく ◦ ユーザファーストを実現する
▪ ユーザが体験している状況を把握し、改善につなげる ◦ インフラは縁の下の力持ちで存在感がない ▪ 存在感を出していくためにも 成果を目に見える形に 8
1. 何を行ったのか • 導入にあたって準備したこと ◦ 全社への説明会 ◦ メトリクスの収集機構 ◦ ダッシュボードの作成
▪ QuickSight+ Azure AD SSO ▪ だれでもログインして閲覧できる 9
1. 何を行ったのか • どのようなSLIを取得したのか ◦ 数多くのシステムがある ▪ 共通で取得できる指標を一 括で集める •
ざっくりとSLOを設定 • ユーザ視点 • 可用性 • 月間稼働率 • 月間エラー率 • 月間レイテンシ • システム視点寄り • 月間アラート数 • 月間平均修復時間(MTTR) 10
2. SLI/SLOを運用・保守に取り入れてみ てどうだった? 11
2. SLI/SLOを運用・保守に取り入れてみてどうだった? • レポート内容を毎月担当からチームに共有 ◦ 要因等を開発チームにフィードバック • 稼働率等は時系列で永続的に記録 12
• よかったこと👍 ◦ QuickSightの知見を得ることができた ◦ SLIを上手く集約して閲覧できるようにできた • よくなかったこと👎 ◦ SLIデータは取得できたが運用・保守にはあまり役立たなかった
▪ 共通で取得したデータからわかることが少ない ▪ システムの現状が如実に表されていない ◦ SLI/SLO を活用した運用のイメージが具体的ではなかった ▪ 数値が悪くなった場合にどのような対応を取るべきか具体的では なかった(原因と結びつきにくい値) 13 → 結果としてあまり利用されずに運用はストップ 2. SLI/SLOを運用・保守に取り入れてみてどうだった?
3. SLI/SLOを導入するための教訓 14
3. SLI/SLOを導入するための教訓 15 • 欲張るな! ◦ 複数プロダクトまとめてやるのは難しい ◦ プロダクトごとの事情を汲み取るべし •
CUJ(Critical User Jorney)を基に決めよう ◦ ユーザにとっての不利益 (= ビジネス機会損失)を検知できる指標 • 運用イメージを具体的に考えられる値にしよう ◦ この値がこうだったらこういう影響が出ているからこうするといった運用をイメージできる指標を探す ▪ 可観測性を重視した メトリクス取得し、観察することでシステム特性も分かる ▪ まあそれが難しいんですけどね...
宣伝 現在弊社では毎月mediba Tech Cafeというイベントを行ってます! mediba Tech Cafe #9 「medibaのエンジニア解体新書〜1日の過ごし方編〜」 •
開催日: 8月30日(火)12:00 ~ 13:00 • 場所: オンライン (Youtube Live) • Connpassにて募集中 ◦ https://mediba-tech-cafe.connpass.com/event/257634/ 16 エンジニアブログもやってます https://ceblog.mediba.jp/ 色んな仲間も募集中です〜 (複業としても・複業やってても OK) https://hrmos.co/pages/mediba/jobs (ご興味あればぜひ)
おわりに 現在、SLI/SLOを用いた運用に再チャレンジ中です。 また別の機会に得られた知見を共有しようと思ってます。 ご清聴ありがとうございました! 17