Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
失敗を経験したあなたへ〜建設的なインシデントの振り返りを行うために実践するべきこと〜
Search
NobuakiKikuchi
May 20, 2022
Technology
0
620
失敗を経験したあなたへ〜建設的なインシデントの振り返りを行うために実践するべきこと〜
JAWS-UG SRE支部 #3
今回のテーマは「これってSREなの?LT大会」
NobuakiKikuchi
May 20, 2022
Tweet
Share
More Decks by NobuakiKikuchi
See All by NobuakiKikuchi
ハッカー飯に New Relic を導入して実践した3つのこと
nobuakikikuchi
0
630
エンジニアと気軽に繋がれるプラットフォーム「ハッカー飯」で行った セキュリティ・モニタリングに関する取り組みについて
nobuakikikuchi
0
740
約1万台のサーバー運用を行うMSPの舞台裏
nobuakikikuchi
0
430
Dockerをざっくり知る
nobuakikikuchi
0
680
Other Decks in Technology
See All in Technology
Gradle Build Scanを使ってビルドのことを知ろう potatotips #87
tomorrowkey
2
160
[新卒向け研修資料] テスト文字列に「うんこ」と入れるな(2024年版)
infiniteloop_inc
5
18k
エンジニア候補者向け資料2024.04.24.pdf
macloud
0
3.4k
アクセス制御にまつわる改善 / Improving access control
itkq
0
590
Building a RAG-poweredAI chat appwith Python and VS Code
pamelafox
0
160
リテール金融(キャッシュレス・ネット銀行・ネット証券)の競争環境と経済圏
8maki
0
1.6k
令和最新版 Ruby プロファイラ "Pf2" のご紹介
osyoyu
0
120
非同期推論システムによるコスト削減と信頼性向上
koki_nishihara
1
360
今日からできる!簡単 .NET 高速化 Tips -2024 edition-
xin9le
7
4k
ルーターでプレゼンする
puhitaku
1
3.3k
家族アルバム みてねにおけるGrafana活用術 / Grafana Meetup Japan Vol.1 LT
isaoshimizu
1
1k
AWS学習者向けにAzureの解説スライドを作成した話
handy
3
200
Featured
See All Featured
Teambox: Starting and Learning
jrom
128
8.4k
A Philosophy of Restraint
colly
197
16k
How to name files
jennybc
65
93k
Web Components: a chance to create the future
zenorocha
306
41k
Reflections from 52 weeks, 52 projects
jeffersonlam
345
19k
Optimising Largest Contentful Paint
csswizardry
12
2.4k
GraphQLとの向き合い方2022年版
quramy
33
12k
Building Better People: How to give real-time feedback that sticks.
wjessup
356
18k
The Pragmatic Product Professional
lauravandoore
26
5.8k
10 Git Anti Patterns You Should be Aware of
lemiorhan
649
58k
Embracing the Ebb and Flow
colly
80
4.2k
The MySQL Ecosystem @ GitHub 2015
samlambert
244
12k
Transcript
失敗を経験したあなたへ ~建設的なインシデントの振り返りを行うために実践するべきこと~ 2022/05/20 JAWS-UG SRE支部 #3 菊池 宣明
このセッションでお話しすること SRE 本の “Postmortem Culture: Learning from Failure” の章では事後分析 (Postmortem)
について記載されています。 また、インシデントが発生しても非難を行わず、建設的な事後分析を行うことは SRE の信条で あるとも説明されています。 https://sre.google/sre-book/table-of-contents/
このセッションでお話しすること SRE 本の “Postmortem Culture: Learning from Failure” の章では事後分析 (Postmortem)
について記載されています。 また、インシデントが発生しても非難を行わず、建設的な事後分析を行うことは SRE の信条で あるとも説明されています。 今日はここに着目します https://sre.google/sre-book/table-of-contents/
このセッションでお話しすること SRE 本の “Postmortem Culture: Learning from Failure” の章では事後分析 (Postmortem)
について記載されています。 また、インシデントが発生しても非難を行わず、建設的な事後分析を行うことは SRE の信条で あるとも説明されています。 失敗が発生した際に自分および周りの人はどのような立ち回りをすると良いのかについて僕の 考えを述べていこうと思います! https://sre.google/sre-book/table-of-contents/ 今日はここに着目します
自己紹介
• 菊池 宣明(Twitter:@kikulabo) ◦ 普段は X-Tech 5 で SRE 業務を行っています
◦ 副業で「ハッカー飯」というサービスの運営と開発をやってます • 趣味 ◦ ゲーム(スマブラ、Fortnite) • 好きな AWS のサービス ◦ AWS サポート
”失敗” した経験ありますか?
僕の失敗エピソード① EC2 のインスタンスタイプを変更する際に ELB から外さず作業を行った
僕の失敗エピソード② 「再起動しない」にチェックを入れずに AMI を取得しサービス影響を起こした
僕の失敗エピソード③ お客様が使用しているユーザを全て削除(無効化)してしまった
人の手で運用している以上 インシデントの発生は避けられない
失敗は学びに変えろと世間一般的には言われるが…
初めのうちはメンタル的に失敗を受け入れるのは辛い
ではメンタルをどのように回復させれば良いか?
僕が失敗をしてしまった時のルーチン① インシデントの対処後その日の業務は終了する 理由:落ち込んでいる時に続けて作業をするのは効率が悪いから
僕が失敗をしてしまった時のルーチン② 普段よりも贅沢して美味しいものを食べる 理由:手っ取り早く幸福感を味わえるから
僕が失敗をしてしまった時のルーチン③ 沢山寝る 理由:睡眠とメンタルヘルスには密接な関係があるから
メンタルの復旧が行われてからインシデントの振り返りを行う ※詳細を忘れてしまうこともあるので次の日には取り組むようにしましょう
自分の部下がインシデントを起こしてしまった時は
報告内容に関して批判を行わない 理由:心理的安全性を確保できるから(隠蔽化されるケースを防ぐため)
ミスを許容し対処内容に関して称賛する 理由:組織全体としてミスに対する理解を促進させるため
インシデントの振り返りを部下と一緒に行う 理由:インシデントの発生原因を自分の不注意のせいにしがちになるから 運用でカバーするのではなく仕組みで解決できるように上司は導いてあげる
インシデントの振り返り:ポストモーテムに関する参考記事 • Postmortem Culture: Learning from Failure ◦ https://sre.google/sre-book/postmortem-culture/ •
失敗から学ぶ - ポストモーテム / Postmotem culture at Wantedly ◦ https://speakerdeck.com/munisystem/postmotem-culture-at-wantedly • 1年間のポストモーテム運用とそこから生まれたツール sre-advisor / SRE NEXT 2022 ◦ https://speakerdeck.com/fujiwara3/1nian-jian-falseposutomotemuyun-yong-tosokokarasheng-maretatu ru-sre-advisor
このセッションで伝えたかったこと • インシデント対応も大事だが自分のメンタルの復旧作業も忘れずに取り組むこと • 自分の部下が失敗した時はメンタルヘルスケアを行ってあげること • 組織としてミスを許容し批判を行わず障害に対して健全な議論を行うこと ご清聴ありがとうございました!