Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
今学生に伝えたい, 監視の話 / okinawa_ac_lt
Search
Sponsored
·
SiteGround - Reliable hosting with speed, security, and support you can count on.
→
cohalz
July 06, 2019
Technology
440
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
今学生に伝えたい, 監視の話 / okinawa_ac_lt
沖縄学生×企業エンジニア 7月大LT大会!!! #okinawa_ac_lt
https://connpass.com/event/132178/
の発表資料です
cohalz
July 06, 2019
More Decks by cohalz
See All by cohalz
toittaにOpenTelemetryを導入した話 / Mackerel APM リリースパーティ
cohalz
1
900
はてなにおけるfujiwara-wareの活用やecspressoのCI/CD構成 / Fujiwara Tech Conference 2025
cohalz
3
11k
はてなのSRE組織2024 / Road to SRE NEXT@福岡
cohalz
2
2.3k
SREのキャリア、 あるいは生態 / #ya8
cohalz
11
1.8k
カンファレンスのボランティアスタッフって何やるの? / DAIMYO Meetup #4
cohalz
0
260
小さなものでも Step Functions / Serverless Meetup Fukuoka Re:boot
cohalz
0
270
ECSのCI/CD改善と標準化の取り組み / JAWS FESTA 2023 in Kyushu
cohalz
8
7.8k
ecspressoへの貢献を振り返る / JAWS-UG コンテナ支部 #24 ecspresso MeetUp
cohalz
1
9k
はてなフォトライフをECSに移行した話 / Hatena Engineer Seminar #20
cohalz
1
20k
Other Decks in Technology
See All in Technology
Rancherの紹介&Update情報(RancherJP Online Meetup #09)
yoshiyuki_kono
0
140
中期計画、2回作ってみた ~業務委託と正社員、両方の視点から~
demaecan
1
530
新規事業を牽引する技術選定 〜フルスタックTypeScript開発の実践事例〜
nullnull
3
380
Agentic Defenseとともにセキュリティエンジニアが輝き続けるには / How Security Engineers Can Keep Excelling with Agentic Defense
yuj1osm
0
140
データ基盤をDataformで整えた話 〜 開発環境を添えて 〜
takapy
0
130
やさしいA2A入門
minorun365
PRO
8
1.2k
React、まだ楽しくて草
uhyo
7
4.2k
チームで進めるAI駆動アジャイル×ウォーターフォール
kumaiu
0
120
ChatworkとBPaaS 異なる特性で学んだAI機能開発の ベストプラクティス
kubell_hr
2
3.3k
関西に縁あるMicrosoft MVPsが語るCopilotの未来
kasada
0
1.2k
社内 AI エージェント Synapse と セマンティックレイヤーの育て方
hiroakis
1
1.2k
LLMにもCAP定理があるという話
harukasakihara
0
270
Featured
See All Featured
Improving Core Web Vitals using Speculation Rules API
sergeychernyshev
21
1.5k
Joys of Absence: A Defence of Solitary Play
codingconduct
1
390
Odyssey Design
rkendrick25
PRO
2
690
DBのスキルで生き残る技術 - AI時代におけるテーブル設計の勘所
soudai
PRO
65
55k
Ten Tips & Tricks for a 🌱 transition
stuffmc
0
130
Building Adaptive Systems
keathley
44
3k
Cheating the UX When There Is Nothing More to Optimize - PixelPioneers
stephaniewalter
287
14k
Building Applications with DynamoDB
mza
96
7.1k
Designing for humans not robots
tammielis
254
26k
Design of three-dimensional binary manipulators for pick-and-place task avoiding obstacles (IECON2024)
konakalab
0
450
Refactoring Trust on Your Teams (GOTO; Chicago 2020)
rmw
35
3.5k
Designing Powerful Visuals for Engaging Learning
tmiket
1
400
Transcript
今学生に伝えたい, 監視の話 沖縄学生×企業エンジニア 7月大LT大会!!! id:cohalz
自己紹介 ・id:cohalz / @cohalz ・はてなインターン2017 Mackerelチーム ・株式会社はてな SRE (2018 ~)
監視って? ・サーバ上の様々なメトリックを元にアラート通知を飛ばす ・ CPU使用率や残り容量など
監視って? ・そのメトリックを保存して,グラフにして見る
なぜ監視の話?
今監視が大ブーム!
覚えて帰ってほしいこと ・監視ってそんなに難しくない ・開発者も監視をしてみよう
何を監視すればいいか?
何を監視すればいいか? ・「起きてほしくないこと」 ・例: Webアプリケーション ・500エラーを返す ・レスポンス時間の悪化 ・証明書の期限切れ
まずはサービスに近いところから ・大事なのはサービスが動いているか ・個別のサーバのCPUやメモリでアラートを設定しない ・アラートが飛びがちになる ・代わりにグラフで傾向を見よう
なんでもアラートを飛ばせばいいものでもない ・たくさんのアラートが飛んでくると? ・「アラート疲れ」 ・「オオカミ少年アラート」 ・サービス品質をよく考えて設計する
アラートが役立つ他の例 ・バッチの実行 ・失敗内容をアラートに含める ・システムのマイグレーション ・古いホストに接続してたらアラート ・安全にホストを落とせる
アラート設計の話
昔のアラート対応 ・インフラエンジニアもしくはSREがアラートを設計 ・対応するのも同じ人 ・同じ言語・フレームワークなので対応方法が決まっていた
最近のアラート対応 ・サービスが複雑になってきた ・言語やフレームワークもバラバラ ・一次対応だけでは済まないことも ・サービス開発者が対応しないといけない ・原因はアプリケーション自体にあることが多い
例: Webアプリケーションが見れなくなった ・MySQLのコネクション数が跳ね上がっていた ・接続数上限のため調査のために繋ぐこともできない!! ・一次対応として再起動をした
例: Webアプリケーションが見れなくなった ・MySQLのコネクション数が跳ね上がっていた ・接続数上限のため調査のために繋ぐこともできない!! ・一次対応として再起動をした ・実はアプリケーション側から接続を切っていなかった!! ・開発者にアプリケーションのコードを直してもらった
開発者も監視に関わるべき ・サービスの実装を一番良くわかっている ・実装時に懸念点があればそこを監視すればいい ・開発者がアラートを受け取る ・根本的解決が早くなるかも
コンテナ化と言語と監視 ・どの言語・フレームワークを使ってるか把握しにくくなる ・サービスから見た最小単位がコンテナになる ・とはいえ特有の監視をしなくていい理由にはならない ・開発者が関わるべき
監視の目的
起きてほしくないことが, 起こっていないを保証する
テストに似てる
テストは皆さん書いてますよね?
対象が違うだけで目的は同じ ・テストはソフトウェアだが,監視はシステムを見る http://developer.cybozu.co.jp/archives/kazuho/2010/01/cronlog-52f2.html
監視プラグイン ・プログラムを書いて対象の数字を出力するだけ ・ヘルパプラグインがあるので意外と簡単 ・既にいろんな人が作っていて,コードの参考にもなる
監視プラグイン ・欲しいプラグインはすでに誰かが作っているかも? ・欲しい機能がなかったらOSSのPR作成チャンス!
監視以外のいろいろ
監視も万能ではない 苦手なもの ・数値にならないもの ・統計・解析 ・1リクエストの詳細
監視以外のあれこれ ・ログ ・APM (Application Performance Management) ・分散トレーシング
監視以外のあれこれ ・ログ ・APM (Application Performance Management) ・分散トレーシング => サービスの見える化
「推測するな,計測せよ」
まとめ ・不安を安心に変えるために監視をする ・テストと同じ ・でもアラートはよく考えよう ・開発者も監視をしてみよう ・サービスに一番詳しいのは開発者
あわせて読みたい ・入門 監視 ・監視についてのアンチパターンなど詳しく載っている本 ・監視 入門 ~ マイクロサービス時代の監視設計 ・https://junkyard.song.mu/slides/rancher-meetup-tokyo-18 ・マイクロサービスに限らない,開発者に向けた現在の監視の話