Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
導入から5年が経って見えた Datadog APM 運用の課題
Search
Atsushi Tanaka
March 13, 2024
Programming
3
1.1k
導入から5年が経って見えた Datadog APM 運用の課題
Japan Datadog User Group Meetup#3
https://datadog-jp.connpass.com/event/309899/
Atsushi Tanaka
March 13, 2024
Tweet
Share
More Decks by Atsushi Tanaka
See All by Atsushi Tanaka
KubernetesでDatadogを飼うならオートディスカバリーを使わないと損
bgpat
1
340
マイクロサービス基盤にフルマネージドサービスではなくKubernetesを選択する理由
bgpat
12
2.5k
400万ユーザーに価値を届けるエンジニアを を支えるインフラ基盤
bgpat
3
300
Ruby製社内ツールのGo移行
bgpat
2
510
取っていてよかった Kubernetes のバックアップ
bgpat
1
530
Terraform と Kubernetes の共存による IaC の実践
bgpat
0
1.6k
Kubernetes Cluster Migration
bgpat
4
4.5k
k8sとNginxでオートスケール / Autoscaling with k8s and Nginx
bgpat
2
1.3k
GCPのgemにコントリビュートした話
bgpat
0
730
Other Decks in Programming
See All in Programming
tc39 x jsconf.jp Panel Discussion 2024
yosuke_furukawa
PRO
0
110
LangChain & LangServeでAPIを爆速作成
kijitorabuti
2
360
Workflow automationによるインシデント原因調査の自動化
showwin
1
110
ACES Meet におけるリリース作業改善の取り組み
fukucheee
0
150
今日で分かる!カスタムコップの作り方
krpk1900
2
270
CSC509 Lecture 07
javiergs
PRO
0
140
Повторное использование кода в ML: почему ML-пайплайны могут помочь?
lamodatech
0
400
CSC305 Lecture 09
javiergs
PRO
0
120
cgroup v2 support in Kubeadm
kentatada
0
220
Програмиране с Rust, ФМИ, 2024
nikolads
0
120
tsconfig.jsonの最近の新機能 ファイルパス編
uhyo
7
1.9k
2024-10-01 dev2next - Observability for Modern JVM Applications
jonatan_ivanov
1
140
Featured
See All Featured
Helping Users Find Their Own Way: Creating Modern Search Experiences
danielanewman
29
2.2k
Building Adaptive Systems
keathley
38
2.2k
Building a Scalable Design System with Sketch
lauravandoore
459
33k
Rails Girls Zürich Keynote
gr2m
93
13k
The Pragmatic Product Professional
lauravandoore
31
6.2k
GitHub's CSS Performance
jonrohan
1030
450k
How to Create Impact in a Changing Tech Landscape [PerfNow 2023]
tammyeverts
46
2.1k
Embracing the Ebb and Flow
colly
84
4.4k
RailsConf 2023
tenderlove
28
860
Practical Orchestrator
shlominoach
186
10k
Exploring the Power of Turbo Streams & Action Cable | RailsConf2023
kevinliebholz
26
4.1k
Speed Design
sergeychernyshev
23
550
Transcript
© 2024 Wantedly, Inc. 導⼊から5年が経って⾒えた Datadog APM 運⽤の課題 Japan Datadog
User Group Meetup#3 Mar. 13 2024 - Atsushi Tanaka @bgpat
© 2024 Wantedly, Inc. 過去の登壇資料 https://speakerdeck.com/bgpat/distributed-tracing-for-microservices
© 2024 Wantedly, Inc. 過去の登壇資料 https://speakerdeck.com/bgpat/opencensus-with-datadog-apm
© 2024 Wantedly, Inc. 今⽇伝えたいこと APM は導⼊後のメンテナンスが重要 • トレースが期待した状態になっているかの確認‧修正 ◦
気付いたら分断されていたり必要な値が⼊っていないことがある ◦ 負のループに陥らないように対応が必要 • 利⽤者への普及活動 ◦ とりあえず⼊れただけの状態で使ってくれる⼈は限られている ◦ 普段から慣れていないといざというときに使えない ◦ 勉強会や障害訓練等で利⽤を広げる活動も必要
© 2024 Wantedly, Inc. $ whoami @bgpat / Atsushi Tanaka
ウォンテッドリー株式会社 Infrastructure Engineer Kubernetes / Terraform SRE / Platform Engineering Datadog 歴 6〜7年くらい
© 2024 Wantedly, Inc. Wantedlyのマイクロサービス (5年前) • マイクロサービス70個以上 (社内サービスも含む)
© 2024 Wantedly, Inc. Wantedlyのマイクロサービス (5年前)
© 2024 Wantedly, Inc. そこで分散トレーシング (Datadog APM)
© 2024 Wantedly, Inc. を導⼊して5年が経過しました
© 2024 Wantedly, Inc. 導⼊時からの変化
© 2024 Wantedly, Inc. マイクロサービス化がさらに進んだ • マイクロサービス70個以上 (社内サービスも含む) →当時と同じ数え⽅で 150
サービス超 Service Catalog には 82 サービスが存在
© 2024 Wantedly, Inc. マイクロサービス化がさらに進んだ 分散トレーシングの価値は上がっている
© 2024 Wantedly, Inc. 5年が経過して⾒えた課題
© 2024 Wantedly, Inc. いつの間にか壊れるトレース 発⽣した問題 • トレースが分断されている • ⼊っていてほしい情報が抜け落ちている
◦ ユーザーID ◦ エラー情報 原因 • フレームワークの変更 • ライブラリのアップデート ◦ トレーシングライブラリを複数⼊れていると問題になりやすい
© 2024 Wantedly, Inc. いつの間にか壊れるトレース トレースが壊れる 使いづらい 利⽤者減 メンテされない
© 2024 Wantedly, Inc. 扱える⼈の2極化 普段からAPMを活⽤している⼈ vs 全く使わない⼈ 導⼊当時は勉強会を実施したがここ数年はしていない ↓
⼀番効果を発揮する障害対応で 何をすればいいか分からない⼈が増えた
© 2024 Wantedly, Inc. 扱える⼈の2極化 ←利⽤しているツールのアンケート結果 エンジニアの約3割は Datadog を使っていない
© 2024 Wantedly, Inc. 扱える⼈の2極化 障害訓練の振り返りから抜粋 • Datadog 操作なれてなくてやりたいことがぱっとできなかった ◦
env どこで指定するんだっけ • データドッグの使い⽅なんとなく理解した • 調査の⽅法が全然分からなかった ◦ どのツールを使えばいいか分からなかった ◦ Datadogの⾒⽅がパッと分からなかった • Datadog の⾒⽅に⼾惑ったのでチートシートなどがほしい • Datadog の trace がつながってなかった • Datadog の操作になれていない⼈が多かった印象が強い ◦ Datadog オペレーション講習会みたいなものをやると良さそう
© 2024 Wantedly, Inc. まとめ APM は導⼊後のメンテナンスが重要 • トレースが期待した状態になっているかの確認‧修正 ◦
気付いたら分断されていたり必要な値が⼊っていないことがある ◦ 負のループに陥らないように対応が必要 • 利⽤者への普及活動 ◦ とりあえず⼊れただけの状態で使ってくれる⼈は限られている ◦ 普段から慣れていないといざというときに使えない ◦ 勉強会や障害訓練等で利⽤を広げる活動も必要
© 2024 Wantedly, Inc. 詳しい話は懇親会 orカジュアル⾯談で https://www.wantedly.com/projects/522096