Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
Grafanaが支えるプロダクト開発 - 開発から本番運用までをサポートする基盤
Search
Mitsuhiro Tanda
September 25, 2026
350
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Grafanaが支えるプロダクト開発 - 開発から本番運用までをサポートする基盤
Mitsuhiro Tanda
September 25, 2026
More Decks by Mitsuhiro Tanda
See All by Mitsuhiro Tanda
OBI Deep Dive — How Is Automatic Instrumentation Actually Implemented?
mtanda
0
13
OBI Deep Dive 〜どのようにして自動計装は実現されているのか?〜
mtanda
0
180
低コストなログ基盤を支えるアーキテクチャ 〜Grafana Lokiの設計思想〜
mtanda
2
4.7k
Life with Grafana
mtanda
0
980
Featured
See All Featured
Design of three-dimensional binary manipulators for pick-and-place task avoiding obstacles (IECON2024)
konakalab
0
600
Making Projects Easy
brettharned
120
6.8k
[SF Ruby Conf 2025] Rails X
palkan
3
1.4k
Gemini Prompt Engineering: Practical Techniques for Tangible AI Outcomes
mfonobong
2
560
Navigating the Design Leadership Dip - Product Design Week Design Leaders+ Conference 2024
apolaine
2
450
Designing for Performance
lara
611
70k
Rails Girls Zürich Keynote
gr2m
96
14k
Sharpening the Axe: The Primacy of Toolmaking
bcantrill
46
3k
How To Speak Unicorn (iThemes Webinar)
marktimemedia
1
590
AI in Enterprises - Java and Open Source to the Rescue
ivargrimstad
0
1.5k
Effective software design: The role of men in debugging patriarchy in IT @ Voxxed Days AMS
baasie
1
540
DBのスキルで生き残る技術 - AI時代におけるテーブル設計の勘所
soudai
PRO
68
58k
Transcript
Grafana が支えるプロダクト開発 開発から本番運用までをサポートする基盤 Grafana Meetup Japan Fukuoka #1 Staff Developer
Advocate, Grafana Labs 反田光洋
自己紹介 反田 光洋 (たんだ みつひろ) @mtanda Staff Developer Advocate Grafana
Labs ▶ 約 10 年来の Grafana / Prometheus ユーザー ▶ Grafana 初期バージョンからのコントリビューター
はじめに
はじめに 今日お話しすること • Grafana Labs が提供しているプロダクトと、それぞれが役立つ場面の紹介 • オブザーバビリティ導入により、具体的にどういう悩みを解決できるか? • 開発の初期からオブザーバビリティを導入することで実現できること
はじめに 今日紹介するプロダクト・機能一覧 プロダクト・機能 Grafana Loki Tempo Mimir Pyroscope Alloy OBI
/ Beyla k6 概要 可視化・横断調査 ログの保存・検索 トレースの保存・検索 メトリクスの保存・検索 継続的プロファイリングの保存・検索 テレメトリデータの収集・加工・転送 eBPF による自動計装 負荷試験ツール プロダクト・機能 Grafana Faro Synthetic Monitoring Application Observability Kubernetes Monitoring Database Observability SLO IRM AI Assistant 概要 フロントエンド計装 SDK 合成監視 アプリケーション特化の調査機能 Kubernetes 特化の調査機能 データベース特化の調査機能 サービス品質に基づくアラート インシデント対応フローの管理 AI アシスタント
完成図
はじめに プロダクトがサポートする 4 つのエリア • 開発時にオブザーバビリティを高める • リリース前に性能を確認する • リリース後にユーザーから見たサービス品質を確認する
• インシデントを検知し、対応する
はじめに 開発時にオブザーバビリティを高める • オブザーバビリティとは、サービス内部の状態を、外部から取得できるデータだけ で把握できる状態のこと • 内部の状態をテレメトリデータとして記録し、開発や運用に関わる判断の元とする • アプリケーションを計装し、テレメトリデータを収集し、保存した上で検索できる ようにする
開発時にオブザーバビリティを高める
はじめに リリース前に性能を確認する • 負荷をかけて確かめなければ、想定した負荷に耐えられるかどうかは分からない • また負荷をかけてみて、はじめてボトルネックとなる箇所が判明する • 負荷試験とプロファイリングをとおして、高負荷時の振る舞いを理解する
リリース前に性能を確認する
はじめに リリース後にユーザーから見たサービス品質を確認する • サービス提供側は、ユーザーがどのような環境からアクセスしているかはわからな い • サーバ側のメトリクスだけを見ていると、ユーザーから見た体感の悪化には気づけ ない • 合成監視や
RUM をとおして、ユーザーが実際に体感するサービス品質を確認する
リリース後にユーザーから見たサービス品質を確認する
はじめに インシデントを検知し、対応する • 検知の仕組みと対応の手順がなければ、インシデントにすぐに対応することは難し い • 休日や夜間でも確実に対応できる体制を整備する必要がある • インシデント対応の体制を整備し、継続的かつ安定的にインシデントに対応する
インシデントを検知し、対応する
開発時にオブザーバビリティを高 める
開発時にオブザーバビリティを高める オブザーバビリティは信頼性の基盤 • 現在のシステムは複雑すぎて、内部の状態を正確に理解することは難しい ‣ コンテナ、Kubernetes、マイクロサービス、サーバレス… • 内部の状態をテレメトリデータとして記録することで、理解を深められる • 正確な判断が下せるようになり、システムの信頼性を高めていける
開発時にオブザーバビリティを高める 何を記録すればよいか? • Kubernetes などは標準でテレメトリデータを出力しているので、それらを記録す るだけでよい • 開発しているアプリケーションに関しては、どういったデータが必要か考える必要 がある •
どのようにしてサービス品質を計測するか、問題が起きた時に原因を調査するかと いう観点で考える • 設計のフェーズで検討し、必要なテレメトリデータが漏れなく正確に記録されるよ うにする
開発時にオブザーバビリティを高める A Braid of Signals • 必要なテレメトリデータを、この 3 つに当てはめていく ‣
メトリクス(What): 何が、どれだけ変化したか。成功率・レイテンシ・スルー プットなど ‣ ログ(Why): 原因につながる文脈は何か。エラー・タイムアウト・依存先の情報 など ‣ トレース(Where): どこで遅延・失敗したか。リクエスト経路や依存先の特定
開発時にオブザーバビリティを高める LGTM スタックで記録する • メトリクス、ログ、トレースを受け止める基盤が LGTM スタック ‣ Loki OSS
‣ Grafana OSS ‣ Tempo OSS ‣ Mimir OSS • OpenTelemetry に対応している • ログとトレースなど、テレメトリデータ同士を関連づけて調査できる
開発時にオブザーバビリティを高める Grafana Alloy で収集する • Grafana Alloy OSS • Grafana
Labs が提供する OpenTelemetry Collector のディストリビューション • テレメトリデータを収集し、バッファリングした上で送信する • 必要に応じてテレメトリデータの加工もできる
開発時にオブザーバビリティを高める
開発時にオブザーバビリティを高める 開発環境のオブザーバビリティ • テレメトリデータを出力できるようにする実装を計装という • 開発環境にも LGTM スタックを導入すれば、日々の開発で計装の動作確認ができ る •
特にログやトレースは、開発時の問題調査にも役立つ • 負荷試験時にも、目標とする性能が出ているか確認できる
開発時にオブザーバビリティを高める 自動計装によるクイックスタート • OBI / Beyla OSS • 最初からコードに計装を組み込む以外の選択肢として、自動計装がある •
OBI は eBPF を利用した自動計装ツール • 自動計装を使うことで、コードを変更せずに基本的な計装ができる • 足りない部分だけ手動計装で足していくこともできる
開発時にオブザーバビリティを高める Application / Kubernetes / Database 特化の機能 • 記録されているテレメトリデータを専用の UI
で表示して、調査をサポート • Application Observability Cloud : アプリケーションに特化した調査機能 • Kubernetes Monitoring Cloud : Kubernetes に特化した調査機能 • Database Observability Cloud : データベースに特化した調査機能
開発時にオブザーバビリティを高める デモ: LGTM スタック • Grafana の Drilldown 機能
リリース前に性能を確認する
リリース前に性能を確認する リリースに対する信頼性を担保する • 失敗できないような大きなリリースに備える • 大きなリリースでは、運用実績がない新規の部分が多く、不確定要素が多い • 本番環境で初めて問題になることも多い ‣ インデックスの追加漏れ、ディスク性能の限界など
• 本番環境相当の負荷をかけてみなければ、想定したとおりに動くかどうかはわから ない
リリース前に性能を確認する k6 による負荷試験 • k6 OSS • 本番環境のような高い負荷をかけるのは、実は難しい • 負荷試験専用のツールを使う必要がある
• k6 は様々な種類の負荷試験に対応している • 負荷試験の結果を LGTM スタックに記録できるため、条件を変えた試験結果同士 を比較できる
リリース前に性能を確認する 継続的プロファイリング • プロファイリングとは、CPU などのリソースをどのコードが消費しているかを計 測する手法 •「継続的」とは、必要なときだけ計測するのではなく、一定間隔のサンプリングを 常時有効にしておくこと • 負荷試験の時間帯のプロファイルを見れば、ボトルネックとなっている処理を見つ
けられる • ボトルネックを改善すれば、サービス品質の改善やコスト削減につなげられる
リリース前に性能を確認する Pyroscope • Grafana Pyroscope OSS • OpenTelemetry eBPF Profiler
OSS • Pyroscope はプロファイリングデータを記録するバックエンド • OpenTelemetry eBPF Profiler はアプリケーションの再ビルド不要で使えるプロ ファイラ • Grafana Alloy に組み込まれているため、簡単に組み合わせて使える
リリース前に性能を確認する
リリース前に性能を確認する デモ: プロファイリング • k6 による負荷生成とプロファイリング結果の確認
リリース後にユーザーから見た サービス品質を確認する
リリース後にユーザーから見たサービス品質を確認する リリース後にも、確認しきれないことがある • 負荷試験は、いわば理想的な環境・条件での検証 • QA で様々なブラウザでのテストを行っても、それでも検証しきれないものがある • 実際のユーザーの環境はさまざまで、全てを網羅できない
リリース後にユーザーから見たサービス品質を確認する 合成監視とフロントエンド監視 • Synthetic Monitoring Cloud ‣ 世界各地に配備された probe を使って、サービス品質を計測する
• Grafana Faro OSS ‣ ユーザーが使っている実際の端末を使って、サービス品質を計測する
リリース後にユーザーから見たサービス品質を確認する
インシデントを検知し、対応する
インシデントを検知し、対応する SLO に基づくアラート • SLO アラート Cloud • サービス品質に基づくアラートルールを設定する機能 •
SLO アラートに関連した便利な機能を提供している ‣ SLO アラートの設定を補助する設定画面 ‣ 設定されている SLO の達成状況を確認できるダッシュボード
インシデントを検知し、対応する IRM でインシデント対応の体制を整える • IRM Cloud • アラートを適切に通知しなければ、気づけずに対応が遅れてしまう • 確実に対応できるように
IRM で体制を整備する ‣ アラートの種別や発生時間を条件とした通知先設定 ‣ エスカレーション先の設定 • 対応中アラートの管理機能 • アラート通知を受け取れるアプリも提供されている
インシデントを検知し、対応する
完成図
OSS で実現できる範囲
おまけ: AI 活用
おまけ: AI 活用 AI Assistant によるサポート • AI Assistant Cloud
• やりたいことを伝えるだけで、誰でも簡単に Grafana を使いこなせる ‣ インシデントの原因調査 ‣ ダッシュボード作成 ‣ k6 の負荷試験スクリプト作成など • Grafana の UI に制約されることなく、記録されているあらゆるデータを連携させ て活用できる
まとめ
まとめ ご紹介したプロダクト・機能 自分のインフラで動かす • Grafana / Loki / Tempo /
Mimir / Pyroscope OSS • Alloy OSS • OBI / Beyla OSS • k6 OSS • Grafana Faro OSS Grafana Cloud で使う • Application / Kubernetes / Database Observability Cloud • Synthetic Monitoring Cloud • SLO / IRM / AI Assistant Cloud • 手元で試すなら otel-lgtm の Docker イメージがおすすめ • Grafana Cloud にも無料枠があるので、個人利用の範囲であれば十分試せる
まとめ Grafana が支えるプロダクト開発 • Grafana Labs のプロダクトは、開発初期の段階からリリース後までの全てをサ ポートする • オブザーバビリティが基盤となり、あらゆる場面でサービスの信頼性向上に取り組
むことができる • 気軽に使い始められるものなので、ぜひ使ってみてください!