Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Google Kubernetes Engine (GKE) の可観測性を活用し、 システムの...
Search
GoogleCloudPlatformJapan
December 21, 2025
Business
120
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Google Kubernetes Engine (GKE) の可観測性を活用し、 システムの Resiliency を高める障害原因調査
GoogleCloudPlatformJapan
December 21, 2025
More Decks by GoogleCloudPlatformJapan
See All by GoogleCloudPlatformJapan
日本CTO協会 新卒合同研修_Google Cloud
googlecloudjapan
0
58
Jagu'e'r O11y分科会 0630 - kubectl logsのその先へ、実は使えるいろんなKubernetesログを追ってみよう
googlecloudjapan
0
96
「原因不明なナゾの障害」で終わらないための Kubernetes のログの徹底活用
googlecloudjapan
0
510
15 分で学ぶ Cloud Run のユースケースと代表的なアーキテクチャパターン
googlecloudjapan
3
880
Google Cloud の スペシャリストと学ぶ! BigQuery & Gemini
googlecloudjapan
1
300
ログから学ぶKubernetes
googlecloudjapan
1
760
GKE Enterprise 徹底解説
googlecloudjapan
2
1.4k
Cloud Run で作るサーバーレス アーキテクチャ 30 連発 - これのときはこう!
googlecloudjapan
33
12k
実践!サーバーレス RAG 構築:Firestore ベクトル検索と VertexAI LLM 活用
googlecloudjapan
2
3.1k
Other Decks in Business
See All in Business
作れる人から、伸ばせる人へ~Anthropicの5アーキタイプで読み解く、成長率日本一の開発組織~ / Builder to Grower
hirokiyamamoto14
PRO
2
820
20年続く長寿タイトルが、15年目にして売上を伸ばせた理由
gree_tech
PRO
0
1.1k
50代で初転職した話
yda
15
22k
NEXERA inc. | Company Deck
nexera
0
25k
セーフィー株式会社(Safie Inc.) 会社紹介資料
safie_recruit
7
470k
3DC Company Deck v2026
3dc_inc
0
470
研修ガイドブック
nicrecruit
1
380
KEEBHOLIC NAGOYA Vol.2
shakupan
0
130
プレイド概要説明資料_2026/08
plaid
PRO
1
5k
20260806financial-results-presentation
sios3744
0
110
RECRUIT DECK 株式会社KOBIRA 会社説明資料
kobira_official
PRO
0
7.2k
株式会社Saleshub 事業概要資料
saleshubinc
1
290
Featured
See All Featured
The Language of Interfaces
destraynor
162
27k
Discover your Explorer Soul
emna__ayadi
2
1.3k
Design in an AI World
tapps
1
300
Darren the Foodie - Storyboard
khoart
PRO
3
3.9k
A better future with KSS
kneath
240
18k
CSS Pre-Processors: Stylus, Less & Sass
bermonpainter
360
30k
Marketing to machines
jonoalderson
1
5.7k
How To Stay Up To Date on Web Technology
chriscoyier
790
250k
Improving Core Web Vitals using Speculation Rules API
sergeychernyshev
21
1.6k
Getting science done with accelerated Python computing platforms
jacobtomlinson
2
460
Accessibility Awareness
sabderemane
1
190
Beyond borders and beyond the search box: How to win the global "messy middle" with AI-driven SEO
davidcarrasco
3
230
Transcript
Google Kubernetes Engine (GKE) の可観測性を活用し、 システムの回復性を高める障害原因調査
02 石井 翔 Google Cloud Technical Solutions Engineer @kyasbal_k @kyasbal
03 石井 翔 Google Cloud Technical Solutions Engineer Google Cloud
のテクニカル サポートの エンジニア = @kyasbal_k @kyasbal
04 Kubernetes は運用をどう変えたか
05 Kubernetes は運用をどう変えたか
06 Kubernetes は運用をどう変えたか 数多くの運用のオペレーションが自動化されるようになった
07 Kubernetes は運用をどう変えたか 数多くの運用のオペレーションが自動化されるようになった 数多くの運用のオペレーションが人の手元から離れて実行されるようになった
08 運用の変化により障害の形も変化した
09 運用の変化により障害の形も変化した
010 運用の変化により障害の形も変化した ダイナミックで自動化された運用パターンが容易に実現できるようになった 一方、 リアルな運用で発生する障害発生時に求められる対応はとても難しくなった
011 障害の形が変化し、可観測性に求められるレベルは高い
012 障害の形が変化し、可観測性に求められるレベルは高い
013 障害の形が変化し、可観測性に求められるレベルは高い 例: GKE のデフォルトのメトリクスダッシュボード (様々なクラスタ上のイベントと関連づけてくれる )
014 障害の形が変化し、可観測性に求められるレベルは高い 例: GKE のデフォルトのメトリクスダッシュボード (様々なクラスタ上のイベントと関連づけてくれる ) しかし、Kubernetes のクラスタに「可観測性」 がある。
もう今の時代ではもちろん当然 ですよね。
015 障害の形が変化し、可観測性に求められるレベルは高い 例: GKE のデフォルトのメトリクスダッシュボード (様々なクラスタ上のイベントと関連づけてくれる ) しかし、Kubernetes のクラスタに「可観測性」 がある。
もう今の時代ではもちろん当然 ですよね。 →その「可観測性」 を活用して様々なダウンタイムを分析し、根本 原因を見つけ、クラスタの Resiliency を高めていくイテレーションを 回せていますか?
016 特に障害原因の断定に必要な「ログ」を活用できてますか
017 特に障害原因の断定に必要な「ログ」を活用できてますか
018 監査ログ ファイル Cloud Logging 自動でクエリ ファイルを アップロード Kubernetes の障害調査に
適した形で可視化 ローカル環境 / Cloud Shell 等 Kubernetes の障害調査のための OSS ログビューア Kubernetes History Inspector (KHI) GoogleCloudPlatform/khi https://github.com/GoogleCloudPlatform/khi Star us on GitHub! Google Cloud の提供する Kubernetes 環境 (GKE / GDC 等) その他の Kubernetes 環境 Kubernetes History Inspector (KHI) は Google Cloud の技術サポートチームが Kubernetes 上の多様な障害原因の調査を行う中で、 ログの情報を最大限活用し迅速に 障害の全容を把握しその原因を見つけるために開発し OSS として公開したログビューア ログだけからリソースの状態をタイムラインにして可視化、特定のタ イミングでのリソースの変化を差分表示
019 監査ログ ファイル Cloud Logging 自動でクエリ ファイルを アップロード Kubernetes の障害調査に
適した形で可視化 ローカル環境 / Cloud Shell 等 Kubernetes の障害調査のための OSS ログビューア Kubernetes History Inspector (KHI) GoogleCloudPlatform/khi https://github.com/GoogleCloudPlatform/khi Star us on GitHub! Google Cloud の提供する Kubernetes 環境 (GKE / GDC 等) その他の Kubernetes 環境 Kubernetes History Inspector (KHI) は Google Cloud の技術サポートチームが Kubernetes 上の多様な障害原因の調査を行う中で、 ログの情報を最大限活用し迅速に 障害の全容を把握しその原因を見つけるために開発し OSS として公開したログビューア ログだけからリソースの状態をタイムラインにして可視化、特定のタ イミングでのリソースの変化を差分表示 ログだけからあるタイミングのリソースの分布を可視化
020 監査ログ ファイル Cloud Logging 自動でクエリ ファイルを アップロード Kubernetes の障害調査に
適した形で可視化 ローカル環境 / Cloud Shell 等 Kubernetes の障害調査のための OSS ログビューア Kubernetes History Inspector (KHI) GoogleCloudPlatform/khi https://github.com/GoogleCloudPlatform/khi Star us on GitHub! Google Cloud の提供する Kubernetes 環境 (GKE / GDC 等) その他の Kubernetes 環境 Kubernetes History Inspector (KHI) は Google Cloud の技術サポートチームが Kubernetes 上の多様な障害原因の調査を行う中で、 ログの情報を最大限活用し迅速に 障害の全容を把握しその原因を見つけるために開発し OSS として公開したログビューア docker run -p 127.0.0.1:8080:8080 gcr.io/kubernetes-history-inspector/release:latest KHI はコマンド 1 つで起動 : (Cloud Shellの場合) (あくまでログビューアなのでクラスタにエージェント等は一切導入不要 )
021 監査ログ ファイル Cloud Logging 自動でクエリ ファイルを アップロード Kubernetes の障害調査に
適した形で可視化 ローカル環境 / Cloud Shell 等 Kubernetes の障害調査のための OSS ログビューア Kubernetes History Inspector (KHI) GoogleCloudPlatform/khi https://github.com/GoogleCloudPlatform/khi Star us on GitHub! Google Cloud の提供する Kubernetes 環境 (GKE / GDC 等) その他の Kubernetes 環境 Kubernetes History Inspector (KHI) は Google Cloud の技術サポートチームが Kubernetes 上の多様な障害原因の調査を行う中で、 ログの情報を最大限活用し迅速に 障害の全容を把握しその原因を見つけるために開発し OSS として公開したログビューア 起動したらログ収集 に必要な情報を入 れるだけ GKE 等は クラスタ名等を 入れると自動でログフィルタが生 成され自動で収集 その他のクラスタではログファイル を KHI にペースト
022 監査ログ ファイル Cloud Logging 自動でクエリ ファイルを アップロード Kubernetes の障害調査に
適した形で可視化 ローカル環境 / Cloud Shell 等 Kubernetes の障害調査のための OSS ログビューア Kubernetes History Inspector (KHI) GoogleCloudPlatform/khi https://github.com/GoogleCloudPlatform/khi Star us on GitHub! Google Cloud の提供する Kubernetes 環境 (GKE / GDC 等) その他の Kubernetes 環境 Kubernetes History Inspector (KHI) は Google Cloud の技術サポートチームが Kubernetes 上の多様な障害原因の調査を行う中で、 ログの情報を最大限活用し迅速に 障害の全容を把握しその原因を見つけるために開発し OSS として公開したログビューア しばらく待つとログビューア画面ができてログをわかりやすく分析できる
023 障害調査のデモ シナリオ: critical-service という名前の Service にノードプールのアップグレード中にアク セスできなくなった。ノードプールのアップデート中は確かに Node は順次ドレイン
されていくが、PodDisruptionBudget(PDB) にはminAvailable:1 が指定されて いる。何故だろうか?
024 まとめ GoogleCloudPlatform/khi https://github.com/GoogleCloudPlatform/khi Star us on GitHub! ← 昨日新しいバージョン
(0.50.0) をリリースしました 🎉