Slide 1

Slide 1 text

はてなのサービス基盤を支える Kubernetes《足腰》 id:masayosu / @masayosu 2026/06/30 Hatena Engineer Seminar #37 1

Slide 2

Slide 2 text

自己紹介 ● masayosu ● 株式会社はてな    組織・基盤開発本部    プラットフォーム部    サービスプラットフォームチーム    SRE ● 趣味 ○ 登山、キャンプ、ゲーム 2

Slide 3

Slide 3 text

サービスプラットフォームチーム ● エンジニア  6人 ● EKS運用 2019年〜 ● 約40サービス 3

Slide 4

Slide 4 text

4 少人数で運用する仕組み

Slide 5

Slide 5 text

目次 ● ArgoCD ● クラスタアップグレード ● オブザーバビリティ ● まとめ 5

Slide 6

Slide 6 text

6 ArgoCD

Slide 7

Slide 7 text

ArgoCD 7

Slide 8

Slide 8 text

認知負荷を減らす ● CDの実装を毎回考えなくてよい ● デプロイの方法を迷わない ● まず見る場所が決まっている 8

Slide 9

Slide 9 text

9 デプロイを特別なイベントにしない

Slide 10

Slide 10 text

10 クラスターアップグレード

Slide 11

Slide 11 text

アップグレードへの不安 ● アップグレードへの不安 ● Kubernetesの更新頻度とチームリソース 11

Slide 12

Slide 12 text

B/Gアップグレード 12

Slide 13

Slide 13 text

13 アップグレードの不安を コントロールする

Slide 14

Slide 14 text

大きな変更を恐れなくなった ● Nodeスケーラーの変更( Spot -> Karpenter) ● GPUノードの追加 ● Node、Addonのバージョンアップ 14

Slide 15

Slide 15 text

15 オブザーバビリティ

Slide 16

Slide 16 text

EKS導入当初の監視 ● Pod ○ CPU / Memory ● Node ○ CPU / Memory ○ Connectivity ● 外形監視 いわゆる「ペット世代」の監視 16

Slide 17

Slide 17 text

17 ユーザー影響の前に気づきたい

Slide 18

Slide 18 text

ユーザー影響の兆候を見る Before ● CPU利用率 ● Memory利用率 ● Nodeの生存 ● 外形監視 After ● 監視 ○ CrashLoop ○ HPA ○ Node数の減少 ● 自動化 ○ カスタムメトリクスで のスケール(KEDA) 18

Slide 19

Slide 19 text

19 アラートが鳴ったら何かやること がある状態を目指す

Slide 20

Slide 20 text

20 まとめ

Slide 21

Slide 21 text

私たちのチームに合った基盤づくり ● デプロイを特別なイベントにしない ● アップグレードの不安をコントロールする ● アラートが鳴ったら何かやることがある 21 チームにおける足腰とは 安心して変化できること

Slide 22

Slide 22 text

22 ご清聴ありがとうございました