$30 off During Our Annual Pro Sale. View Details »
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
質問箱の負荷対策
Search
umemotoryo
October 31, 2019
Programming
0
490
質問箱の負荷対策
umemotoryo
October 31, 2019
Tweet
Share
More Decks by umemotoryo
See All by umemotoryo
障害対応で実施する3つのこと
umemotoryo
0
590
Other Decks in Programming
See All in Programming
生成AI時代を勝ち抜くエンジニア組織マネジメント
coconala_engineer
0
1k
モデル駆動設計をやってみようワークショップ開催報告(Modeling Forum2025) / model driven design workshop report
haru860
0
280
ゆくKotlin くるRust
exoego
1
160
DevFest Android in Korea 2025 - 개발자 커뮤니티를 통해 얻는 가치
wisemuji
0
170
tsgolintはいかにしてtypescript-goの非公開APIを呼び出しているのか
syumai
7
2.3k
脳の「省エネモード」をデバッグする ~System 1(直感)と System 2(論理)の切り替え~
panda728
PRO
0
120
LLM Çağında Backend Olmak: 10 Milyon Prompt'u Milisaniyede Sorgulamak
selcukusta
0
130
Patterns of Patterns
denyspoltorak
0
310
Cell-Based Architecture
larchanjo
0
140
認証・認可の基本を学ぼう前編
kouyuume
0
270
リリース時」テストから「デイリー実行」へ!開発マネージャが取り組んだ、レガシー自動テストのモダン化戦略
goataka
0
140
ローカルLLMを⽤いてコード補完を⾏う VSCode拡張機能を作ってみた
nearme_tech
PRO
0
160
Featured
See All Featured
I Don’t Have Time: Getting Over the Fear to Launch Your Podcast
jcasabona
34
2.6k
Stewardship and Sustainability of Urban and Community Forests
pwiseman
0
72
Practical Tips for Bootstrapping Information Extraction Pipelines
honnibal
25
1.7k
Navigating Team Friction
lara
191
16k
Why You Should Never Use an ORM
jnunemaker
PRO
61
9.7k
My Coaching Mixtape
mlcsv
0
13
How Software Deployment tools have changed in the past 20 years
geshan
0
30k
AI: The stuff that nobody shows you
jnunemaker
PRO
1
16
RailsConf & Balkan Ruby 2019: The Past, Present, and Future of Rails at GitHub
eileencodes
141
34k
Designing Dashboards & Data Visualisations in Web Apps
destraynor
231
54k
So, you think you're a good person
axbom
PRO
0
1.8k
Hiding What from Whom? A Critical Review of the History of Programming languages for Music
tomoyanonymous
0
300
Transcript
質問箱の負荷対策
2 画像・図・グラフなど • 名前: 梅本稜 • 担当サービス ◦ 質問箱 •
実装 ◦ サーバーサイド ◦ インフラ • ジラフ歴: だいたい5年 • DDos経験: 3回 自己紹介
3 1. アーキテクチャ図(簡易版) 2. よくわからないけど繋がらなくなる 3. DBのコネクションがいっぱいになる 4. Redisのメモリが不足する 目次
4 アーキテクチャ図(簡易版) Infrastructure Master Cloud SQL Slave Cloud SQL Kubernetes
cluster Application Kubernetes Engine Worker Kubernetes Engine Nginx Ingress Kubernetes Engine Infrastructure Cloud Memorystore Cloud Memorystore S3 Cloud Memorystore S3 proxyr Kubernetes Engine
5 よくわからないけど 繋がらなくなる
6 アラートをトリガーに 電話が来る 夜22~23時ごろ誰もデプロイはしていない 一旦脳死でpodを増やすも復活しない
7 前提 podを増やしても復活しない GCPで障害は発生していない 仮説 1. LBが死んでいる 2. DBで詰まっている 3.
Redisのメモリが溢れている 問題を切り分ける
8 1. LBが死んでいる a. これはGCPのワークロードからpodの状態を確認して問題なし 2. DBが詰まっている a. DBにshow processlistを実行すると60秒以上実行されているクエ
リが多く発見される b. しかもレプリケーションが3時間近く遅延 3. Redisのメモリが溢れている a. Stackdriverで見ると溢れていない 仮説検証する
9 1. 質問テーブルと回答テーブルをjoinしたクエリ 2. ユーザーテーブルのレコードに頻繁にアップデートが実行されロック 3. indexを貼っていないカラムで検索してフルスキャン&filesort DBが詰まっている原因
10 一次対応 Redisで出来るだけキャッシュする 実行箇所をコメントアウトして空のオブジェクトを返す 恒久対応 joinせずに2回クエリを実行する 処理を見るとjoinする必要がないものがあったのでjoinをやめる 質問テーブルと回答テーブルをjoinし たクエリの対策
11 一次対応 アクセス日はユーザーに見えないので更新するメソッドをコメントアウト 恒久対応 アクセスと同時にアップデートしていたので非同期にする 現在はBigQueryで管理 ユーザーテーブルのレコードに 頻繁にアップデートが実行されロック
12 一次対応 Redisに出来るだけキャッシュする コメントアウトして空のオブジェクトを返す 恒久対応 explainを使用して適切なindexを探す 検索する値の順番を整理する indexを貼っていないカラムで検索し てフルスキャン&filesort
13 DBのコネクションが いっぱいになる CloudSQLのmysqlの最大コネクションの 4000コネクションに到達
14 緑の線がmasterのDB オレンジの線がslaveのDB Stackdriverから の通知で電話が 来る 画像・図・グラフなど
15 Pumaの場合 PumaのWorker * pool らしい(ソースコードまで追ってないです) なので Pod * PumaのWorker
* pool が4000以下になるように database.yml設定を変更する コネクションの総数を計算する 方法を調べる
16 show processlistで表示される行数と Pod * PumaのWorker * pool の数を比較して減らす 怖かったので1つずつpoolを減らして様子をみる
同時にPumaの処理待ちをStackdriverで監視して処理が詰まらないことを 確認しながら行なった 質問箱の場合は最終的に 7 になった(cpu 6core, memory 32GB) database.ymlの変更
17 Redisのメモリが不足する キャッシュしすぎた
18 1. 負荷対策でキャッシュしたものが増えた 2. sidekiqで処理待ちになったjobが400万近くあった 3. キャッシュによってどの程度の容量が必要か計算していなかった 経緯
19 lib/peing_cache_pool.rbをに以下をコードを設置 複数のRedisを接続できるように変更
20 ジラフではエンジニアを募集しています! もし興味がある方は僕に声をかけて欲しいです! 最後に