Lock in $30 Savings on PRO—Offer Ends Soon! ⏳
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
スパイクアクセス対策としての pitchfork 導入
Search
Shia
December 06, 2024
Technology
0
760
スパイクアクセス対策としての pitchfork 導入
RubyWorld Conference 2024 Day 2 の発表です。
https://2024.rubyworld-conf.org/ja/program/day2/#b-2-1
Shia
December 06, 2024
Tweet
Share
More Decks by Shia
See All by Shia
ひとつの開発環境
riseshia
0
30
Conquering Massive Traffic Spikes in Ruby Applications with Pitchfork
riseshia
0
240
NewEngineering 2024 - 繋がっていくサービスを支える開発環境作り
riseshia
0
1.5k
Hotspot on Coverage
riseshia
0
240
差分ベースで効率的にテストを実行してみる
riseshia
1
760
Cookpad internship 2020 summer - web
riseshia
0
7.6k
マイクロサービス化を支える継続的切り替え術
riseshia
0
670
Cleaning up a huge ruby application
riseshia
3
12k
Find out potential dead codes from diff
riseshia
0
7.1k
Other Decks in Technology
See All in Technology
AlmaLinux + KVM + Cockpit で始めるお手軽仮想化基盤 ~ 開発環境などでの利用を想定して ~
koedoyoshida
0
150
まだ間に合う! Agentic AI on AWSの現在地をやさしく一挙おさらい
minorun365
17
2.4k
松尾研LLM講座2025 応用編Day3「軽量化」 講義資料
aratako
0
550
Oracle Database@Google Cloud:サービス概要のご紹介
oracle4engineer
PRO
1
750
JEDAI認定プログラム JEDAI Order 2026 エントリーのご案内 / JEDAI Order 2026 Entry
databricksjapan
0
170
Snowflake だけで実現する “自立的データ品質管理” ~Data Quality Monitoring 解説 ~@ BUILD Meetup: TOKYO 2025
ryo_suzuki
0
120
Bedrock AgentCore Memoryの新機能 (Episode) を試してみた / try Bedrock AgentCore Memory Episodic functionarity
hoshi7_n
2
1.6k
20251222_next_js_cache__1_.pdf
sutetotanuki
0
160
ZOZOの独自性を生み出す「似合う4大要素」の開発サイクル
zozotech
PRO
0
120
[2025-12-12]あの日僕が見た胡蝶の夢 〜人の夢は終わらねェ AIによるパフォーマンスチューニングのすゝめ〜
tosite
0
140
ExpoのインダストリーブースでみたAWSが見せる製造業の未来
hamadakoji
0
190
Amazon Connect アップデート! AIエージェントにMCPツールを設定してみた!
ysuzuki
0
130
Featured
See All Featured
Building a A Zero-Code AI SEO Workflow
portentint
PRO
0
190
Leadership Guide Workshop - DevTernity 2021
reverentgeek
0
160
Unsuck your backbone
ammeep
671
58k
Dominate Local Search Results - an insider guide to GBP, reviews, and Local SEO
greggifford
PRO
0
15
Optimising Largest Contentful Paint
csswizardry
37
3.5k
Jess Joyce - The Pitfalls of Following Frameworks
techseoconnect
PRO
1
25
Why Your Marketing Sucks and What You Can Do About It - Sophie Logan
marketingsoph
0
41
Automating Front-end Workflow
addyosmani
1371
200k
Become a Pro
speakerdeck
PRO
31
5.7k
Leveraging Curiosity to Care for An Aging Population
cassininazir
1
130
Six Lessons from altMBA
skipperchong
29
4.1k
Navigating Team Friction
lara
191
16k
Transcript
スパイクアクセス対策としての pitchfork 導入 Ruby World Conference 2024 Sim Sangyong@STORES
Self introduction - Sangyong Sim @ STORES. Inc - shia
@ Internet - riseshia @ {X, GitHub} 2
STORES ネットショップ 3
- 多様な規模の事業者 - 特定時刻から販売を開始することができる - 規模を正しく予測するのは難しい STORES ネットショップ 4
xx/xx 10時から数量限定グッズ販売開始します!!! 5 more than 10x
レイテンシが劣化する 6 p95 p90 p50
(できれば何もせずに) スパイクアクセス時にも安定した購入体験ができる ようにしたい!!! 目標 7
- リクエストをできるだけ待たせない ~= 十分な数のWebサーバのワー カーを用意する - p90 あたりから観測されるレイテンシ劣化を改善する 注: このセッションではアプリケーション高速化およびキャッシングによ
る負荷軽減はスコープ外なので話しません 課題 8
環境 9 - ECS Fargate 上で動く - ASG(Auto Scaling Group)
でキャパシティ管理する - Ruby on Rails / unicorn で動く
- 正確にトラフィックを予測することはできないので過去の実績ベース で戦略を考える - 予想を超えてしまった場合はしょうがないので待ちを許す(しかない) - ほとんどのスパイクのピークは 1分以下で 5分以内でほぼ捌き終わるの で、
ASG では間に合わないため 課題 - 十分な数のWebサーバのワーカーを用意する 10
小規模のもの - 常に過剰キャパシティを持ってスパイクが発生したらそれで吸収する - ECS Fargate Spot で格安で運用できている 大規模なもの -
まれに来るそれ以上のスパイク、規模感から事前に把握してることが 多く、販売直前でサービスをスケールアウトする 課題 - 十分な数のWebサーバのワーカーを用意する 11
リクエスト平均処理時間を 内部の処理時間で分類 課題 - レイテンシ劣化を改善する 12 Ruby p95 p90 p50
DB 外部通信
課題 - レイテンシ劣化を改善する 13 もしかして Webサーバのワーカー、温まってない...?
Webサーバのワーカー、温まってないとは 14 Webサーバ(Rails アプリケーション)は起動して実際リクエストが処理する ことで初めて走る処理が色々あり、それらによって起動直後は遅いことがある - 各種の TCP コネクション生成 -
インメモリーキャッシュ生成 - (YJIT を有効にしている場合) JIT コンパイル - method_missing から始まるメタプロ - Action View のコンパイル - …
なぜ一部だけ? - 実験 15 unicorn でリクエストを処理する時、どのワーカーが仕事していたのかの 確認をしてみる - 処理に 0.1s
かかるエンドポイント - ワーカー数 8 - 低負荷の再現するため 2並列 - 10s 負荷 各ワーカーが処理したリクエストの数を調べてみる
なぜ一部だけ? - 実験 16 - worker 0: 85 - worker
1: 86 - worker 2: 2 - worker 3: 0 - worker 4: 0 - worker 5: 0 - worker 6: 0 - worker 7: 0 注:Linux 環境のみ再現します
- unicorn は prefork 型 web サーバ - 起動して要求された数のワーカーを fork
し新しいプロセスを生成 - 1つの TCP ソケットが共有される - unicorn では epoll(or kqueue) というのが使われる - この通知順番はどうなっているか なぜ偏る? 17 ソケット epoll ワーカー0 ワーカー1 ワーカーn … 監視 通知
なぜ偏る? 18 - リクエストが来た時、それを処理するワーカーが順番に並んてる キューを想像すると、そのキューは LIFO - 処理が終わったワーカーがキューに入ったら、次のリクエスト時にも同じ ワーカーが選ばれるので偏る Ref:
https://blog.cloudflare.com/the-sad-state-of-linux-socket-balancing/ epoll ワーカー1 ワーカー2 … 通知 待ち列 ワーカー0 処理が終わったら待ち列の先頭に入る
- スパイクに備えて過剰キャパシティを確保する - 過剰に確保されたワーカーは起動してから仕事していない - 販売開始時刻の大量のリクエストにより遊んでいたワーカーが仕事を 始める - 温まってないので処理に時間がかかる...? つまり起きてるのはおそらく
19
どうやって全ワーカーを温める? - 実際トラフィックを作って温める - 温まった状態でサービスインする - puma にする - ??
20
- Shopify による unicorn の fork - refork という機能がある pitchfork
21
COMMAND \_ pitchfork master \_ (gen:0) mold \_ (gen:0) worker[0]
\_ (gen:0) worker[1] \_ (gen:0) worker[2] \_ (gen:0) worker[3] COMMAND \_ pitchfork master \_ (gen:1) mold \_ (gen:1) worker[0] \_ (gen:1) worker[1] \_ (gen:1) worker[2] \_ (gen:1) worker[3] pitchfork - refork - 一定数(adjustable)のリクエストを処理したワーカーをテンプレート として全ワーカーを再度 forkする - Copy on Write(CoW) による共有メモリーを増やしてメモリー使用量 を減らす戦略 22 fork promote
温まったワーカーを refork すると 全ワーカーが温まった状態になるのでは? pitchfork 23
導入 - pitchfork が問題ないか確認するために開発環境でしばらく運用 - 本番を徐々にロールアウト 24
fork safety 確認が必要 - コネクションが継承されるとか - バックグラウンドで動くスレッドの扱いとか 相性が悪い事例もあるので気をつける Ref: https://github.com/Shopify/pitchfork/blob/master/docs/FORK_SAFETY.md
導入の注意点 25
毎年定期的に開催されている大きい販売の比較。 グラフの高さは同じスケールに調整されてます。 導入結果 26 rps(2023) rps(2024)
導入結果 27 レイテンシ(2024) レイテンシ(2023) p95 p90 p50 p95 p90 p50
導入結果 28 レイテンシ(2024) レイテンシ(2023) Ruby DB 外部通信 Ruby DB 外部通信
p95 p90 p50 p95 p90 p50 リクエスト平均処理時間を 内部の処理時間で分類(2023) リクエスト平均処理時間を 内部の処理時間で分類(2024)
不規則なスパイクアクセスの処理のため、低コストの効率的な暖気手段と して pitchfork を試して一定の成果がありました まとめ 29
ご清聴ありがとうございました まとめ 30