Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
ホントにあったAmazon_EC2のコワーイ話.pdf
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
caad TakaraShinya
August 25, 2024
Technology
0
97
ホントにあったAmazon_EC2のコワーイ話.pdf
caad TakaraShinya
August 25, 2024
Tweet
Share
More Decks by caad TakaraShinya
See All by caad TakaraShinya
S3に関する調査が必要になったときの 効率よく調査できるTips
takarashinya
0
40
生成AIと子どものお手伝い回数管理するWEBアプリ作ってみた
takarashinya
0
76
Next.js LearnのアプリでDB連携してる箇所をAPI化して、Swagger化してみた
takarashinya
0
300
システム開発におけるドキュメントをできるだけGithub Pagesに集約してみた話
takarashinya
0
3.4k
WordpressにAWS Copilot CLIを利用したら利用事例に掲載してもらえた話
takarashinya
2
390
Other Decks in Technology
See All in Technology
【Oracle Cloud ウェビナー】[Oracle AI Database + AWS] Oracle Database@AWSで広がるクラウドの新たな選択肢とAI時代のデータ戦略
oracle4engineer
PRO
2
180
[CV勉強会@関東 World Model 読み会] Orbis: Overcoming Challenges of Long-Horizon Prediction in Driving World Models (Mousakhan+, NeurIPS 2025)
abemii
0
150
30万人の同時アクセスに耐えたい!新サービスの盤石なリリースを支える負荷試験 / SRE Kaigi 2026
genda
4
1.4k
AIと新時代を切り拓く。これからのSREとメルカリIBISの挑戦
0gm
2
3.1k
インフラエンジニア必見!Kubernetesを用いたクラウドネイティブ設計ポイント大全
daitak
1
380
2026年、サーバーレスの現在地 -「制約と戦う技術」から「当たり前の実行基盤」へ- /serverless2026
slsops
2
260
1,000 にも届く AWS Organizations 組織のポリシー運用をちゃんとしたい、という話
kazzpapa3
0
150
Kiro IDEのドキュメントを全部読んだので地味だけどちょっと嬉しい機能を紹介する
khmoryz
0
210
Codex 5.3 と Opus 4.6 にコーポレートサイトを作らせてみた / Codex 5.3 vs Opus 4.6
ama_ch
0
200
SREチームをどう作り、どう育てるか ― Findy横断SREのマネジメント
rvirus0817
0
340
ファインディの横断SREがTakumi byGMOと取り組む、セキュリティと開発スピードの両立
rvirus0817
1
1.6k
Oracle AI Database移行・アップグレード勉強会 - RAT活用編
oracle4engineer
PRO
0
110
Featured
See All Featured
The Psychology of Web Performance [Beyond Tellerrand 2023]
tammyeverts
49
3.3k
Reality Check: Gamification 10 Years Later
codingconduct
0
2k
Everyday Curiosity
cassininazir
0
130
Chrome DevTools: State of the Union 2024 - Debugging React & Beyond
addyosmani
10
1.1k
No one is an island. Learnings from fostering a developers community.
thoeni
21
3.6k
The Power of CSS Pseudo Elements
geoffreycrofte
80
6.2k
Fight the Zombie Pattern Library - RWD Summit 2016
marcelosomers
234
17k
The Success of Rails: Ensuring Growth for the Next 100 Years
eileencodes
47
7.9k
Speed Design
sergeychernyshev
33
1.5k
Distributed Sagas: A Protocol for Coordinating Microservices
caitiem20
333
22k
"I'm Feeling Lucky" - Building Great Search Experiences for Today's Users (#IAC19)
danielanewman
231
22k
Principles of Awesome APIs and How to Build Them.
keavy
128
17k
Transcript
ホントにあった Amazon EC2のコワーイ話 Shima Tech Hub#5 by takarake preencoded.png
ホントにあった Amazon EC2のコワーイ話 話 Shima Tech Hub#5 by takarake preencoded.png
皆さんの業務でAmazon EC2は使われていますか? 本日は2019年のある日起こった、予想外の出来事についてお話します。 皆さんのご利用の環境でも発生する可能性はゼロではありません。 これを聞いて実はクラウドって怖いんだと思って帰ってくださいw
自己紹介 • 高良 真也 (XX) ※年齢、知りたい人は聞いてねw • 技術統括本部 マネージャー •
沖縄、ベトナムをまたいで仕事してます • (最近、無料でGCP認定GET )
Amazon EC2とは? クラウドコンピューティング Amazon EC2はAmazonのクラウドコン ピューティングサービスです。オンデマ ンドのコンピューティング能力を提供し 、ユーザーが必要に応じて柔軟に利用で きます。 仮想サーバー
EC2では仮想サーバーをクラウド上で作 成・管理できます。物理的なサーバーを 用意する必要がなく、簡単にスケーリン グできるのが特徴です。 高可用性 AWSのデータセンターには高度な冗長性 があり、サービスの可用性が高いのが魅 力です。障害に強いインフラを実現して います。 preencoded.png
Amazon EC2のオートスケーリング EC2の柔軟なリソース管理 EC2のオートスケーリング機能により、 アプリケーションの需要に合わせてリソ ースを自動的に拡張または縮小できます 需要に合わせたスケールアウト ピーク時のトラフィックにも柔軟に対応 できるよう、EC2のリソースを自動的に スケールアウトできます。
障害に強いインフラ AWSのデータセンターは高度な冗長性を 備えているため、サービスの可用性が高 く、障害に強いインフラを実現できます preencoded.png
コワーイ話の前に・・・ ✓ 2019年の出来事ですが、今は発生しないとは保証できません ✓ あるシステムのインフラ環境にAmazon EC2を利用 ✓ コスト最適化を目的にAutoScalingによる起動数調整していた ✓ 夜中に起動数減
、朝に起動数増 で運用中 preencoded.png
コワーイ話の前に・・・ では参ります preencoded.png
Amazon EC2のコワーイ話 1 突然のエラー スケールアウト不可でエラーが発生 2 3 4 preencoded.png
Amazon EC2のコワーイ話 1 突然のエラー スケールアウト不可でエラーが発生 2 アクセス障害への恐怖 平日営業開始前の発生のため、 稼働リソース不足起因の障害発生 の不安に襲われる
3 4 preencoded.png
Amazon EC2のコワーイ話 1 突然のエラー スケールアウト不可でエラーが発生 2 アクセス障害への恐怖 平日営業開始前の発生のため、 稼働リソース不足起因の障害発生 の不安に襲われる
3 原因は???????? ?????????????????? 4 preencoded.png
preencoded.png 2019年 3月 14日のAutoScaling実行結果ログ 翻訳 新しいEC2インスタンスを起動しています。 現在、リクエストされたアベイラビリティゾーン(ap-northeast-1c)に十分なm3.largeのキャパシティがありません。 システムは追加のキャパシティを提供するために作業を行っています。 現在、アベイラビリティゾーンを指定しないか、ap-northeast-1aを選択することでm3.largeのキャパシティを取得できます。EC2インスタ
preencoded.png エッ・・・・・・ってなりませんか????
preencoded.png ※再掲 2019年 3月 14日のAutoScaling実行結果ログ 翻訳 新しいEC2インスタンスを起動しています。 現在、リクエストされたアベイラビリティゾーン(ap-northeast-1c)に十分なm3.largeのキャパシティがありません。 システムは追加のキャパシティを提供するために作業を行っています。 現在、アベイラビリティゾーンを指定しないか、ap-northeast-1aを選択することでm3.largeのキャパシティを取得できます。EC2インスタ
Amazon EC2のコワーイ話 1 突然のエラー スケールアウト不可でエラーが発生 2 アクセス障害への恐怖 平日営業開始前の発生のため、 稼働リソース不足起因の障害発生 の不安に襲われる
3 キャパシティ不足の問題 原因は東京リージョンの 特定AZのキャパシティ不足 4 preencoded.png
Amazon EC2のコワーイ話 1 突然のエラー スケールアウト不可でエラーが発生 2 アクセス障害への恐怖 平日営業開始前の発生のため、 稼働リソース不足起因の障害発生 の不安に襲われる
3 キャパシティ不足の問題 原因は東京リージョンの 特定AZのキャパシティ不足 4 preencoded.png 早期対応できず キャパ不足のまま営業時間となり 、CPU負荷アラートが
その後の対応 冷静な分析 即、暫定対応 まずは落ち着いて状況を分析 と言いたいですが、アラートも届いてる ので、手動で別AZへのインスタンス起動とALB接続にて暫定対応 手動対応したサーバを維持しつつ、様子見 特定AZで早朝バッチ等でリソースを別のお客様に抑えられてる ような挙動を確認(〜10:00前後には自動的にエラー解消するため )
2019年 4月 1日に利用するタイプ変更し恒久対応完了 m3.large -> t2.large へ それでも2021年までは年に1度は同じエラーが発生するのを確認 preencoded.png
まとめ 学習の機会 AWSだって、インスタンスのキャパシテ ィは無限大じゃない 共有リソースをシェアして利用? AWSに確認したわけではないが、そんな 挙動でした 起動テンプレートで改善 複数のインスタンスタイプを選択可能なため、 こちらに変更可能だが、コンテナ化をトライ
preencoded.png
preencoded.png
ご静聴ありがとうございました preencoded.png