スケールアウト再考

スケールアウト再考〜数千億アクセスへの道〜 Supership 山崎大輔(@yamaz)

山崎大輔(@yamaz) Supership 取締役（旧Scaleout代表） Scaleoutはnanapi, Bitcellerと合併して Supershipになりました。広告システムと検索システム作ってます。

広告システムについてシステム：インターネット広告システムアクセス：月間数千億〜サーバ台数： 1000台程度レスポンス
：〜100msec ユーザ数：数億UU〜上記のシステムを安定運用するための考え方について話したいと思います。

現在のインターネット広告配信の仕組み 4 DSP メディア側広告サーバ(SSP) DSP DSP ③ビッディング ①広告Request ②オークション
開催ブラウザ ④広告Result 広告１配信(1imp)ごとにオークションを行う

（参考）弊社採用のソフトウェア群配信系： nginx, apache, 独自エンジン(C++) KVS: memcached, 独自KVS(tokyocabinetベース）集計： hadoop,
hive, spark, vertica 管理画面： Ruby On Rails DB ： PostgreSQL ほぼオンプレ

いきなりですが、質問です。

いつも１0人並んでるATMが1台があります. ここで新たにATMを1台足すと行列の数はどうなるでしょう? ATM ATM ATM

答えだいたい0人に近づいていく

いつも１0人並んでるATMとは → 単位時間に到着する人数とATMが処理できる人数が釣り合ってるということいつも10人 ATM

ATMが1台増えると？ → ATMが処理できる人数の方が多くなる → 行列の数がどんどん減っていく → 最終的に0人になる ATM ATM

ATMの処理性能＜到着数の時処理が間に合ってないってことなので、行列がどんどん増えて最終的にめちゃくちゃ遅くなる

ATMの処理性能 > 到着数の時処理が間に合ってるってことなので、行列がどんどん減って最終的には0に近づく

リトルの公式(Little’s formula) 平均の待ち行列の数 L = λ * W L: システムの平均待ち行列数
λ：システムの平均到着率 W: システムの平均待ち時間

ここまでのまとめイイネ！システムの処理性能 > アクセスヨクナイネ！システムの処理性能 < アクセス

スケールアップとスケールアウト

スケールアップとスケールアウトどちらもシステムの処理性能 > アクセスを維持するための手法

スケールアップとスケールアウトスケールアップ：システムの処理性能 > アクセスになるまでサーバをパワーアップスケールアウト：システムの処理性能 > アクセス
になるまでサーバを増やす

スケールアウトという手法システムの処理性能 > アクセスになるまでサーバを増やすではなくシステムの処理性能 > アクセスになるまで1台あたりのアクセスとデータ量を減らす
と考えてみる

（おさらい）システムの処理性能 < アクセス → 待ち行列がどんどん増えていく → システムはどんどん遅くなる ATM

システムの処理性能 < アクセス 1%しか超えてなくても、この状態がずーっと続く限りは待ち行列は永遠に増える →システムは無限に遅くなる

スケールアウトあるある応答速度が10倍遅くなった！えぇっ？10倍サーバを足す必要があるの？？ →必要ありませんシステムの処理性能＞アクセスを満たせばいいので、大抵の場合数割の増強で事足りるはず

逆を言うと？ 1台あたり数割の性能劣化が10倍以上の速度低下をもたらす可能性がある！！

ミドルウェアの選定基準ピーク性能ではなく、性能の安定度（分散の小ささ）に着目するパフォーマンスが不安定なものはピーク性能が良くても良くないものだと考える

性能の分散が小さい＝制御しやすいソフトA ソフトB 性能高性能低品質工学の考え方：ソフトBのほうがよいと考える

ミドルウェアの選定基準 1. 複雑な機構を持ったものを避け、単純なものを採用する 2. GCやデータリバランスなどコントロールしにくい挙動のものを避ける「やかんは壊れない」の心意気

スケールアウトあるあるシステムは設計を端折ったところからほころび始める。あらゆる箇所が現在の100倍になっても大丈夫か確認しましょう。

スケールアウトあるある処理能力を超えると一気にダメになる対策： - ピークアクセス時の予兆を見逃さない - カナリアサーバの準備 - アクセスの強制的な平滑化

それでもダメならスケールアップも積極的に検討しましょう。 SSDには随分と助けられました。なおネットワーク帯域はスケールアップしにくい領域なので、極力ネットワーク負荷の低いシステム設計にしましょう。

最後に 1. 「システムの処理性能 > アクセス」の維持を強く意識しましょう 2. 普通をきちんと積み重ねるだけで数1000億のアクセスは十分対応可能 3.
とはいえ、大量アクセスを浴び続けることで養われるものもあるそんなシステムを取り回してみたい方はぜひ弊社に！ http://recruit.supership.jp/

スケールアウト再考

スケールアウト再考

Daisuke Yamazaki

More Decks by Daisuke Yamazaki

Other Decks in Technology

Featured

Transcript