Upgrade to Pro — share decks privately, control downloads, hide ads and more …

JAWS-UG HPC支部_hpc8a Benchmark

JAWS-UG HPC支部_hpc8a Benchmark

Avatar for Takafumi Takeda

Takafumi Takeda

April 17, 2026

Other Decks in Technology

Transcript

  1. 3 © DENTSU SOKEN INC. クロスイノベーション本部 クラウドインフラテクノロジーユニット クラウドイノベーションセンター エンジニアリングクラウドグループ 武田

    嵩史 Takeda Takafumi #AWS #Azure #OCI #Google Cloud #IoT #ETL 株式会社 電通総研 主なプロジェクト実績  大手自動車会社様向け 大規模HPC環境構築(プロジェクトマネージャー)  サプライヤー様向け HPC環境構築(プロジェクトリーダー)  大手商社様向け ETL/AIサービスを用いた予測ダッシュボード構築 (プロジェクトリーダー)  大手自動車会社様向け ID統合/管理システム設計・構築 (プロジェクトマネージャー)  研究機関向け VDI環境設計/構築(プロジェクトマネージャー) 趣味  身体を動かすこと  脱出ゲーム・ボードゲーム  カメラ
  2. 9 © DENTSU SOKEN INC. AWS HPC向け最新インスタンスタイプ ~hpc8a~ インスタンスタイプ名 hpc8a.96xlarge

    プロセッサ Turin(AMD EPYC 9R45) コア数 192CPU メモリ 768GB(4GB/CPU) NW bandwidth 300Gbps(EFA対応) 使用可能リージョン 26/2/16 : us-east-2(オハイオ)、eu-north-1(ストックホルム) 26/3/13 : ap-northeast-1(東京) 、GovCloud(米国西部) 前世代の Hpc7a インスタンスよりも 最大 40% 優れたパフォーマンス、最大 25% 優れた料金パフォーマンスを実現します。 (出典) https://www.amd.com/ja/products/processors/server/epyc/9005-series.html
  3. 10 © DENTSU SOKEN INC. ベンチマーク実施インスタンスタイプ Instance type Spec Cost(instance/h)

    Cost(core/h) In te l hpc6id.32xlarge CPU :Intel Xeon Ice Lake 64cores Memory :1024GB NIC :200Gbit/s EFA $5.70 $0.09 r8i.96xlarge CPU :Intel Xeon6 Granite Rapids-AP 192 cores @ 3.9GHz Memory :3072GB NIC :100Gbit/s EFA $26.67 $0.14 A M D c7a.48xlarge CPU :AMD EPYC 9R14 Genoa 192 cores @ 3.6GHz Memory :384GB NIC :50 Gbit/s EFA $9.85 $0.05 hpc7a.96xlarge CPU :AMD EPYC 9R14 Genoa 192 cores @ 3.6GHz Memory :768GB NIC :300 Gbit/s EFA $7.20 $0.04 m8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :768GB NIC :75 Gbit/s EFA $11.69 $0.06 c8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :384GB NIC :75 Gbit/s EFA $10.35 $0.06 hpc8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :768GB NIC :300 Gbit/s EFA $7.92 $0.04 A W S c8g.48xlarge CPU :AWS Graviton4 192 cores @ 3.2GHz Memory :384GB NIC :50 Gbit/s EFA $7.63 $0.04 ※Costはオハイオリージョンでの単価としております。
  4. 11 © DENTSU SOKEN INC. ベンチマーク実施インスタンスタイプ Instance type Spec Cost(instance/h)

    Cost(core/h) In te l hpc6id.32xlarge CPU :Intel Xeon Ice Lake 64cores Memory :1024GB NIC :200Gbit/s EFA $5.70 $0.09 r8i.96xlarge CPU :Intel Xeon6 Granite Rapids-AP 192 cores @ 3.9GHz Memory :3072GB NIC :100Gbit/s EFA $26.67 $0.14 A M D c7a.48xlarge CPU :AMD EPYC 9R14 Genoa 192 cores @ 3.6GHz Memory :384GB NIC :50 Gbit/s EFA $9.85 $0.05 hpc7a.96xlarge CPU :AMD EPYC 9R14 Genoa 192 cores @ 3.6GHz Memory :768GB NIC :300 Gbit/s EFA $7.20 $0.04 m8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :768GB NIC :75 Gbit/s EFA $11.69 $0.06 c8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :384GB NIC :75 Gbit/s EFA $10.35 $0.06 hpc8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :768GB NIC :300 Gbit/s EFA $7.92 $0.04 A W S c8g.48xlarge CPU :AWS Graviton4 192 cores @ 3.2GHz Memory :384GB NIC :50 Gbit/s EFA $7.63 $0.04 ※Costはオハイオリージョンでの単価としております。
  5. 12 © DENTSU SOKEN INC. ベンチマーク概要~ベンチマークモデル~ 各社様よりライセンス・ベンチマークモデルをご提供いただき、ベンチマークを実施いたしました。 OS RHEL8.10 FSx

    for Lustre (SSD/250MB/s/TiB x 4.8TB) HW Fluent 2025R2 SW EFA MW Storage NW Job Scheduler Slurm Ansys LS-DYNA 2025R2 Siemens STAR-CCM+ 2506.0001 Benchmark Model MPI IntelMPI v2021.13 /OpenMPI v4.1.7 f1_racer_140m 1億4000万メッシュ規模 Caravan-V03c_ver10_1200k-car2 パーツ数:990個 節点数 :2,533,466 要素数 :2,448,596 Golf_120M.sim 1億2000万メッシュ規模
  6. 13 © DENTSU SOKEN INC. ベンチマーク概要~計測項目~ 【時間】 ソルバーの実行時間のみを計測 (標準出力のTotal Solver

    Elapsed Time [s]) 【コスト】 1ベンチマークジョブを実行するのに かかったインスタンス費用[$] 【コストパフォーマンス】 = (実行時間)×(コスト) (Genoaの汎用インスタンスを”1”とする。)
  7. 15 © DENTSU SOKEN INC. Ansys Fluent 0 500 1000

    1500 2000 2500 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4)
  8. 16 © DENTSU SOKEN INC. Ansys Fluent 0 500 1000

    1500 2000 2500 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 パフォーマンス比較
  9. 17 © DENTSU SOKEN INC. Ansys Fluent 1466.815 976.913 610.672

    472.169 1064.127 698.844 428.571 334.541 0 500 1000 1500 2000 2500 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 • 前世代hpcインスタンスより 3割程度のパフォーマンス改善 が見られた。 約27%向上 約28%向上 約30%向上 約29%向上 前世代hpcとのパフォーマンス比較
  10. 18 © DENTSU SOKEN INC. Ansys Fluent 1117.786 764.059 496.724

    404.925 1064.127 698.844 428.571 334.541 0 500 1000 1500 2000 2500 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 • 前世代hpcインスタンスより 3割程度のパフォーマンス改善 が見られた。 • 並列数が増えれば増えるほど 汎用タイプよりも性能向上比 が高くなる。 約5%向上 約9%向上 約14%向上 約17%向上 汎用タイプとのパフォーマンス比較
  11. 19 © DENTSU SOKEN INC. Ansys Fluent 0 500 1000

    1500 2000 2500 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 • 前世代hpcインスタンスより 3割程度のパフォーマンス改善 が見られた。 • 並列数が増えれば増えるほど 汎用タイプよりも性能向上比 が高くなる。 • Graviton4では大規模並列計 算において、計算時間のスケー ルメリットが出ている。 :Graviton4(c8g) :Turin(hpc8a) Graviton4のスケール
  12. 20 © DENTSU SOKEN INC. $0.00 $5.00 $10.00 $15.00 $20.00

    $25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent
  13. 21 © DENTSU SOKEN INC. $0.00 $5.00 $10.00 $15.00 $20.00

    $25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 コスト性能
  14. 22 © DENTSU SOKEN INC. $5.87 $5.86 $7.33 $10.39 $4.68

    $4.61 $5.66 $8.10 $0.00 $5.00 $10.00 $15.00 $20.00 $25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 前世代hpcとのコスト比較 約20%低下 約21%低下 約23%低下 約22%低下
  15. 23 © DENTSU SOKEN INC. $7.26 $7.44 $9.67 $14.46 $4.68

    $4.61 $5.66 $8.10 $0.00 $5.00 $10.00 $15.00 $20.00 $25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 • 汎用タイプ比では4割近くのコ スト改善となる。 汎用タイプとのコスト比較 約36%低下 約38%低下 約41%低下 約44%低下
  16. 24 © DENTSU SOKEN INC. $0.00 $5.00 $10.00 $15.00 $20.00

    $25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 • 汎用タイプ比では4割近くのコ スト改善となる。 • Intelのインスタンスタイプは コスト観点では高め。 Intelのインスタンスコスト
  17. 25 © DENTSU SOKEN INC. $0.00 $5.00 $10.00 $15.00 $20.00

    $25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 • 汎用タイプ比では4割近くのコ スト改善となる。 • Intelのインスタンスタイプは コスト観点では高め。 • Ice Lakeを除くインスタンス タイプにおいて、512並列がコ スト削減のピークポイント。 : Ice Lakeを除く平均コスト 並列数に対するコスト
  18. 26 © DENTSU SOKEN INC. 1.05 0.99 1.05 1.16 1.42

    1.21 1.36 1.43 1.00 1.00 1.00 1.00 0.79 0.73 0.74 0.71 0.76 0.73 0.76 0.78 0.60 0.57 0.63 0.74 1.10 1.01 1.00 0.93 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較(Lower is better) hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。
  19. 27 © DENTSU SOKEN INC. 1.05 0.99 1.05 1.16 1.42

    1.21 1.36 1.43 1.00 1.00 1.00 1.00 0.79 0.73 0.74 0.71 0.76 0.73 0.76 0.78 0.60 0.57 0.63 0.74 1.10 1.01 1.00 0.93 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較(Lower is better) hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent コストパフォーマンスでの比較 コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。 • コスパが一番良いのはhpc8a。 512並列がコスパの最小値。
  20. 28 © DENTSU SOKEN INC. 1.05 0.99 1.05 1.16 1.42

    1.21 1.36 1.43 1.00 1.00 1.00 1.00 0.79 0.73 0.74 0.71 0.76 0.73 0.76 0.78 0.60 0.57 0.63 0.74 1.10 1.01 1.00 0.93 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較(Lower is better) hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。 • コスパが一番良いのはhpc8a。 512並列がコスパの最小値。 • 2048並列までいくと Graviton4のコスパが c7a(Genoa)を逆転。 Graviton4のスケール
  21. 29 © DENTSU SOKEN INC. 1.05 0.99 1.05 1.16 1.42

    1.21 1.36 1.43 1.00 1.00 1.00 1.00 0.79 0.73 0.74 0.71 0.76 0.73 0.76 0.78 0.60 0.57 0.63 0.74 1.10 1.01 1.00 0.93 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較(Lower is better) hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。 • コスパが一番良いのはhpc8a。 512並列がコスパの最小値。 • 2048並列までいくと Graviton4のコスパが c7a(Genoa)を逆転。 • hpcインスタンスはコスパが大 変優れている。 hpcインスタンスのコスパ
  22. 31 © DENTSU SOKEN INC. 0 2000 4000 6000 8000

    10000 12000 14000 64並列 128並列 256並列 512並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA
  23. 32 © DENTSU SOKEN INC. 0 2000 4000 6000 8000

    10000 12000 14000 64並列 128並列 256並列 512並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA パフォーマンス比較 • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。
  24. 33 © DENTSU SOKEN INC. 8574.743 5498.062 3563.12 2408.745 4747.619

    3300.729 2077.994 1416.822 0 2000 4000 6000 8000 10000 12000 14000 64並列 128並列 256並列 512並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA 前世代hpcとのパフォーマンス比較 • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 • 前世代hpcインスタンスより 4割超のパフォーマンス改善が 見られた。 約45%向上 約40%向上 約42%向上 約41%向上
  25. 34 © DENTSU SOKEN INC. 6655.073 4863.415 3029.923 2115.624 4747.619

    3300.729 2077.994 1416.822 0 2000 4000 6000 8000 10000 12000 14000 64並列 128並列 256並列 512並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA コンピューティング最適とのパフォーマンス比較 • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 • 前世代hpcインスタンスより 4割超のパフォーマンス改善が 見られた。 • コンピューティング最適インス タンスよりもメモリが多いかつ NW帯域が大きいため、高並列 での性能向上率が高かった。 約29%向上 約32%向上 約31%向上 約33%向上
  26. 35 © DENTSU SOKEN INC. $0.00 $10.00 $20.00 $30.00 $40.00

    $50.00 $60.00 $70.00 64並列 128並列 256並列 512並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA
  27. 36 © DENTSU SOKEN INC. $0.00 $10.00 $20.00 $30.00 $40.00

    $50.00 $60.00 $70.00 64並列 128並列 256並列 512並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA コスト性能 • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。
  28. 37 © DENTSU SOKEN INC. $17.15 $11.00 $14.25 $14.45 $10.44

    $7.26 $9.14 $9.35 $0.00 $10.00 $20.00 $30.00 $40.00 $50.00 $60.00 $70.00 64並列 128並列 256並列 512並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA 前世代hpcとのコスト比較 • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 4割弱のコスト改善が見られた。 約39%低下 約34%低下 約36%低下 約35%低下
  29. 38 © DENTSU SOKEN INC. $19.13 $13.98 $17.42 $18.25 $10.44

    $7.26 $9.14 $9.35 $0.00 $10.00 $20.00 $30.00 $40.00 $50.00 $60.00 $70.00 64並列 128並列 256並列 512並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA コンピューティング最適とのコスト比較 • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 4割弱のコスト改善が見られた。 • コンピューティング最適タイプ 比では5割近くのコスト改善と なる。 約45%低下 約48%低下 約48%低下 約49%低下
  30. 39 © DENTSU SOKEN INC. $0.00 $10.00 $20.00 $30.00 $40.00

    $50.00 $60.00 $70.00 64並列 128並列 256並列 512並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA Intelのインスタンスコスト • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 4割弱のコスト改善が見られた。 • コンピューティング最適タイプ 比では5割近くのコスト改善と なる。
  31. 40 © DENTSU SOKEN INC. 1.11 1.19 1.18 1.32 1.52

    1.40 1.42 1.35 1.00 1.00 1.00 1.00 0.84 0.72 0.74 0.70 0.78 0.76 0.75 0.73 0.49 0.45 0.45 0.43 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 64並列 128並列 256並列 512並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較 hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。
  32. 41 © DENTSU SOKEN INC. 1.11 1.19 1.18 1.32 1.52

    1.40 1.42 1.35 1.00 1.00 1.00 1.00 0.84 0.72 0.74 0.70 0.78 0.76 0.75 0.73 0.49 0.45 0.45 0.43 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 64並列 128並列 256並列 512並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較 hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。 • コスパが一番良いのはhpc8a • hpc7aと比較してもTurinが 搭載されているマシンはコス パが良い。 コストパフォーマンスでの比較
  33. 43 © DENTSU SOKEN INC. 0 500 1000 1500 2000

    2500 3000 3500 4000 4500 5000 128並列 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+
  34. 44 © DENTSU SOKEN INC. 0 500 1000 1500 2000

    2500 3000 3500 4000 4500 5000 128並列 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • 最新AMDプロセッサ(Turin) が搭載されたタイプとがパ フォーマンスに優れていた。 • 256並列まではIntel Granite Rapidsのパフォー マンスも優れていた。 パフォーマンス比較
  35. 45 © DENTSU SOKEN INC. 4031 2078 1079 614 412

    2917 1732 790 467 308 0 500 1000 1500 2000 2500 3000 3500 4000 4500 5000 128並列 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • 最新AMDプロセッサ(Turin) が搭載されたタイプとがパ フォーマンスに優れていた。 • 256並列まではIntel Granite Rapidsのパフォー マンスも優れていた。 • 前世代hpcインスタンスより 2割程度のパフォーマンス改善 が見られた。 前世代hpcとのパフォーマンス比較 約28%向上 約17%向上 約27%向上 約24%向上 約25%向上
  36. 46 © DENTSU SOKEN INC. 3268 1702 889 2917 1732

    790 467 308 0 500 1000 1500 2000 2500 3000 3500 4000 4500 5000 128並列 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • 最新AMDプロセッサ(Turin) が搭載されたタイプとがパ フォーマンスに優れていた。 • 256並列まではIntel Granite Rapidsのパフォー マンスも優れていた。 • 前世代hpcインスタンスより 2割程度のパフォーマンス改善 が見られた。 • コンピューティング最適との比 較では約10%程度の改善が見 られた。 コンピューティング最適とのパフォーマンス比較 約11%向上 約2%低下 約11%向上
  37. 47 © DENTSU SOKEN INC. $0.00 $10.00 $20.00 $30.00 $40.00

    $50.00 $60.00 $70.00 128並列 256並列 512並列 1024並列 2048並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+
  38. 48 © DENTSU SOKEN INC. $0.00 $10.00 $20.00 $30.00 $40.00

    $50.00 $60.00 $70.00 128並列 256並列 512並列 1024並列 2048並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • hpc8a(Turin) が全ての並 列数で一番コストが低い結果 であった。 コスト性能
  39. 49 © DENTSU SOKEN INC. $8.06 $8.31 $8.63 $9.82 $13.18

    $6.42 $7.62 $6.95 $8.22 $10.84 $0.00 $10.00 $20.00 $30.00 $40.00 $50.00 $60.00 $70.00 128並列 256並列 512並列 1024並列 2048並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • hpc8a(Turin) が全ての並 列数で一番コストが低い結果 であった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 前世代hpcとのコスト比較 約20%低下 約8%低下 約19%低下 約18%低下 約16%低下
  40. 50 © DENTSU SOKEN INC. $9.40 $9.79 $10.22 $6.42 $7.62

    $6.95 $8.22 $10.84 $0.00 $10.00 $20.00 $30.00 $40.00 $50.00 $60.00 $70.00 128並列 256並列 512並列 1024並列 2048並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • hpc8a(Turin) が全ての並 列数で一番コストが低い結果 であった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 • コンピューティング最適タイプ 比では3割近くのコスト改善と なる。 コンピューティング最適とのコスト比較 約30%低下 約22%低下 約32%低下
  41. 51 © DENTSU SOKEN INC. 1.13 1.18 1.29 1.88 2.92

    1.26 1.36 1.35 1.52 1.63 1.00 1.00 1.00 1.00 1.00 0.79 0.79 0.77 0.75 0.77 0.76 0.78 0.76 0.60 0.69 0.59 0.60 0.60 0.00 0.50 1.00 1.50 2.00 2.50 3.00 3.50 128並列 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較 hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。
  42. 52 © DENTSU SOKEN INC. 1.13 1.18 1.29 1.88 2.92

    1.26 1.36 1.35 1.52 1.63 1.00 1.00 1.00 1.00 1.00 0.79 0.79 0.77 0.75 0.77 0.76 0.78 0.76 0.60 0.69 0.59 0.60 0.60 0.00 0.50 1.00 1.50 2.00 2.50 3.00 3.50 128並列 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較 hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。 • コスパが一番良いのはhpc8a コストパフォーマンスでの比較
  43. 53 © DENTSU SOKEN INC. ベンチマーク結果サマリ  hpc8aは全ソルバ/全並列数で計算速度が優れた結果。  CPU性能がソルバの計算性能向上に寄与している。

     NW bandwidthの最適化も計算性能向上に寄与している。  計算速度向上に加え、HPC最適化インスタンスである “hpc8a”がコストパフォーマンスも高い。 0 2000 4000 6000 8000 10000 12000 14000 64並列 128並列 256並列 512並列 LS-DYNA 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) “Turin搭載” かつ “HPC専用”で出してきているのはAWSのみ 1.05 0.99 1.05 1.16 1.42 1.21 1.36 1.43 1.00 1.00 1.00 1.00 0.79 0.73 0.74 0.71 0.76 0.73 0.76 0.78 0.60 0.57 0.63 0.74 1.10 1.01 1.00 0.93 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 256並列 512並列 1024並列 2048並列 Fluent コストパフォーマンス比較(Lower is better) hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4)
  44. 55 © DENTSU SOKEN INC. (2025年12月 Update) AWS Interconnect –

    multicloud  マネージド型のプライベート接続サービス AWS 仮想プライベートクラウド (VPC) と他のパブリッククラウド上の VPC 間の高速ネットワーク接続を構築できます。 2026年4月現在 : Public Preview 2026年後半 Microsoft Azure Gateway AWS Cloud Virtual private cloud (VPC) AWS Interconnect -multicloud
  45. 56 © DENTSU SOKEN INC. (2026年4月7日 Update) S3 Files 

    4/7 S3に新しいサービスが登場  S3をNFSを使ってマウントできる! Virtual private cloud (VPC) 【従来】 【S3 Files】 Virtual private cloud (VPC) “Mountpoint for S3” をインストール Public Private S3 Files NFS マウントは出来ていてS3アクセスできるが、 厳密にはS3 APIを呼び出して、 マウントしているように見せているだけ。 S3 Filesに直接NFSマウントできる! オブジェクトストレージではなく、 ファイルシステムとして利用できる。
  46. 57 © DENTSU SOKEN INC. (2026年4月7日 Update) S3 Files 

    4/7 S3に新しいサービスが登場  S3をNFSを使ってマウントできる! Virtual private cloud (VPC) S3 Files NFS EFS EFSが裏側では動いており、 EFSがキャッシュとなりS3と中継している。 • 実質無制限容量のファイルストレージ • 縮退/拡張が自動 • 裏側はEFSなのでパフォーマンスも悪くない (はず) • S3 Filesに対しての読み書きにも課金発生 • 費用が見積りづらい
  47. 58 © DENTSU SOKEN INC. まとめ “hpc8a”はCAE解析に優れたインスタンスタイプ 今回ベンチマークを取った”hpc8a”は間違いなくCAE用途に優れたインスタンスタイプ。 “hpc8a”は日本リージョンで利用可能。 (キャパシティは要相談だと思いますが。。。)

    HPC利用に便利なサービスをAWSは展開 • Turinが搭載されたHPC専用マシンを展開しているのはAWSのみ。 • 他クラウドとの直接接続サービスも展開開始。 • S3も直接??EC2にマウント可能に! ベンチマークにご協力いただいた皆様へ感謝申し上げます。 ベンチマークにお力添えいただきましたAWS 小川様、舛重様、関係者様。 ライセンスをご提供いただきましたAnsys様、Siemens様へこの場を借りて感謝申し上げます。