Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
JAWS-UG HPC支部_hpc8a Benchmark
Search
Takafumi Takeda
April 17, 2026
Technology
150
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
JAWS-UG HPC支部_hpc8a Benchmark
Takafumi Takeda
April 17, 2026
Other Decks in Technology
See All in Technology
[DroidKaigi 2026] Making UI specifications visible: Android UI development in the AI agent era supported by Compose Screenshot Testing and galleries
syarihu
0
490
AIで実装は速くなった。なのにプロダクトは速くならない。職能の壁を越えて価値のフローを設計する
nwiizo
6
6.1k
なぜSRE・セキュリティは評価されないのか?守りの組織を事業成長エンジンに変えた実践
cscengineer
PRO
2
1.9k
DGX Sparkを2台使って いろいろ動かす話
sonoda_mj
1
120
Genie Code ワークショップ 基礎編 / Genie-Code-Workshop-fundamental
databricksjapan
PRO
0
310
AI-DLCって実際どう? 〜聞きたいこと全部聞いてみる〜
news_it_enj
0
200
【試作】IoT x AIエージェント
happysamurai294
0
110
Sony-DroidKaigi2026
sony
1
300
Bet AI Day 2026丨Agentは、「金融」という巨大産業の何を変えられるのか
layerx
PRO
0
630
本番に近いテストをもっと手軽に - Postmanで広がるAPIテストの世界 / Expanding the World of API Testing with Postman
yokawasa
1
240
【視聴者参加型!】AWSセキュリティアンチパターンクイズ
syoshie
0
160
AIで開発は速くなったのに、なぜ現場は楽にならないのか 〜あなたの組織のボトルネックを突き止めるワークショップ〜
jacopen
1
230
Featured
See All Featured
Hiding What from Whom? A Critical Review of the History of Programming languages for Music
tomoyanonymous
3
1.2k
世界の人気アプリ100個を分析して見えたペイウォール設計の心得
akihiro_kokubo
PRO
74
42k
Statistics for Hackers
jakevdp
799
230k
Rebuilding a faster, lazier Slack
samanthasiow
85
9.6k
Game over? The fight for quality and originality in the time of robots
wayneb77
1
260
CSS Pre-Processors: Stylus, Less & Sass
bermonpainter
360
30k
Code Reviewing Like a Champion
maltzj
528
40k
Claude Code どこまでも/ Claude Code Everywhere
nwiizo
67
58k
Music & Morning Musume
bryan
47
7.4k
Responsive Adventures: Dirty Tricks From The Dark Corners of Front-End
smashingmag
254
22k
RailsConf & Balkan Ruby 2019: The Past, Present, and Future of Rails at GitHub
eileencodes
141
35k
Getting science done with accelerated Python computing platforms
jacobtomlinson
2
460
Transcript
JAWS-UG HPC支部 2026年4月17日 株式会社 電通総研 クロスイノベーション本部 クラウドインフラテクノロジーユニット クラウドイノベーションセンター エンジニアリングクラウドグループ 武田
嵩史 HPC8a benchmark by 電通総研
2 自己紹介 Hpc8aインスタンス ベンチマーク結果 最新AWSインフラトピック 01 02 03 大目次 INDEX
3 © DENTSU SOKEN INC. クロスイノベーション本部 クラウドインフラテクノロジーユニット クラウドイノベーションセンター エンジニアリングクラウドグループ 武田
嵩史 Takeda Takafumi #AWS #Azure #OCI #Google Cloud #IoT #ETL 株式会社 電通総研 主なプロジェクト実績 大手自動車会社様向け 大規模HPC環境構築(プロジェクトマネージャー) サプライヤー様向け HPC環境構築(プロジェクトリーダー) 大手商社様向け ETL/AIサービスを用いた予測ダッシュボード構築 (プロジェクトリーダー) 大手自動車会社様向け ID統合/管理システム設計・構築 (プロジェクトマネージャー) 研究機関向け VDI環境設計/構築(プロジェクトマネージャー) 趣味 身体を動かすこと 脱出ゲーム・ボードゲーム カメラ
あなたのクリエイティブで前向きな発言がイベント をより楽しくします。 発表者や質問者に対して疑問や意見がある場合は 批判や罵り・嘲りではなく提案と課題解決の態度で ポジティブな発言を心がけましょう。
あなたのクリエイティブで前向きな発言がイベント をより楽しくします。 発表者や質問者に対して疑問や意見がある場合は 批判や罵り・嘲りではなく提案と課題解決の態度で ポジティブな発言を心がけましょう。 JAWS-UGのマナー1つ目
あなたのクリエイティブで前向きな発言がイベント をより楽しくします。 発表者や質問者に対して疑問や意見がある場合は 批判や罵り・嘲りではなく提案と課題解決の態度で ポジティブな発言を心がけましょう。 世界一 心理的安全性が高いコミュニティ (私調べ)
7 自己紹介 Hpc8aインスタンス ベンチマーク結果 最新AWSインフラトピック 01 02 03 大目次 INDEX
8 Hpc8aインスタンス ベンチマーク結果 02 大目次 INDEX 01. hpc8a紹介 02. ベンチマーク実施インスタンスタイプ
03. ベンチマーク概要 04. ベンチマーク結果
9 © DENTSU SOKEN INC. AWS HPC向け最新インスタンスタイプ ~hpc8a~ インスタンスタイプ名 hpc8a.96xlarge
プロセッサ Turin(AMD EPYC 9R45) コア数 192CPU メモリ 768GB(4GB/CPU) NW bandwidth 300Gbps(EFA対応) 使用可能リージョン 26/2/16 : us-east-2(オハイオ)、eu-north-1(ストックホルム) 26/3/13 : ap-northeast-1(東京) 、GovCloud(米国西部) 前世代の Hpc7a インスタンスよりも 最大 40% 優れたパフォーマンス、最大 25% 優れた料金パフォーマンスを実現します。 (出典) https://www.amd.com/ja/products/processors/server/epyc/9005-series.html
10 © DENTSU SOKEN INC. ベンチマーク実施インスタンスタイプ Instance type Spec Cost(instance/h)
Cost(core/h) In te l hpc6id.32xlarge CPU :Intel Xeon Ice Lake 64cores Memory :1024GB NIC :200Gbit/s EFA $5.70 $0.09 r8i.96xlarge CPU :Intel Xeon6 Granite Rapids-AP 192 cores @ 3.9GHz Memory :3072GB NIC :100Gbit/s EFA $26.67 $0.14 A M D c7a.48xlarge CPU :AMD EPYC 9R14 Genoa 192 cores @ 3.6GHz Memory :384GB NIC :50 Gbit/s EFA $9.85 $0.05 hpc7a.96xlarge CPU :AMD EPYC 9R14 Genoa 192 cores @ 3.6GHz Memory :768GB NIC :300 Gbit/s EFA $7.20 $0.04 m8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :768GB NIC :75 Gbit/s EFA $11.69 $0.06 c8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :384GB NIC :75 Gbit/s EFA $10.35 $0.06 hpc8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :768GB NIC :300 Gbit/s EFA $7.92 $0.04 A W S c8g.48xlarge CPU :AWS Graviton4 192 cores @ 3.2GHz Memory :384GB NIC :50 Gbit/s EFA $7.63 $0.04 ※Costはオハイオリージョンでの単価としております。
11 © DENTSU SOKEN INC. ベンチマーク実施インスタンスタイプ Instance type Spec Cost(instance/h)
Cost(core/h) In te l hpc6id.32xlarge CPU :Intel Xeon Ice Lake 64cores Memory :1024GB NIC :200Gbit/s EFA $5.70 $0.09 r8i.96xlarge CPU :Intel Xeon6 Granite Rapids-AP 192 cores @ 3.9GHz Memory :3072GB NIC :100Gbit/s EFA $26.67 $0.14 A M D c7a.48xlarge CPU :AMD EPYC 9R14 Genoa 192 cores @ 3.6GHz Memory :384GB NIC :50 Gbit/s EFA $9.85 $0.05 hpc7a.96xlarge CPU :AMD EPYC 9R14 Genoa 192 cores @ 3.6GHz Memory :768GB NIC :300 Gbit/s EFA $7.20 $0.04 m8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :768GB NIC :75 Gbit/s EFA $11.69 $0.06 c8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :384GB NIC :75 Gbit/s EFA $10.35 $0.06 hpc8a.48xlarge CPU :AMD EPYC 9R45 Turin 192 cores Memory :768GB NIC :300 Gbit/s EFA $7.92 $0.04 A W S c8g.48xlarge CPU :AWS Graviton4 192 cores @ 3.2GHz Memory :384GB NIC :50 Gbit/s EFA $7.63 $0.04 ※Costはオハイオリージョンでの単価としております。
12 © DENTSU SOKEN INC. ベンチマーク概要~ベンチマークモデル~ 各社様よりライセンス・ベンチマークモデルをご提供いただき、ベンチマークを実施いたしました。 OS RHEL8.10 FSx
for Lustre (SSD/250MB/s/TiB x 4.8TB) HW Fluent 2025R2 SW EFA MW Storage NW Job Scheduler Slurm Ansys LS-DYNA 2025R2 Siemens STAR-CCM+ 2506.0001 Benchmark Model MPI IntelMPI v2021.13 /OpenMPI v4.1.7 f1_racer_140m 1億4000万メッシュ規模 Caravan-V03c_ver10_1200k-car2 パーツ数:990個 節点数 :2,533,466 要素数 :2,448,596 Golf_120M.sim 1億2000万メッシュ規模
13 © DENTSU SOKEN INC. ベンチマーク概要~計測項目~ 【時間】 ソルバーの実行時間のみを計測 (標準出力のTotal Solver
Elapsed Time [s]) 【コスト】 1ベンチマークジョブを実行するのに かかったインスタンス費用[$] 【コストパフォーマンス】 = (実行時間)×(コスト) (Genoaの汎用インスタンスを”1”とする。)
14 Ansys Fluent
15 © DENTSU SOKEN INC. Ansys Fluent 0 500 1000
1500 2000 2500 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4)
16 © DENTSU SOKEN INC. Ansys Fluent 0 500 1000
1500 2000 2500 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 パフォーマンス比較
17 © DENTSU SOKEN INC. Ansys Fluent 1466.815 976.913 610.672
472.169 1064.127 698.844 428.571 334.541 0 500 1000 1500 2000 2500 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 • 前世代hpcインスタンスより 3割程度のパフォーマンス改善 が見られた。 約27%向上 約28%向上 約30%向上 約29%向上 前世代hpcとのパフォーマンス比較
18 © DENTSU SOKEN INC. Ansys Fluent 1117.786 764.059 496.724
404.925 1064.127 698.844 428.571 334.541 0 500 1000 1500 2000 2500 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 • 前世代hpcインスタンスより 3割程度のパフォーマンス改善 が見られた。 • 並列数が増えれば増えるほど 汎用タイプよりも性能向上比 が高くなる。 約5%向上 約9%向上 約14%向上 約17%向上 汎用タイプとのパフォーマンス比較
19 © DENTSU SOKEN INC. Ansys Fluent 0 500 1000
1500 2000 2500 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 • 前世代hpcインスタンスより 3割程度のパフォーマンス改善 が見られた。 • 並列数が増えれば増えるほど 汎用タイプよりも性能向上比 が高くなる。 • Graviton4では大規模並列計 算において、計算時間のスケー ルメリットが出ている。 :Graviton4(c8g) :Turin(hpc8a) Graviton4のスケール
20 © DENTSU SOKEN INC. $0.00 $5.00 $10.00 $15.00 $20.00
$25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent
21 © DENTSU SOKEN INC. $0.00 $5.00 $10.00 $15.00 $20.00
$25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 コスト性能
22 © DENTSU SOKEN INC. $5.87 $5.86 $7.33 $10.39 $4.68
$4.61 $5.66 $8.10 $0.00 $5.00 $10.00 $15.00 $20.00 $25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 前世代hpcとのコスト比較 約20%低下 約21%低下 約23%低下 約22%低下
23 © DENTSU SOKEN INC. $7.26 $7.44 $9.67 $14.46 $4.68
$4.61 $5.66 $8.10 $0.00 $5.00 $10.00 $15.00 $20.00 $25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 • 汎用タイプ比では4割近くのコ スト改善となる。 汎用タイプとのコスト比較 約36%低下 約38%低下 約41%低下 約44%低下
24 © DENTSU SOKEN INC. $0.00 $5.00 $10.00 $15.00 $20.00
$25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 • 汎用タイプ比では4割近くのコ スト改善となる。 • Intelのインスタンスタイプは コスト観点では高め。 Intelのインスタンスコスト
25 © DENTSU SOKEN INC. $0.00 $5.00 $10.00 $15.00 $20.00
$25.00 $30.00 $35.00 $40.00 $45.00 256並列 512並列 1024並列 2048並列 各インスタンス毎のジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 • 汎用タイプ比では4割近くのコ スト改善となる。 • Intelのインスタンスタイプは コスト観点では高め。 • Ice Lakeを除くインスタンス タイプにおいて、512並列がコ スト削減のピークポイント。 : Ice Lakeを除く平均コスト 並列数に対するコスト
26 © DENTSU SOKEN INC. 1.05 0.99 1.05 1.16 1.42
1.21 1.36 1.43 1.00 1.00 1.00 1.00 0.79 0.73 0.74 0.71 0.76 0.73 0.76 0.78 0.60 0.57 0.63 0.74 1.10 1.01 1.00 0.93 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較(Lower is better) hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。
27 © DENTSU SOKEN INC. 1.05 0.99 1.05 1.16 1.42
1.21 1.36 1.43 1.00 1.00 1.00 1.00 0.79 0.73 0.74 0.71 0.76 0.73 0.76 0.78 0.60 0.57 0.63 0.74 1.10 1.01 1.00 0.93 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較(Lower is better) hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent コストパフォーマンスでの比較 コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。 • コスパが一番良いのはhpc8a。 512並列がコスパの最小値。
28 © DENTSU SOKEN INC. 1.05 0.99 1.05 1.16 1.42
1.21 1.36 1.43 1.00 1.00 1.00 1.00 0.79 0.73 0.74 0.71 0.76 0.73 0.76 0.78 0.60 0.57 0.63 0.74 1.10 1.01 1.00 0.93 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較(Lower is better) hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。 • コスパが一番良いのはhpc8a。 512並列がコスパの最小値。 • 2048並列までいくと Graviton4のコスパが c7a(Genoa)を逆転。 Graviton4のスケール
29 © DENTSU SOKEN INC. 1.05 0.99 1.05 1.16 1.42
1.21 1.36 1.43 1.00 1.00 1.00 1.00 0.79 0.73 0.74 0.71 0.76 0.73 0.76 0.78 0.60 0.57 0.63 0.74 1.10 1.01 1.00 0.93 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較(Lower is better) hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4) Ansys Fluent コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。 • コスパが一番良いのはhpc8a。 512並列がコスパの最小値。 • 2048並列までいくと Graviton4のコスパが c7a(Genoa)を逆転。 • hpcインスタンスはコスパが大 変優れている。 hpcインスタンスのコスパ
30 Ansys LS-DYNA
31 © DENTSU SOKEN INC. 0 2000 4000 6000 8000
10000 12000 14000 64並列 128並列 256並列 512並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA
32 © DENTSU SOKEN INC. 0 2000 4000 6000 8000
10000 12000 14000 64並列 128並列 256並列 512並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA パフォーマンス比較 • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。
33 © DENTSU SOKEN INC. 8574.743 5498.062 3563.12 2408.745 4747.619
3300.729 2077.994 1416.822 0 2000 4000 6000 8000 10000 12000 14000 64並列 128並列 256並列 512並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA 前世代hpcとのパフォーマンス比較 • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 • 前世代hpcインスタンスより 4割超のパフォーマンス改善が 見られた。 約45%向上 約40%向上 約42%向上 約41%向上
34 © DENTSU SOKEN INC. 6655.073 4863.415 3029.923 2115.624 4747.619
3300.729 2077.994 1416.822 0 2000 4000 6000 8000 10000 12000 14000 64並列 128並列 256並列 512並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA コンピューティング最適とのパフォーマンス比較 • hpc8a(Turin)が全ての並列 数で一番パフォーマンスが優 れていた。 • 前世代hpcインスタンスより 4割超のパフォーマンス改善が 見られた。 • コンピューティング最適インス タンスよりもメモリが多いかつ NW帯域が大きいため、高並列 での性能向上率が高かった。 約29%向上 約32%向上 約31%向上 約33%向上
35 © DENTSU SOKEN INC. $0.00 $10.00 $20.00 $30.00 $40.00
$50.00 $60.00 $70.00 64並列 128並列 256並列 512並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA
36 © DENTSU SOKEN INC. $0.00 $10.00 $20.00 $30.00 $40.00
$50.00 $60.00 $70.00 64並列 128並列 256並列 512並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA コスト性能 • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。
37 © DENTSU SOKEN INC. $17.15 $11.00 $14.25 $14.45 $10.44
$7.26 $9.14 $9.35 $0.00 $10.00 $20.00 $30.00 $40.00 $50.00 $60.00 $70.00 64並列 128並列 256並列 512並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA 前世代hpcとのコスト比較 • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 4割弱のコスト改善が見られた。 約39%低下 約34%低下 約36%低下 約35%低下
38 © DENTSU SOKEN INC. $19.13 $13.98 $17.42 $18.25 $10.44
$7.26 $9.14 $9.35 $0.00 $10.00 $20.00 $30.00 $40.00 $50.00 $60.00 $70.00 64並列 128並列 256並列 512並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA コンピューティング最適とのコスト比較 • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 4割弱のコスト改善が見られた。 • コンピューティング最適タイプ 比では5割近くのコスト改善と なる。 約45%低下 約48%低下 約48%低下 約49%低下
39 © DENTSU SOKEN INC. $0.00 $10.00 $20.00 $30.00 $40.00
$50.00 $60.00 $70.00 64並列 128並列 256並列 512並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA Intelのインスタンスコスト • hpc8a(Turin)が全ての並列 数で一番コストが低い結果で あった。 • 前世代hpcインスタンスより 4割弱のコスト改善が見られた。 • コンピューティング最適タイプ 比では5割近くのコスト改善と なる。
40 © DENTSU SOKEN INC. 1.11 1.19 1.18 1.32 1.52
1.40 1.42 1.35 1.00 1.00 1.00 1.00 0.84 0.72 0.74 0.70 0.78 0.76 0.75 0.73 0.49 0.45 0.45 0.43 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 64並列 128並列 256並列 512並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較 hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。
41 © DENTSU SOKEN INC. 1.11 1.19 1.18 1.32 1.52
1.40 1.42 1.35 1.00 1.00 1.00 1.00 0.84 0.72 0.74 0.70 0.78 0.76 0.75 0.73 0.49 0.45 0.45 0.43 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 64並列 128並列 256並列 512並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較 hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Ansys LS-DYNA コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。 • コスパが一番良いのはhpc8a • hpc7aと比較してもTurinが 搭載されているマシンはコス パが良い。 コストパフォーマンスでの比較
42 Siemens STAR-CCM+
43 © DENTSU SOKEN INC. 0 500 1000 1500 2000
2500 3000 3500 4000 4500 5000 128並列 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+
44 © DENTSU SOKEN INC. 0 500 1000 1500 2000
2500 3000 3500 4000 4500 5000 128並列 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • 最新AMDプロセッサ(Turin) が搭載されたタイプとがパ フォーマンスに優れていた。 • 256並列まではIntel Granite Rapidsのパフォー マンスも優れていた。 パフォーマンス比較
45 © DENTSU SOKEN INC. 4031 2078 1079 614 412
2917 1732 790 467 308 0 500 1000 1500 2000 2500 3000 3500 4000 4500 5000 128並列 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • 最新AMDプロセッサ(Turin) が搭載されたタイプとがパ フォーマンスに優れていた。 • 256並列まではIntel Granite Rapidsのパフォー マンスも優れていた。 • 前世代hpcインスタンスより 2割程度のパフォーマンス改善 が見られた。 前世代hpcとのパフォーマンス比較 約28%向上 約17%向上 約27%向上 約24%向上 約25%向上
46 © DENTSU SOKEN INC. 3268 1702 889 2917 1732
790 467 308 0 500 1000 1500 2000 2500 3000 3500 4000 4500 5000 128並列 256並列 512並列 1024並列 2048並列 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • 最新AMDプロセッサ(Turin) が搭載されたタイプとがパ フォーマンスに優れていた。 • 256並列まではIntel Granite Rapidsのパフォー マンスも優れていた。 • 前世代hpcインスタンスより 2割程度のパフォーマンス改善 が見られた。 • コンピューティング最適との比 較では約10%程度の改善が見 られた。 コンピューティング最適とのパフォーマンス比較 約11%向上 約2%低下 約11%向上
47 © DENTSU SOKEN INC. $0.00 $10.00 $20.00 $30.00 $40.00
$50.00 $60.00 $70.00 128並列 256並列 512並列 1024並列 2048並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+
48 © DENTSU SOKEN INC. $0.00 $10.00 $20.00 $30.00 $40.00
$50.00 $60.00 $70.00 128並列 256並列 512並列 1024並列 2048並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • hpc8a(Turin) が全ての並 列数で一番コストが低い結果 であった。 コスト性能
49 © DENTSU SOKEN INC. $8.06 $8.31 $8.63 $9.82 $13.18
$6.42 $7.62 $6.95 $8.22 $10.84 $0.00 $10.00 $20.00 $30.00 $40.00 $50.00 $60.00 $70.00 128並列 256並列 512並列 1024並列 2048並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • hpc8a(Turin) が全ての並 列数で一番コストが低い結果 であった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 前世代hpcとのコスト比較 約20%低下 約8%低下 約19%低下 約18%低下 約16%低下
50 © DENTSU SOKEN INC. $9.40 $9.79 $10.22 $6.42 $7.62
$6.95 $8.22 $10.84 $0.00 $10.00 $20.00 $30.00 $40.00 $50.00 $60.00 $70.00 128並列 256並列 512並列 1024並列 2048並列 各インスタンスのジョブあたりのコスト[$] hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ • hpc8a(Turin) が全ての並 列数で一番コストが低い結果 であった。 • 前世代hpcインスタンスより 2割程度のコスト改善が見られ た。 • コンピューティング最適タイプ 比では3割近くのコスト改善と なる。 コンピューティング最適とのコスト比較 約30%低下 約22%低下 約32%低下
51 © DENTSU SOKEN INC. 1.13 1.18 1.29 1.88 2.92
1.26 1.36 1.35 1.52 1.63 1.00 1.00 1.00 1.00 1.00 0.79 0.79 0.77 0.75 0.77 0.76 0.78 0.76 0.60 0.69 0.59 0.60 0.60 0.00 0.50 1.00 1.50 2.00 2.50 3.00 3.50 128並列 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較 hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。
52 © DENTSU SOKEN INC. 1.13 1.18 1.29 1.88 2.92
1.26 1.36 1.35 1.52 1.63 1.00 1.00 1.00 1.00 1.00 0.79 0.79 0.77 0.75 0.77 0.76 0.78 0.76 0.60 0.69 0.59 0.60 0.60 0.00 0.50 1.00 1.50 2.00 2.50 3.00 3.50 128並列 256並列 512並列 1024並列 2048並列 c7a(Genoa)に対する各インスタンスのコストパフォーマンス比較 hpc6id.32xlarge(Ice Lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) Siemens STAR-CCM+ コスパ= (実行時間)×(コスト) • 各並列数にて、c7a(Genoa) を1.0としたときの他インスタ ンスのコスパを比較。 • コスパが一番良いのはhpc8a コストパフォーマンスでの比較
53 © DENTSU SOKEN INC. ベンチマーク結果サマリ hpc8aは全ソルバ/全並列数で計算速度が優れた結果。 CPU性能がソルバの計算性能向上に寄与している。
NW bandwidthの最適化も計算性能向上に寄与している。 計算速度向上に加え、HPC最適化インスタンスである “hpc8a”がコストパフォーマンスも高い。 0 2000 4000 6000 8000 10000 12000 14000 64並列 128並列 256並列 512並列 LS-DYNA 各インスタンス毎の経過時間比較[s] hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) c8a.48xlarge(Turin) hpc8a.96xlarge(Turin) “Turin搭載” かつ “HPC専用”で出してきているのはAWSのみ 1.05 0.99 1.05 1.16 1.42 1.21 1.36 1.43 1.00 1.00 1.00 1.00 0.79 0.73 0.74 0.71 0.76 0.73 0.76 0.78 0.60 0.57 0.63 0.74 1.10 1.01 1.00 0.93 0.00 0.20 0.40 0.60 0.80 1.00 1.20 1.40 1.60 256並列 512並列 1024並列 2048並列 Fluent コストパフォーマンス比較(Lower is better) hpc6id.32xlarge(Ice lake) r8i.96xlarge(Xeon Granite Rapids) c7a.48xlarge(Genoa) hpc7a.96xlarge(Genoa) m8a.48xlarge(Turin) hpc8a.96xlarge(Turin) c8g.48xlarge(Graviton4)
54 自己紹介 Hpc8aインスタンス ベンチマーク結果 最新AWSインフラトピック 01 02 03 大目次 INDEX
55 © DENTSU SOKEN INC. (2025年12月 Update) AWS Interconnect –
multicloud マネージド型のプライベート接続サービス AWS 仮想プライベートクラウド (VPC) と他のパブリッククラウド上の VPC 間の高速ネットワーク接続を構築できます。 2026年4月現在 : Public Preview 2026年後半 Microsoft Azure Gateway AWS Cloud Virtual private cloud (VPC) AWS Interconnect -multicloud
56 © DENTSU SOKEN INC. (2026年4月7日 Update) S3 Files
4/7 S3に新しいサービスが登場 S3をNFSを使ってマウントできる! Virtual private cloud (VPC) 【従来】 【S3 Files】 Virtual private cloud (VPC) “Mountpoint for S3” をインストール Public Private S3 Files NFS マウントは出来ていてS3アクセスできるが、 厳密にはS3 APIを呼び出して、 マウントしているように見せているだけ。 S3 Filesに直接NFSマウントできる! オブジェクトストレージではなく、 ファイルシステムとして利用できる。
57 © DENTSU SOKEN INC. (2026年4月7日 Update) S3 Files
4/7 S3に新しいサービスが登場 S3をNFSを使ってマウントできる! Virtual private cloud (VPC) S3 Files NFS EFS EFSが裏側では動いており、 EFSがキャッシュとなりS3と中継している。 • 実質無制限容量のファイルストレージ • 縮退/拡張が自動 • 裏側はEFSなのでパフォーマンスも悪くない (はず) • S3 Filesに対しての読み書きにも課金発生 • 費用が見積りづらい
58 © DENTSU SOKEN INC. まとめ “hpc8a”はCAE解析に優れたインスタンスタイプ 今回ベンチマークを取った”hpc8a”は間違いなくCAE用途に優れたインスタンスタイプ。 “hpc8a”は日本リージョンで利用可能。 (キャパシティは要相談だと思いますが。。。)
HPC利用に便利なサービスをAWSは展開 • Turinが搭載されたHPC専用マシンを展開しているのはAWSのみ。 • 他クラウドとの直接接続サービスも展開開始。 • S3も直接??EC2にマウント可能に! ベンチマークにご協力いただいた皆様へ感謝申し上げます。 ベンチマークにお力添えいただきましたAWS 小川様、舛重様、関係者様。 ライセンスをご提供いただきましたAnsys様、Siemens様へこの場を借りて感謝申し上げます。
本文書 (添付資料を含む) は、 株式会社電通総研が著作権その他の権利を有する営業秘密 (含サプライヤー等第三者が権利を有するもの) です。 当社の許可なく複製し利用すること、また漏洩することは 「著作権法」 「不正競争防止法」 によって禁じられております。
本資料内の社名・製品名は各社の登録商標です。 CONFIDENTIAL