Slide 1

Slide 1 text

+"846(౦๺ AWS シリコン最前線 ~ AI 時代のチップ選択を読み解く ~ Annapurna Labs, Amazon Web Services 常世 ⼤史

Slide 2

Slide 2 text

名前︓常世 ⼤史 (とこよ ひろし) 所属︓Annapurna Labs (アンナプルナラボ) 職務︓アンナプルナラボ発信技術の拡販、技術⽀援 経歴︓グローバル半導体企業でのキャリアを経て、2013 年、 アンナプルナラボに参画。国内外チップ外販ビジネス の技術⽀援を主導 2015 年の Amazon による買収後は、Nitro カードの 開発⽀援などを経て、現在は Trainium/Inferentia に 関わる技術⽀援に従事 出⾝地︓仙台 名取 好きな 仙台メシ︓おり久の⾚みそラーメンとみそおにぎり ⾃⼰紹介

Slide 3

Slide 3 text

• AWS を⽀えるシリコンイノベーション • AI 時代のチップ選択 • AWS Trainium Deep Dive • クロージング & 質疑応答 本セッションの対象者 👥 AWS シリコン(半導体チップ)に興味をお持ちの⽅全て 🚀 半導体チップ初学者から Trainium 経験者まで楽しめる内容を⽬指します 本⽇のアジェンダ

Slide 4

Slide 4 text

4 • AWS を⽀えるシリコンイノベーション • AI 時代のチップ選択 • AWS Trainium Deep Dive • クロージング & 質疑応答

Slide 5

Slide 5 text

• 2011年に設⽴ - イスラエル発ファブレスチップ設計会社 • NAS (Network Attached Storage) やネットワーク機器に搭載 • 2015年から AWS の⼀員に Annapurna Labs とは

Slide 6

Slide 6 text

https://www.geekwire.com/2023/inside-the-ai-chip-race-how-a- pivotal-happy-hour-changed-amazons-strategy-in-the-cloud/ 2013年秋、シアトルのパイクプレイスマーケット にある歴史あるレストランで、AWS の James Hamilton⽒と Annapurna Labs 創業者の Nafea Bshara⽒が運命的な出会いを果たしました。その 直前、Hamilton⽒は AWS の独⾃チップ開発の必 要性について社内⽂書を作成していました。イン フラストラクチャの⾰新とコスト制御には、半導 体レベルでの開発が不可⽋との考えからです。 この出会いを経て、AWS は 2015年に Annapurna Labs を買収。サーバーチップ Nitro の開発を⽪切 りに、現在では AI 特化型チップ Trainium と Inferentia まで⼿掛け、クラウドインフラの技術 ⾰新を加速しています。

Slide 7

Slide 7 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS を⽀えるシリコンイノベーション INFERENTIA TRAINIUM TRAINIUM2 AWS Trainium / Inferentia • 機械学習向けアクセラレータ • 低コスト、⾼い電⼒効率、持続可能な AI 基盤を実現 2019 2025 TRAINIUM3 NITRO NITRO v2 NITRO v3 NITRO v4 NITRO v5 NITRO v6 AWS Nitro System • Amazon EC2 独⾃の仮想化基盤 • 共通処理を専⽤ハードウェアに オフロード 2013 2024 GRAVITON GRAVITON2 GRAVITON3 GRAVITON4 AWS Graviton • ARM コア搭載プロセッサ • クラウドネイティブなワークロードに最適化 2018 2025 GRAVITON5

Slide 8

Slide 8 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS を⽀えるシリコンイノベーション その1 re:Invent 2016 Amazon EC2 独⾃の仮想化基盤 ネットワークやストレージの仮 想化等を専⽤ハードウェアにオ フロードして、ホストと分離、 最適化されたパフォーマンスを 提供 DPU (Data Processing Unit) という⾔葉ができる前から AWSでは同様の技術を実⽤化 AWS Nitro System https://aws.amazon.com/jp/ec2/nitro/

Slide 9

Slide 9 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. • AWS による買収前から技術提供 - 多様なインスタンスタイプの提供 - 最⼤限のパフォーマンスを提供 - セキュリティの向上 AWS を⽀えるシリコンイノベーション その1 AWS Nitro System https://aws.amazon.com/jp/ec2/nitro/ 10GBPS NITRO 2013 25GBPS NITRO v2 2015 200GBPS NITRO v5 2022 400GBPS NITRO v6 2024 100GBPS NITRO v4 2020 100GBPS NITRO v3 2017

Slide 10

Slide 10 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS Nitro System 以前の仮想化基盤 Host system Customer instances Xen hypervisor Dom0 Management security and monitoring Local storage Amazon EBS storage Amazon VPC networking

Slide 11

Slide 11 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. Host system Customer instances Xen hypervisor Dom0 Management security and monitoring Local storage Amazon EBS storage Amazon VPC networking Host system Nitro Hypervisor Customer instances Nitro Card(s) PCI Express Management security and monitoring Local storage Amazon EBS storage Amazon VPC networking Nitro System 以後 Nitro System 以前

Slide 12

Slide 12 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. Host system Nitro Hypervisor Customer instances Nitro Card(s) PCI Express Management security and monitoring Local storage Amazon EBS storage Amazon VPC networking AWS Nitro System がもたらしたもの 多様なインスタンスタイプの提供 • 仮想化基盤がホストから独⽴することで様々 なインスタンスタイプの提供が容易に • ベアメタルタイプの提供も可能 最⼤限の性能を提供 • ベアメタルと同等性能の仮想化環境を実現 • SRD プロトコルによるネットワーク性能向上 • ストレージ性能の向上 セキュリティの向上 • 全ての通信は暗号化 • セキュアなブート環境を実現 • ホスト環境への管理アクセスを禁⽌

Slide 13

Slide 13 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. Scalable Reliable Datagram (SRD) によるスループット、レイテンシーの改善 EFA – Elastic Fabric Adapter • AWS が独⾃開発した 低遅延・⾼スループット のトランスポートプロトコル • 複数のネットワーク経路を活⽤するマルチパスルーティング • 独⾃の link/switch ダウン検出、輻輳制御による遅延・ジッターの低減 • 分散学習などでクラスタのスケーラビリティを向上 インスタンス EFA https://ieeexplore.ieee.org/document/9167399 インスタンス EFA

Slide 14

Slide 14 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS を⽀えるシリコンイノベーション その2 AWS Graviton https://aws.amazon.com/jp/ec2/graviton/ re:Invent 2018 re:Invent 2019 • A1 インスタンス(16 コア) • Arm エコシステムの発展に貢献 • サーバ Neoverse N1 コアを採⽤(64 コア) • ⽤途に応じた様々なインスタンスタイプを提供

Slide 15

Slide 15 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS を⽀えるシリコンイノベーション その2 Graviton 初代 Graviton プロセッサ 16 コア 16nm プロセス 50億トランジスタ Graviton2 Neoverse-N1 64 コア 7nm プロセス 300億トランジスタ Graviton3 Neoverse-V1 64 コア チップレットベース 550億トランジスタ Graviton5 Neoverse-V3 192 コア 3nm プロセス 1720億トランジスタ AWS Graviton Graviton4 Neoverse-V2 96 コア Dual Socket 対応 730億トランジスタ 2025 2018 2023 2021 2019 https://aws.amazon.com/jp/ec2/graviton/

Slide 16

Slide 16 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS を⽀えるシリコンイノベーション その2 Graviton3 Neoverse-V1 64 コア チップレットベース 550億トランジスタ AWS Graviton 2021 https://aws.amazon.com/jp/ec2/graviton/ Graviton5 Neoverse-V3 192 コア 3nm プロセス 1720億トランジスタ Graviton4 Neoverse-V2 96 コア Dual Socket 対応 730億トランジスタ 2025 2023 Graviton3 と⽐較して • 最⼤ 30% 性能向上 • 50% コア数増加 • 2倍の L2 キャッシュ容量 (コアあたり 2MB) • メモリ帯域幅が 75% 向上 Graviton2 と⽐較して • 最⼤ 25% 性能向上 • 2倍の浮動⼩数点演算性能 • DDR5 メモリ採⽤ • メモリ帯域幅が 50% 向上

Slide 17

Slide 17 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS を⽀えるシリコンイノベーション その2 AWS Graviton https://aws.amazon.com/jp/ec2/graviton/ Graviton5 Neoverse-V3 192 コア 3nm プロセス 1720億トランジスタ Graviton4 Neoverse-V2 96 コア Dual Socket 対応 730億トランジスタ 2025 2023 Graviton4 と⽐較して • 最⼤ 25% 性能向上 • 2倍のコア数 • シングルソケットで 192 コアを実現 • NUMA レイテンシを 33% 削減 • 5倍の L3 キャッシュ容量(192MB) Nitro Isolation Engine で数学的に証明された分離セキュリティ に対応 2026年6⽉10⽇、 M9g/M9gd インスタンスが ⼀般提供開始 詳細は… https://youtu.be/6eeZu3Kn-v0

Slide 18

Slide 18 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 柔軟な Graviton 搭載サーバ構成を実現 Graviton4 搭載サーバ構成 • Nitro Card による柔軟な構成が可能 - 独⽴した2つの仮想インスタンス - 1つのコヒーレントな仮想インスタンス - 独⽴した 2つのベアメタルインスタンス - 1つのコヒーレントなベアメタルインス タンス Graviton3 搭載サーバ構成 • チップ・パッケージ・マザーボード のデザインを最適化し、1 サーバあた り 3 ソケット構成が可能に • Nitro Card が 3 ソケット構成に対応

Slide 19

Slide 19 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. Graviton が実現する省エネルギー 同等処理で最⼤ 60% の消費電⼒削減

Slide 20

Slide 20 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. Amazon Prime Day での Graviton 活⽤ 2024年 • 5,800 以上の異なる Amazon.com サービスを⽀え るため、25万個以上の AWS Graviton チップを活⽤ 2023年 • Graviton インスタンスにより、2,600 以上のサー ビスを実現。その数は 2022年の 2.7倍に 2022年 • Graviton2 の採⽤拡⼤により効率性が向上。全体の サーバー規模は 2021年のサイバーマンデー⽐で 7%増加のみ 2021年 • 12の主要⼩売サービスにおいて、3 リージョンのク ラスターで 53,000 以上の Graviton2 ベースの C6g インスタンスを展開

Slide 21

Slide 21 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS を⽀えるシリコンイノベーション その3 https://aws.amazon.com/jp/machine-learning/inferentia/ https://aws.amazon.com/jp/machine-learning/trainium/ AWS Trainium / Inferentia 推論専⽤アクセラレータ としてリリース Amazon Alexa 等で活⽤ ⼤規模⾔語モデルの分散 学習、分散推論環境を低 価格で実現 Inferentia と⽐較し 5倍 のトランジスタ、HBM メモリ搭載 Trainium と⽐較して、 4倍の性能、3倍のメ モリ容量、2倍の電⼒ 効率を実現 初の 3nmプロセス採⽤ 1.5倍のメモリ容量、 1.7倍の帯域幅 MXFP8 および MXFP4 データタイプに対応 2025 2023 2021 2019 Inferentia Trainium Inferentia2 Trainium2 Trainium3

Slide 22

Slide 22 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS 独⾃の AI アクセラレータが Amazon の AI イノベーションを推進 AI ショッピングアシスタント Rufus Alexa 対話型 AI Amazon Search 検索エンジン

Slide 23

Slide 23 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. なぜ独⾃シリコンへの投資を続けているのか︖ AWS Graviton の実績 • 過去 3 年間で新規コンピューティングリソースの 50% 以上が Graviton 搭載 • 最⼤ 40% 優れた価格性能(同等の EC2 インスタンスと⽐較) • 最⼤ 60% の消費電⼒削減(同等の EC2 インスタンスと⽐較) • 性能、コスト、電⼒効率を最適化 • 仕様策定から導⼊までのスピード向上 • 市場のニーズに迅速かつ柔軟に対応 • さらなるイノベーションが可能に • 複数の選択肢を持つことで可⽤性を向上 https://youtu.be/YKRFVA6g9j0

Slide 24

Slide 24 text

24 • AWS を⽀えるシリコンイノベーション • AI 時代のチップ選択 • AWS Trainium Deep Dive • クロージング & 質疑応答

Slide 25

Slide 25 text

AI を実現するために求められるチップとは︖ • Transformers / CNN ↓ • 多量のニューラルネットワーク層 ↓ • ⾏列演算(matmul)+ 活性化関数 ↓ • 積和演算(MAC) いかに効率よく⾏列演算(積和演算)を実⾏できるか Transformers CNN ニューラルネットワーク

Slide 26

Slide 26 text

• 10〜100のプロセッシング コア • 事前定義された命令セット とデータパス幅 • 汎⽤コンピューティング向 けに最適化 CPU CPU、GPU、FPGA、ASIC の特徴 • 数千のプロセッシングコア • 事前定義された命令セット とデータパス幅 • 並列実⾏に効果的な設計 GPU • 数百万のプログラマブル デジタルロジックセル • 書換え可能なハードウェア • 事前定義された命令セット はなく、広帯域のデータパ スを実装可能 FPGA • 特定の⽤途/機能に最適化 されたカスタム設計 • APIを通じて公開される事 前定義されたソフトウェア エクスペリエンス ASIC Control ALU ALU Cache DRAM ALU ALU Control ALU ALU Cache DRAM ALU ALU Control ALU ALU Cache DRAM ALU ALU Control ALU ALU Cache DRAM ALU ALU DRAM DRAM DRAM

Slide 27

Slide 27 text

効率を⾼めるためには︖ CPU 複雑な演算 結果 GPU シンプルな演算 結果 結果 結果 結果 結果 演算効率、電⼒効率を⾼めるシストリックアレイ シストリックアレイ シンプルな演算 並列処理 局所通信 並列処理

Slide 28

Slide 28 text

効率を⾼めるためには︖ ASIC GPU CPU 効率 アプリケーション 演算効率、電⼒効率を⾼める専⽤エンジン群 Neuronコア GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine 汎⽤ SIMD エンジン カスタムオペレータに対応 オンチップメモリ 各エンジンに⾼速 データ転送 Tensor エンジン ⾏列演算に最適化 Scalar エンジン RELU 等の活性化関 数に最適化 Vector エンジン プーリング、正規化 処理に最適化

Slide 29

Slide 29 text

推論分離による⾼速化 コンピュート律速とメモリ帯域律速のボトルネックを解決 ※ 参考 Cerebras 社公開資料より https://www.aboutamazon.com/news/aws/aws-cerebras-ai-inference 1トークンごとに、メモリからモデルの 重みや KV キャッシュ読み出しが必要 ⼊⼒されたプロンプトの全 トークンを同時に並列処理

Slide 30

Slide 30 text

• Agentic AI では、LLM 推論 1 回に対し 5〜20 回の CPU 処理 が発⽣ • エージェント化が進むほど CPU の重要性は増す GPU だけでは動かない ─ Agentic AI の真実 ボトルネックは AI チップから CPU へ︖ チャットボット型 AI エージェント型 AI 動作パターン 聞かれたら答える (1問1答) ⾃律的に判断し動き続 ける 処理の流れ プロンプト → トークン ⽣成 → 応答 ⽬標分解 → 検索 → ツール実⾏ → 評価 → 次のステップ 主な計算 並列⾏列演算 逐次制御フロー (オーケストレーション、 ツール実⾏、メモリ管理) 数千万の Graviton コアを展開、Agentic AI の CPU 集約型ワークロードをスケール 今後 5年間で AWS 上の Graviton および AI インフラに60億ドルを投資 https://www.aboutamazon.com/news/aws/meta- aws-graviton-ai-partnership https://www.snowflake.com/ja/news/press- releases/snowflake-expands-aws-collaboration-with- 6b-commitment-to-accelerate-enterprise-agentic-ai- adoption/

Slide 31

Slide 31 text

32 • AWS を⽀えるシリコンイノベーション • AI 時代のチップ選択 • AWS Trainium Deep Dive • クロージング & 質疑応答

Slide 32

Slide 32 text

AWS Trainium 🤔 使ったことありますか 🤔

Slide 33

Slide 33 text

No content

Slide 34

Slide 34 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 世界最⼤規模の AI コンピュート クラスタ 2025年、100万個を超えるチップを導⼊ PROJECT RAINIER https://www.aboutamazon.com/news/aws/aws-project- rainier-ai-trainium-chips-compute-cluster

Slide 35

Slide 35 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 36 記録的なペースで Trainium2 を展開 3x AWS 生成 AI キャパシティ 4x より速いキャパシティの拡⼤ 時間 Amazon EC2 Trn2 これまでの AWS AI 向けインスタンス より多くのキャパシティ

Slide 36

Slide 36 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. Anthropic Sonnet 4.5 (reasoning) 37 Trn2 は Sonnet 4.5 で最も⾼い OTPS を提供 Trn2 は Sonnet 4.5 で 平均的に⾼い OTPS (出⼒トークン毎秒)を 実現 Based on Artificial Analysis public benchmarks 0 10 20 30 40 50 60 70 80 90 100 Vision / single image Medium / coding 100 input tokens 1k input tokens 10k input tokens 100k input tokens Sonnet 4.5 (reasoning) OTPS Other Hyperscaler Amazon

Slide 37

Slide 37 text

OpenAI to consume 2 gigawatts of Trainium capacity through AWS infrastructure https://www.aboutamazon.com/news/aws/amazon-open-ai-strategic-partnership-investment February 27, 2026

Slide 38

Slide 38 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS が⾃社開発した第 3 世代の⽣成 AI / ML アクセラレータ AWS Trainium2 2024 年⼀般提供開始 HBM 容量 HBM 帯域幅 Dense / Sparse compute Trn2 : Trainium2 搭載インスタンス • 最大 16 個の Trainium2 を搭載 (Trn2.48xlarge) • 同等のインスタンスと⽐較し 30%-40% ⾼いコスト性 能を実現 • 最⼤ 1.5 TB の⾼速 HBM3 メモリ搭載 • 3,200 Gbps のネットワーク帯域に対応 • Anthropic社 Claude モデルは Trainium2 上にデプロイ

Slide 39

Slide 39 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS Trainium2 https://aws.amazon.com/machine-learning/trainium/ HBM HBM NeuronLink-v3 DMA DMA DMA DMA DMA DMA DMA Collective Communication Host PCIe NeuronLink-v3 Trainium2 NeuronLink-v3 NeuronLink-v3 HBM HBM NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine Neuronコア v3 NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine Neuronコア v3 NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine Neuronコア v3 第 3 世代 Neuronコア v3 § 8 つの Neuronコア (4 つの 論理 Neuronコア) § インスタンスあたり 最⼤ 128 Neuronコア (64 論理 Neuronコア) § Sparsity 対応 (最⼤ 4 倍の FLOPS 値) 96 GB HBM メモリスタック § Trainium と⽐較し 3 倍の容量、4 倍の帯域幅 NeuronLink-v3 § より⾼帯域、低遅延なデバイス間接続 専⽤ Collective Compute エンジン § 分散学習、推論を⾏う際に、演算と集団通信を オーバーラップ

Slide 40

Slide 40 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS Trainium2 2D Torus トポロジー (trn2.48xlarge) Trainium2 NeuronLink-v3 § ⾼帯域、低遅延なデバイス間接続 HBM HBM NeuronLink-v3 DMA DMA DMA DMA DMA DMA DMA Collective Communication Host PCIe NeuronLink-v3 Trainium2 NeuronLink-v3 NeuronLink-v3 HBM HBM NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine NeuronCore-v3 GPSIMD Engine On-chip SRAM memory Tensor Engine Vector Engine Scalar Engine

Slide 41

Slide 41 text

Amazon EC2 Capacity Blocks for ML で提供中 • 必要なキャパシティを将来の⽇付で⼀定期間、低コストで確保するための 仕組み Trn2 インスタンスをお試し下さい 🚀 Trainium2 HBM3 EFA 帯域 CB 価格 対応リージョン Trn2.3xlarge 1 96 GB - $2.235 MEL (ap-southeast-4) GRU (sa-east-1) Trn2.48xlarge 16 1.5 TB 3,200 Gbps $35.76 CMH (us-east-2) ※ 2026 年 6 ⽉時点の価格 - 需要と供給の傾向に基づいて定期的に更新 https://aws.amazon.com/jp/ec2/capacityblocks/ 🔰 初期 PoC に最適 Spot にも対応 !

Slide 42

Slide 42 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS 次世代のエージェント型 AI、推論、 動画⽣成アプリケーションに最⾼の トークンエコノミクスを実現する 第 4 世代 AI チップ HBM3E Capacity HBM3E Bandwidth MXFP8 Compute 2025 年⼀般提供開始

Slide 43

Slide 43 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. MXFP8 COMPUTE HBM3E CAPACITY HBM3E BANDWIDTH NeuronSwitch Bandwidth Trn3 UltraServers 4.4 倍 の計算能⼒ | 3.9 倍 のメモリ帯域幅 (Trn2 UltraServers と⽐較)

Slide 44

Slide 44 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 4.4 倍 の計算能⼒ | 3.9 倍 のメモリ帯域幅 (Trn2 UltraServers と⽐較) NeuronSwitch • スイッチドファブリック(PCIe からUALink128/224 へ進化) • より⼤規模なスケールアップドメイン(最⼤ 144 チップ) • 2 TB/s の NeuronLink 帯域幅 • AllGather のレイテンシを最⼤ 6 倍削減 • AllReduce のレイテンシを最⼤ 2 倍削減 Trn3 UltraServers

Slide 45

Slide 45 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS のハードウェアイノベーション モジュール式で堅牢な設計 トップから交換可能 オートメーション対応

Slide 46

Slide 46 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS のハードウェアイノベーション Trainium3 モジュール式で堅牢な設計 トップから交換可能 オートメーション対応

Slide 47

Slide 47 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS のハードウェアイノベーション Nitro モジュール式で堅牢な設計 トップから交換可能 オートメーション対応

Slide 48

Slide 48 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. AWS のハードウェアイノベーション Graviton モジュール式で堅牢な設計 トップから交換可能 オートメーション対応

Slide 49

Slide 49 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved.

Slide 50

Slide 50 text

AWS Neuron (Trainium, Inferentia 向け SDK) 🤔 使い勝⼿ってどうなの 🤔 51

Slide 51

Slide 51 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 52 NxD (NeuronX Distributed) ライブラリ

Slide 52

Slide 52 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. カラクリ社での Trainium 活⽤事例 2023年 • 「AWS LLM 開発⽀援プログラム」を成功裏に完了した 15 社中 12 社が AWS Trainium を活⽤ • カラクリ社では、当時の Neuron SDK で未実装だった GQA (Grouped Query Attention) を独⾃実装し、 Llama2 70B をベースとしたモデルを開発 2024年 • Mixtral 8x7B MoE、Qwen2.5-VL にいち早く独⾃対応 しモデルを開発、Hugging Face Hub 上で公開中 2025年 • Trainium2 を活⽤し、次世代モデルを開発 Trainium を使⽤し続ける中で蓄積してきた ノウハウを「AWS Trainium 50本ノック」 という形で実践形式にまとめ、公開中 https://zenn.dev/karakuri_blog/articles/ 77d93c40b27b60

Slide 53

Slide 53 text

🚀さらに使いやすい環境を⽬指して 54

Slide 54

Slide 54 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. Native PyTorch • PrivateUse1 デバイスバックエンド 経由の統合 • オープンソース実装 • 簡単なデバイス切り替え 典型的な GPU 向け PyTorch コード デバイス名を neuron にアップデート TorchNeuron NEW !! Beta 版を提供中

Slide 55

Slide 55 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. torch.accelerator を使⽤するモダンなアプ ローチは、Neuron 上でそのまま動作可能 • PrivateUse1 デバイスバックエンド 経由の統合 • オープンソース実装 • 簡単なデバイス切り替え Native PyTorch TorchNeuron NEW !! Beta 版を提供中

Slide 56

Slide 56 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 分散処理 API(torch.distributed) • FSDP (Fully Sharded Data Parallel) • DTensor (Distributed Tensor) • DDP (Distributed Data Parallel) torch.compile • JIT コンパイルによる性能向上 TorchTitan • PyTorchの分散学習フレームワーク • ⼤規模モデルの学習に最適化 PyTorch 標準 API の ネイティブサポート Native PyTorch TorchNeuron NEW !! Beta 版を提供中

Slide 57

Slide 57 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 59 Qwen3 pre-training with TorchTitan

Slide 58

Slide 58 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. これまで Trainium/Neuron SDK 独⾃の NxD Inference ライブラリに依存していた vLLM 対応 を、よりネイティブ化し、依存を解消 新規モデルへの対応障壁を⼤幅に低減 ! vLLM のネイティブサポート Native vLLM vllm-neuron NEW !! Beta 版を提供中

Slide 59

Slide 59 text

⚙ Trainium での性能最適化⼿法は︖ 61 Anthropic のパフォーマンスエンジニア のお気に⼊り機能 😍 https://youtu.be/-k6yikkxQqI Claude On Three Accelerators @Modular GPU Kernel Hackathon

Slide 60

Slide 60 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. Neuron Kernel Interface (NKI) https://awsdocs-neuron.readthedocs-hosted.com/en/latest/general/nki/ • Python に組み込まれたドメイン 固有⾔語(eDSL) • タイルレベルプログラミングの 利便性 • AWS Trainium ハードウェア命令 セットへの直接アクセスによ り、最適化された AI カーネルの 記述が可能

Slide 61

Slide 61 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. Neuron Explorer • パフォーマンス最適化と デバッグのワークフロー 全体を⽀援するツール群 • Widgetベースのレイア ウトにより操作性と視認 性が向上 • Webアプリケーション、 またはVSCodeから利⽤ 可能

Slide 62

Slide 62 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 117µs から 76µs に短縮 アテンションブロックの実⾏時間が なし あり NKI による Flash Attention カーネル利⽤ NKI なし NKI あり 例)Qwen3-235B-A22B モデルのトークン⽣成部分を Nueron Explorer で精査 Neuron Explorer

Slide 63

Slide 63 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. NKI 開発を AI エージェントで加速する オープンソースツールキット • NKI カーネルの作成・デバッグ・ プロファイリングを⾃動化 • PyTorch / NumPy / ⾃然⾔語から NKI カーネルを⽣成 • コンパイルエラーの⾃律的な分析と修正 • Kiro / Claude Code にデプロイ可能 Agents neuron-nki-agent NKI 開発の全サイクルを統合管理 neuron-nki-writer-agent カーネル作成・修正の⾃動化 neuron-nki-debugger-agent コンパイルエラーの⾃律デバッグ neuron-nki-profile-analysis-agent プロファイル取得と性能分析 Skills neuron-nki-writing カーネル新規作成・編集 neuron-nki-debugging コンパイルエラーのデバッグ neuron-nki-profiling ハードウェア上の性能プロファイル neuron-nki-docs NKI ドキュメント検索・ API 参照 neuron-nki-profile-querying プロファイルデータの SQL 分析 https://github.com/aws-neuron/neuron-agentic-development Neuron Agentic Development NKI カーネル開発⽤のエージェントコーディング機能を提供

Slide 64

Slide 64 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. NKI 開発を AI エージェントで加速する オープンソースツールキット • NKI カーネルの作成・デバッグ・ プロファイリングを⾃動化 • PyTorch / NumPy / ⾃然⾔語から NKI カーネルを⽣成 • コンパイルエラーの⾃律的な分析と修正 • Kiro / Claude Code にデプロイ可能 Agents neuron-nki-agent NKI 開発の全サイクルを統合管理 neuron-nki-writer-agent カーネル作成・修正の⾃動化 neuron-nki-debugger-agent コンパイルエラーの⾃律デバッグ neuron-nki-profile-analysis-agent プロファイル取得と性能分析 Skills neuron-nki-writing カーネル新規作成・編集 neuron-nki-debugging コンパイルエラーのデバッグ neuron-nki-profiling ハードウェア上の性能プロファイル neuron-nki-docs NKI ドキュメント検索・ API 参照 neuron-nki-profile-querying プロファイルデータの SQL 分析 https://github.com/aws-neuron/neuron-agentic-development Neuron Agentic Development NKI カーネル開発⽤のエージェントコーディング機能を提供

Slide 65

Slide 65 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. NKI 開発を AI エージェントで加速する オープンソースツールキット • NKI カーネルの作成・デバッグ・ プロファイリングを⾃動化 • PyTorch / NumPy / ⾃然⾔語から NKI カーネルを⽣成 • コンパイルエラーの⾃律的な分析と修正 • Kiro / Claude Code にデプロイ可能 Neuron Agentic Development NKI カーネル開発⽤のエージェントコーディング機能を提供

Slide 66

Slide 66 text

69 • AWS を⽀えるシリコンイノベーション • AI 時代のチップ選択 • AWS Trainium Deep Dive • クロージング & 質疑応答

Slide 67

Slide 67 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 2011 2012 2014 2015 ENHANCED STRORAGE 2018 2019 2020 XEN 2010 2022 2023 2024 2013 ENHANCED NETWORKING 2016 2017 AWS NITRO SYSTEM 2021 NITRO SSD イノベーションのスピードは加速 NITRO 10Gbps NITROv2 25Gbps NITROv4 100Gbps NITROv3 100Gbps NITROv5 200Gbps Graviton Graviton2 Graviton3 Inferentia Inferentia2 Trainium 2025 インスタンスタイプの数 1000+ NITROv6 400Gbps Graviton4 Trainium2 Trainium3 Graviton5

Slide 68

Slide 68 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 独⾃半導体開発への投資は継続 re:Invent 2025 Keynote

Slide 69

Slide 69 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. Neuron Community https://aws.amazon.com/jp/blogs/news/neuron-community-day-one/ https://aws.amazon.com/jp/blogs/news/neuron-community-vol-2/ https://discord.gg/DUx4g3Z3pq コミュニティへの参加 はこちらから

Slide 70

Slide 70 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 73 まとめ - AWS シリコン最前線 AWS を⽀えるシリコンイノベーション • AWS Nitro System による仮想化基盤の⾰新 • AWS Graviton によるコストパフォーマンスと電⼒効率の実現 • AWS Trainium / Inferentia による AI 基盤の新しい選択肢 今⽇からできること • Spot インスタンスで提供されている trn2.3xlarge で PoC を始めてみて下さい • Neuron Community にもぜひご参加頂き、知⾒を共有しながら⼀緒に AWS のシ リコンイノベーションを活⽤していきましょう AWS はシリコンイノベーションを通じて、クラウド コンピューティングの可能性を無限に広げていきます

Slide 71

Slide 71 text

© 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 【AWS re:Invent 2025 速報】AWS ⾃社設計 AIチップ AWS Trainium3 の全貌 h9ps://zenn.dev/aws_japan/arCcles/06808526d5c75f

Slide 72

Slide 72 text

ご視聴ありがとうございました