Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Neuron Community 2026 Vol.1 - AWS Summit Digest...

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
Avatar for Ryota Sawa Ryota Sawa PRO
July 26, 2026
0

Neuron Community 2026 Vol.1 - AWS Summit Digest - AWS Trainium の全貌.pdf

2026/07/15 開催の Neuron Community – 2026 Vol.1 にてご説明した資料です。

Neuron Community は、ユーザー間で AWS Trainium / AWS Inferentia エコシステムに関する情報や知見の共有を促進するための場として発足したコミュニティです。今回は AWS Summit Japan 2026 の振り返りや、AWS Neuron のアップデート情報を中心にお話ししました。

イベントレポート(AWS ブログ): https://aws.amazon.com/jp/blogs/news/neuron-community-2026-vol-1/

Avatar for Ryota Sawa

Ryota Sawa PRO

July 26, 2026

Transcript

  1. Neuron Community 2026 Vol.1 2026/07/15 AWS Summit Japan 振り返り セッションダイジェスト

    "AI エージェントの推論から⼤規模学習まで" コスト効率と性能が両⽴する AI インフラ ̶ AWS Trainium の全貌 澤 亮太 アマゾン ウェブサービス ジャパン合同会社
  2. ⾃⼰紹介 澤 亮太 アマゾンウェブサービスジャパン合同会社 技術統括本部 エンタープライズ技術本部 ⾃動⾞・製造グループ ⻄⽇本ソリューション部 ソリューションアーキテクト ・主に製造業のお客様を担当

    ・前職では、主に Computer Vision 領域での Deep Learning を⽤いたアルゴリズム開発、 AI⼈材の育成などを推進 © 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved.
  3. 計算機リソースに満⾜できていますか︖ 調達リードタイム 学習・推論コスト 運⽤負荷 申し込みから数ヶ⽉待ち 学習 1 回で数百万円 インフラの運⽤監視 クラウドでも簡単に

    GPU を確保できない⽇が続く API 課⾦も積み上がる ハードウェアの メンテナンスや⽼朽化 ⽣成 AI の学習・推論コスト、 GPU の確保などに 頭を悩ませた経験はありませんか︖ © 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved.
  4. よくある Trainium の使い⽅ あなたはどれが当てはまりますか︖ コードはそのままで 学習コストは下げたい パフォーマンスを 最⼤限引き出したい 推論コストを 固定にしたい

    ⼤規模モデルを 分散学習したい カーネルレベルで 最適化したい “簡単に” Trainium 上へ モデルをデプロイしたい Native PyTorch Neuron Kernel Interface (NKI) + Neuron Explorer vLLM on Trainium © 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved.
  5. コードはそのままで学習コストは下げたい 典型的な GPU 向け PyTorch コード TorchNeuron Native PyTorch [

    Beta ] • 既存 GPU コードをそのまま動かせる • PrivateUse1 デバイスバックエンド 経由の統合 • オープンソース実装 • 簡単なデバイス切り替え © 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. デバイス名を neuron にアップデート
  6. 性能を最適化したい Neuron Kernel Interface (NKI) • Python ベースのプログラミングイン ターフェース •

    PyTorch、JAX で利⽤可能な最適化済 みのオープンソースカーネル • AWS Trainium ハードウェア 命令セットへの直接アクセスにより、 最適化された AI カーネルの記述が可能 © 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved.
  7. Neuron Explorer でボトルネックを⾒つけ、 NKI で速くする Qwen3-235B-A22B モデルのトークン⽣成部分を Nueron Explorer で精査

    アノテーション機能を⽤いて 対象区間を計測 アテンションブロックの 実⾏が 117μs と判明 NKI による Flash Attention カーネルの利⽤を決断 © 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved.
  8. Neuron Explorer でボトルネックを⾒つけ、 NKI で速くする なし NKI による Flash Attention

    カーネル利⽤ Qwen3-235B-A22B / 2 番⽬のアテンションブロックの実⾏時間が © 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. NKI なし あり NKI あり 117µs から 76µs に短縮
  9. 性能を最適化したい Neuron Agentic Development NKI 開発を AI エージェントで加速する オープンソースツールキット •

    NKI カーネルの作成・デバッグ・ プロファイリングを⾃動化 Agents neuron-nki-agent NKI 開発の全サイクルを統合管理 neuron-nki-writer-agent カーネル作成・修正の⾃動化 neuron-nki-debugger-agent コンパイルエラーの⾃律デバッグ neuron-nki-profile-analysis-agent プロファイル取得と性能分析 Skills neuron-nki-writing カーネル新規作成・編集 PyTorch / NumPy / ⾃然⾔語から NKI カーネルを⽣成 neuron-nki-debugging コンパイルエラーのデバッグ neuron-nki-profiling ハードウェア上の性能プロファイル • コンパイルエラーの⾃律的な分析と修正 neuron-nki-docs NKI ドキュメント検索・ API 参照 • Kiro / Claude Code にデプロイ可能 neuron-nki-profile-querying プロファイルデータの SQL 分析 • https://github.com/aws-neuron/neuron-agentic-development © 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. https://aws.amazon.com/blogs/machine-learning/stop-hand-tuning-kernels-how-neuron-agenticdevelopment-accelerates-aws-trainium-optimizations/
  10. 再 よくある Trainium の使い⽅ あなたはどれが当てはまりますか︖ コードはそのままで 学習コストは下げたい パフォーマンスを 最⼤限引き出したい 推論コストを

    固定にしたい ⼤規模モデルを 分散学習したい カーネルレベルで 最適化したい “簡単に” Trainium 上へ モデルをデプロイしたい Native PyTorch Neuron Kernel Interface (NKI) + Neuron Explorer vLLM on Trainium © 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved. 掲
  11. まずは Trn2 インスタンスをお試し下さい︕ Amazon EC2 にて Capacity Blocks for ML

    または Spot Intances で提供中 インスタンス タイプ スペック Trainium2 HBM3 EFA 帯域 Trn2.3xlarge 1 96 GB - Trn2.48xlarge 16 1.5 TB 3,200 Gbps 対応リージョン 🔰 初期 PoC に最適 Spot にも対応 ! 料⾦ / 時間 Capacity Blocks Spot MEL (ap-southeast-4) $2.235 $1.3649 GRU (sa-east-1) $2.235 $0.9026 CMH (us-east-2) $35.76 $8.5964 ※ 2026 年 6 ⽉ 26 ⽇時点の価格 - 需要と供給の傾向に基づいて定期的に更新 Capacity Blocks for ML ‥ 必要なキャパシティを将来の⽇付で⼀定期間、低コストで確保するための仕組み Spot Intances ‥予備の EC2 キャパシティを活⽤し、中断の可能性はあるがオンデマンド⽐最⼤ 90% 割引で利⽤可能。 © 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved.
  12. まとめ GPU が必要なワークロードは増え続けている • AWS は独⾃のシリコンを設計・製造している • AWS Trainium は

    AI 基盤の新しい選択肢に Trainium は、さまざまなシーンで使える • Native PyTorch で既存 GPU コードをそのまま実⾏できる • vLLM on Trainium で推論コストを固定に など まずは Spot Intances で提供中の trn2.3xlarge から PoC を始めてみて下さい︕ © 2026, Amazon Web Services, Inc. or its affiliates. All rights reserved.