Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
AWS Inferentiaに入門して 徳得を積む
Search
mu7889yoon / Yuta Nakamura
July 08, 2025
Programming
210
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
AWS Inferentiaに入門して 徳得を積む
mu7889yoon / Yuta Nakamura
July 08, 2025
More Decks by mu7889yoon / Yuta Nakamura
See All by mu7889yoon / Yuta Nakamura
JSONataとAWS Step Functionsで目指すRuntimelessな世界
mu7889yoon
1
720
Terraform標準の組織で AWS CDKをどう使うか
mu7889yoon
1
680
AWS CodeArtifact だいぶディープ
mu7889yoon
0
86
本当の”仕事”を手放せる未来が見えた
mu7889yoon
0
370
今だから言える(?) Q Developer Pro のクレジットが神ってた話
mu7889yoon
0
170
API Gateway→Lambda→AgentCore を再考する
mu7889yoon
0
60
MCPで決済に楽にする
mu7889yoon
1
270
Lambdaを使い倒す
mu7889yoon
0
150
~Everything as Codeを諦めない~ 後からCDK
mu7889yoon
3
1.6k
Other Decks in Programming
See All in Programming
半永久的に提供し続けられるプライベートクラウドを目指して ― 利用者の認知負荷を抑えるAPI抽象化とハードウェア世代交代の基盤設計
tomokon
0
440
マイコン向けの軽量Ruby「PicoRuby」で各種デバイスを制御するネイティブアプリの実現手法
bash0c7
0
470
Findy - エンジニア向け会社紹介/Findy Company Deck
findyinc
6
400k
Vue Fes Japan 2026 タイムテーブル徹底解説
448jp
1
620
残高管理から台帳サービスへの進化
artoy
0
140
When benchmarks go bad - what I learned from measuring performance wrong
hollycummins
0
130
カツオ、ご期待ください
suneo3476
0
140
re:Inventに行く前に知っておきたい現地参加のノウハウ
nokomoro3
0
360
20260914 AIエージェント時代のPlatform Engineering LLM基盤とプロダクトの責務境界線
kanfab1
7
2.4k
Simple Storage Service(S3) is not simple
iwatsukayura
0
190
ハーネス設計入門 〜 基礎知識の整理から実務へのステップアップ 〜
kinopeee
20
21k
Heart of Swift Concurrency
koher
0
1.2k
Featured
See All Featured
<Decoding/> the Language of Devs - We Love SEO 2024
nikkihalliwell
1
340
Are puppies a ranking factor?
jonoalderson
2
4k
Faster Mobile Websites
deanohume
310
32k
The AI Search Optimization Roadmap by Aleyda Solis
aleyda
2
6.3k
Odyssey Design
rkendrick25
PRO
2
860
Fashionably flexible responsive web design (full day workshop)
malarkey
409
67k
Building a Scalable Design System with Sketch
lauravandoore
464
34k
Ecommerce SEO: The Keys for Success Now & Beyond - #SERPConf2024
aleyda
1
2.2k
The Power of CSS Pseudo Elements
geoffreycrofte
82
6.6k
Heart Work Chapter 1 - Part 1
lfama
PRO
10
36k
HDC tutorial
michielstock
2
940
The Cost Of JavaScript in 2023
addyosmani
55
10k
Transcript
JAWS-UG京都 AWS Summit Japan 2025 re:Cap LT大会 AWS Inferentiaに入門して 徳得を積む
中村 勇太 / mu7889yoon
経歴 2024年3月 大阪電気通信大学 卒業 2024年4月 株式会社シーズ 入社 2025年6月 Japan AWS
Jr. Champions 2025 好きなAWSサービス AWS Step Functions / Amazon Lightsail 中村 勇太 / mu7889yoon 2
AWS Inferentia is… - 低コストで高性能な推論を実現するために、AWSが独自開発したチップ - ざっくり言うとAWSが用意した機械学習モデルの推論の最適解 https://aws.amazon.com/jp/ai/machine-learning/inferentia/
(前までの) AWS Inferentia のイメージ - LLMモデルのアーキテクチャによって制限ありそう - LLMモデルのコンパイル大変そう https://pages.awscloud.com/summit-japan-2025-aws-expo-booth.html#aws-builders-fair
(Builders’ Fair訪問後の) AWS Inferentia のイメージ - LLMモデルのアーキテクチャによって制限ありそう → LlamaForCausalLM、MistralForCausalLMに対応 -
LLMモデルのコンパイル大変そう。 → 非MLエンジニアでもコンパイルできる仕組みを用意している。 → フレームワークによってはより簡単にコンパイル可能
EC2 Infでの推論を試す 1. インスタンス起動 2. vLLM + Neuron の Docker
ビルド → 約10分 3. モデルのダウンロード → 約2分(モデル次第) 4. モデルのコンパイル → 約10分(同上) 5. 🎊 Coding Time 🎉 https://aws.amazon.com/jp/blogs/machine-learning/serving-llms-using-vllm-and-amazon-ec2-instances-with -aws-ai-chips/
EC2 Infでの推論を試す 1. インスタンス起動 2. vLLM + Neuron の Docker
ビルド → 約10分 3. モデルのダウンロード → 約2分(モデル次第) 4. モデルのコンパイル → 約10分(同上) 5. 🎊 Coding Time 🎉 - EC2 Infインスタンス利用 1🉐ポイント https://aws.amazon.com/jp/blogs/machine-learning/serving-llms-using-vllm-and-amazon-ec2-instances-with -aws-ai-chips/
EC2 Infでの推論を試す 1. インスタンス起動 2. vLLM + Neuron の Docker
ビルド → 約10分 3. モデルのダウンロード → 約2分(モデル次第) 4. モデルのコンパイル → 約10分(同上) 5. 🎊 Coding Time 🎉 - EC2 Infインスタンス利用 1🉐ポイント https://aws.amazon.com/jp/blogs/machine-learning/serving-llms-using-vllm-and-amazon-ec2-instances-with -aws-ai-chips/ ここから🉐ポイントの香りがする
得得構成
得得構成 1. インスタンス起動 2. 🎊 Coding Time 🎉 - EC2
Infインスタンス利用 - us-east-1利用 - スポットインスタンス利用 - AMI利用によるDockerビルドのスキップ - AMI利用によるモデルのダウンロード・コンパイルのスキップ 🎊🎊🎊 5🉐ポイント 🎊🎊🎊
まとめ - Builders’ Fair 1を聞いたら 10が返ってくるような濃密な時間が過ごせる - Llama / Mistral
アーキテクチャの推論は、 EC2 Infインスタンスの利用が最適 - Qwenに対応すればよりHAPPY - 量子化モデルの使用は力およばず未検証 → さらに🉐になる可能性 - 専用の推論サーバーを持つ 嬉しさ - 小さいモデルにプログラム書かせるのも楽しい - ホームユースにも夢が広がる
参考ページなど AI チップ - Amazon Inferentia - AWS https://aws.amazon.com/jp/ai/machine-learning/inferentia/ Serving
LLMs using vLLM and Amazon EC2 instances with AWS AI chips https://aws.amazon.com/jp/blogs/machine-learning/serving-llms-using-vllm-and-am azon-ec2-instances-with-aws-ai-chips/ Neuron Community - Vol.2 (7/15 ハイブリット開催) https://aws.amazon.com/startups/events/neuron-community-02 Neuron Calculator — AWS Neuron Documentation (便利) https://awsdocs-neuron.readthedocs-hosted.com/en/latest/general/calculator/neuro n-calculator.html
ありがとうございました 「もっと🉐積めるよ!」があれば懇親会でお話ししましょう!
付録 : 初めの構成 VS 得得構成 共通条件 EC2 Inf2.8xlarge EBS 300
GB Out 100 GB / 月