Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
FSx for Lustreを使ったAIモデル開発の始め方
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
Morita
March 15, 2025
130
0
Share
FSx for Lustreを使ったAIモデル開発の始め方
JAWS-UG福岡 #20: Storage-JAWS共催スペシャル
Morita
March 15, 2025
More Decks by Morita
See All by Morita
AWSでの Difyのアーキテクチャを考えてみた
ch6noota
0
13
Amazon Bedrock における モデルカスタマイズについて考えてみた
ch6noota
0
11
Reinforcement Fine-tuning 基礎〜実践まで
ch6noota
0
390
Dify で AWS を使い倒す!
ch6noota
1
1.1k
DeepSeek for Amazon Bedrock
ch6noota
0
100
5分で学ぶ! 宣言型ポリシーの基礎からベストプラクティスまで
ch6noota
1
670
新機能 Bedrock Model Distillation 基礎〜実践まで #regrowth_fuk
ch6noota
0
760
AWS を使った生成AIの活用
ch6noota
0
920
AWS初めての方必見!初学者でも入りやすいAWSサービス3選 #devio2022
ch6noota
0
1.5k
Featured
See All Featured
Noah Learner - AI + Me: how we built a GSC Bulk Export data pipeline
techseoconnect
PRO
0
190
We Have a Design System, Now What?
morganepeng
55
8.1k
Optimizing for Happiness
mojombo
378
71k
Ten Tips & Tricks for a 🌱 transition
stuffmc
0
120
Making Projects Easy
brettharned
120
6.6k
Game over? The fight for quality and originality in the time of robots
wayneb77
1
180
Designing Dashboards & Data Visualisations in Web Apps
destraynor
231
55k
Become a Pro
speakerdeck
PRO
31
5.9k
From Legacy to Launchpad: Building Startup-Ready Communities
dugsong
0
210
Marketing Yourself as an Engineer | Alaka | Gurzu
gurzu
0
200
Reflections from 52 weeks, 52 projects
jeffersonlam
356
21k
Information Architects: The Missing Link in Design Systems
soysaucechin
0
940
Transcript
JAWS-UG福岡 #20 Storage-JAWS共催スペシャル 森⽥⼒ FSx for Lustreを使ったAIモデル開発の 始め⽅
⾃⼰紹介 2 • 名前 ◦ 森⽥ ⼒ • 所属 ◦
クラスメソッド株式会社 ▪ 福岡オフィス所属 ◦ クラウド事業本部 コンサルティング部 • 好きなAWSサービス ◦ AWS Lambda ◦ Amazon Bedrock
⽬次 3 • AIモデル開発で必要となるファイルシステムの要件 • そもそもLustreとは • Amazon FSx for
Lustre とは • AIモデル開発で利⽤するには
AIモデル開発で必要となるファイルシステムの要件
AIモデル開発に必要なもの 5 AIモデル開発では何が必要か • ⾼性能コンピューティング(GPU/TPU) • ⼤規模データセット⽤の⾼速ファイルシステム • 効率的なデータパイプライン •
スケーラブルなストレージソリューション • 並列処理能⼒
AIモデル開発に必要なもの 6 AIモデル開発では何が必要か • ⾼性能コンピューティング(GPU/TPU) • ⼤規模データセット⽤の⾼速ファイルシステム • 効率的なデータパイプライン •
スケーラブルなストレージソリューション • 並列処理能⼒
ファイルシステムの課題 7 AIモデル開発におけるストレージの課題 • ⼤量のデータ(TB〜PB規模)の⾼速アクセス • 並列読み取り/書き込みのパフォーマンス • トレーニング中のI/Oボトルネック •
データセットの効率的な管理
そもそもLustreとは
Lustreとは 9 Lustreの特徴 • オープンソースの分散ファイルシステム • ⼤規模クラスターコンピューティング向けに設計 • ⾼スループット、低レイテンシー •
HPC(⾼性能コンピューティング)環境で広く採⽤ • 並列I/O処理に最適化
FSx for Lustre とは 10 • AWSが提供するフルマネージドLustreファイルシステム • インフラ管理不要 ◦
セットアップ, パッチ適⽤などマネージド管理 • S3との統合 • 数百GBpsのスループット、数百万IOPSを実現 ◦ ⼤規模な分散学習に耐えれる • オンデマンドでスケーリング可能 • 従量課⾦ ◦ 秒単位(ストレージサイズ, スループット)
S3からシームレスにデータをRead/Write 11 • S3バケットにデータセットを格納 • S3バケットがファイルシステムに同期される ◦ 低レイテンシ、⾼スループット • 学習済みモデルなどのアーティファクトをS3に保存する
AIモデル開発で利⽤するには
AIモデル開発で利⽤するには 13 SageMaker HyperPod で利⽤する • 容易さ ◦ 設定ファイル内で定義するだけで⾃動接続 ◦
分散学習向けに最適化された構成が提供される • パフォーマンス ◦ EFAとの最適化された統合 ◦ SageMaker分散ライブラリとの連携 • 管理 ◦ FSx for Lustreの設定もライフサイクルスクリプトに含められる ◦ モデルチェックポイント管理などマネージドなS3との統合
設定ファイルの変更 14 https://github.com/aws-samples/awsome-distributed-training/tree/mai n/1.architectures/5.sagemaker-hyperpod
AIモデル開発で利⽤するには 15 SageMaker HyperPod recipes • re:Invent 2024で発表 • ML必要なリソースの⾃動セットアップ
◦ トレーニングデータセットのロード ◦ 分散トレーニング ◦ 障害復旧の⾃動化
SageMaker HyperPod recipes 16 DeepSeek-R1をFine-Tuningしてみたのでよければご参考ください!
まとめ
まとめ 18 • FSx for Lustreでは ⾼速‧⼤容量ファイルシステムをAWS上でフルマネージド提供 ◦ AIモデル開発⽤途に良い •
S3との統合で⼤規模データセットを低レイテンシ‧⾼スループットで処 理可能 • SageMaker HyperPodとの連携で分散学習環境を容易に構築でき、AIモ デル開発のデータ処理ボトルネックを解消 ◦ 特に、SageMaker HyperPod recipes がおすすめ
None