Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
SambaNova SN40L-16 における 日本語LLM「Sarashina」の推論ベンチマーク
Search
SambaNova
PRO
October 09, 2025
Technology
220
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
SambaNova SN40L-16 における 日本語LLM「Sarashina」の推論ベンチマーク
SambaNova
PRO
October 09, 2025
Other Decks in Technology
See All in Technology
internal/testlog で遊ぼう
rokuosan
0
230
Microsoft MVP プログラムを紹介するから目指す人増えてくれ
tsubakimoto_s
0
110
【書籍出版記念】 10周回って、エージェント開発は RAGがすべてだった。〜RAGの歴史と開発現場で見えた実践知〜
akiratameto
20
7.6k
ハッカソンで入賞した話 @ Findy LT
asari194617
0
1.5k
Digitization部 紹介資料
sansan33
PRO
2
7.7k
RelayerというPHPのフレームワークを作った
polidog
PRO
0
140
巨大気象データと戦う ― サロゲートモデル学習を高速化する圧縮技術
gpuunite_official
0
280
Android skills に学ぶ
kokiko
0
190
Eight Engineering Unit 紹介資料
sansan33
PRO
3
8.3k
マイナンバーカード本人確認の実装比較(OAuth/OIDC Numa (Immersion) Workshop 2026) / 20260825 numa-12
oidfj
PRO
0
280
tamachi.go 誕生の裏側
rymiyamoto
1
210
2027年のMetricKit
kantacky
0
180
Featured
See All Featured
Product Roadmaps are Hard
iamctodd
55
12k
Refactoring Trust on Your Teams (GOTO; Chicago 2020)
rmw
35
3.8k
More Than Pixels: Becoming A User Experience Designer
marktimemedia
3
500
Ethics towards AI in product and experience design
skipperchong
2
350
How to build an LLM SEO readiness audit: a practical framework
nmsamuel
1
870
Information Architects: The Missing Link in Design Systems
soysaucechin
1
1.1k
"I'm Feeling Lucky" - Building Great Search Experiences for Today's Users (#IAC19)
danielanewman
230
23k
Visualizing Your Data: Incorporating Mongo into Loggly Infrastructure
mongodb
49
10k
CoffeeScript is Beautiful & I Never Want to Write Plain JavaScript Again
sstephenson
162
16k
Documentation Writing (for coders)
carmenintech
77
5.5k
Distributed Sagas: A Protocol for Coordinating Microservices
caitiem20
333
23k
Stop Working from a Prison Cell
hatefulcrawdad
274
21k
Transcript
技術開発部 超並列計算基盤チーム 浅葉 祥吾 SambaNova SN40L-16 における 日本語LLM「Sarashina」の推論ベンチマーク 10/07 SambaCloud
Tokyo Mingle 4
2 ©︎ 2025 SB Intuitions Corp. 出資 (100%) ⚫ 日本語性能の高い大規模基盤モデルの研究開発
⚫ 日本の文化・商習慣にあった安心安全なAIサービスを提供 生成AIの開発経験のあるエンジニアがグループ各社から集結
ソフトバンク × AI 3 ©︎ 2025 SB Intuitions Corp. AI戦略を積極投資
LLMの内製開発への取り組み、ビジネス応用まで広くカバー AGI革命を加速する群戦略 最先端のAI計算基盤を世界 初導入 国産LLMの自社開発 国内最大級モデルの実現 生成AI時代における トランスフォーメーションを 支援 ソフトバンク Gen-AX SB Intuitions ソフトバンクグループ AGI革命を加速する群戦略 AIへの積極投資を実行 生成AIの社会実装 (SaaS/コンサル) 日本語に特化した 大規模言語モデルの構築 国内最大級の AI計算機版の整備 クリスタル・ インテリジェンス 連携 連携 連携
ソフトバンクと SambaNova の関係 4 ©︎ 2025 SB Intuitions Corp. •
https://sambanova.ai/ja/press/sambanova-expands-deployment-with-softbank-corp-fast-ai-inference-apac より
Sarashina 5 ©︎ 2025 SB Intuitions Corp. SB Intuitions株式会社が開発するAIモデルシリーズ 日本語データセットでゼロからトレーニングしているLLM
日本語の理解や生成において高い性能を発揮する。 言語特性への対応 文化・文脈への理解 規制・倫理への対応 『漢字・ひらがな・カタカナ共存』や 『敬語・方言のニュアンス』を学習し、 汎用モデルでは捉えられない 日本語の複雑さを自然に反映できる。 日本語の表現には、 文化的背景や暗黙の了解が (「忖度」「空気を読む」など)密接に関わる。 こうしたニュアンスをより正確に反映できる。 各国の法規制や倫理観は異なる。 日本語モデルを国内で開発することで、 日本の法律や社会的規範に沿った 運用が可能になる。 日本語で生成AIを作る意義
Speculative Decoding(SD) • 小型の Draft Model で Token を生成し、大型の Target
Model で一括検証して推論を高速化 • Acceptance Rate が高いほど検証済み Token が増え、スループットが向上 6 ©︎ 2025 SB Intuitions Corp. Autoregressive decoding Speculative Decoding Input tokens Once upon a time Output tokens , there was a + + + boy + Model(70B) Input tokens Once upon a time Draft tokens , there was a + + + girl + Draft Model(7B) Speculative Window(k)= 5 + + , there was a boy Verify tokens ✓ ✓ ✓ ✓ ✗ Target Model(70B) Accepts Tokens Bonus Tokens 𝐴𝑐𝑐𝑒𝑝𝑡𝑎𝑛𝑐𝑒 𝑅𝑎𝑡𝑒 = 𝐴𝑐𝑐𝑒𝑝𝑡𝑠 𝑇𝑜𝑘𝑒𝑛𝑠 𝐷𝑟𝑎𝑓𝑡 𝑇𝑜𝑘𝑒𝑛𝑠
ベンチマーク環境 • SambaNova SN40L-16 • 検証用として SambaNova SN40L-16 の専用ノードをご提供いただき、ベンチマークを実施しました •
GPU とは異なる Reconfigurable Dataflow Architecture を採用 • Three-tier Dataflow Memory 構成: • 8 GB On-Chip SRAM • 1 TB HBM3 • 24 TB DDR • Speculative Decoding:Target Model = Sarashina2 70B, Draft Model = Sarashina2 7B • NVIDIA DGX H100 • NVIDIA H100 Tensor Core GPU ×8基を搭載 • Memory 構成: • 約940.7 MB On-Chip Memory • 8 ×(33,792 KB(Register file)+ 33,792 KB (L1/Shared)+ 50 MB(L2)) • 640 GB HBM3 • 推論サーバは vLLM v0.8.5.post1 を使用 • Autoregressive decoding(wo/SD):Sarashina2 70B(v1 Engine) • Speculative Decoding(w/SD):Target Model = Sarashina2 70B, Draft Model = Sarashina2 7B(v0 Engine) • Speculative Window の設定: • Batch Size = 1 のとき 9 • Batch Size > 1 のとき 5 7 ©︎ 2025 SB Intuitions Corp.
ベンチマーク手法とサーバーサイドの Throughput 指標 vLLM Benchmark OpenAI API • vLLM Benchmark
を使用 • Endpoint: OpenAI API 互換の Create Completion(/v1/completions) • Dataset: random • Number of prompts: 1, 2, 4, 8, 16, 32, 64 • Input tokens: 128, 256, 512, 1024, 2048 • Output tokens: 128, 256, 512, 1024, 2048 • 除外: Input tokens = 2048 かつ Output tokens = 2048 • Throughput [tokens/s] 指標 • 定義 TTFT = Time to First Token, 𝑇𝑃𝑂𝑇 Time per Output Token = 𝐿𝑎𝑡𝑒𝑛𝑐𝑦 − 𝑇𝑇𝐹𝑇 𝑂𝑢𝑡𝑝𝑢𝑡 𝑇𝑜𝑘𝑒𝑛𝑠 − 1 𝐵𝑎𝑡𝑐ℎ 𝑆𝑖𝑧𝑒 𝑇ℎ𝑟𝑜𝑢𝑔ℎ𝑝𝑢𝑡 = 𝐵𝑎𝑡𝑐ℎ 𝑆𝑖𝑧𝑒 𝑀𝑒𝑑𝑖𝑎𝑛 𝑇𝑃𝑂𝑇 • 集計方法 • 各 Input tokens と 各Output tokens の組み合わせごとに測定し、最小値と最大値を除外した平均値を算出 • 測定条件と解釈 • SambaNova Cloud はインターネット経由のみでアクセスするため TTFT の影響が小さい Batch Size Throughput を採 用 • ユーザサイドの Output Throughput とは傾向が異なる点に注意 8 ©︎ 2025 SB Intuitions Corp.
結果 • SN40L-16 は、H100 w/SD より 2.3 ~ 3.0 倍高速
• SN40L-16 と H100 w/SD の Acceptance Rate は、0.95 以上と非常に高い 9 ©︎ 2025 SB Intuitions Corp. 0 1,000 2,000 3,000 4,000 5,000 6,000 1 2 4 8 16 32 64 Batch Size Throughput [tokens/s] Batch Size SN40L-16 H100 w/SD H100 wo/SD
まとめ • サーバサイドでの Throughput は、期待していた通りに良い値だった • きちんと Batch Size に応じてスケールしている
• 大きなメモリ容量が処理速度の向上に寄与している可能性が高い • Batch Size = 64 の条件下で、H100 w/SD は H100 wo/SD より Throughput が低い • SD では小規模な GEMM / Attention が多発し、 CUDA Graphs や fused kernels の効果が出にく いため、スループットが低下した可能性が高い • 今回のベンチマークに際し多大なご協力を賜りました SambaNova の皆さまに、心より御礼 申し上げます 10 ©︎ 2025 SB Intuitions Corp.
直感を、 知性へ
None