SambaNova SN40L-16 における 日本語LLM「Sarashina」の推論ベンチマーク

Avatar for SambaNova SambaNova PRO
October 09, 2025

SambaNova SN40L-16 における 日本語LLM「Sarashina」の推論ベンチマーク

Avatar for SambaNova

SambaNova PRO

October 09, 2025

Other Decks in Technology

Transcript

  1. 2 ©︎ 2025 SB Intuitions Corp. 出資 (100%) ⚫ 日本語性能の高い大規模基盤モデルの研究開発

    ⚫ 日本の文化・商習慣にあった安心安全なAIサービスを提供 生成AIの開発経験のあるエンジニアがグループ各社から集結
  2. ソフトバンク × AI 3 ©︎ 2025 SB Intuitions Corp. AI戦略を積極投資

    LLMの内製開発への取り組み、ビジネス応用まで広くカバー AGI革命を加速する群戦略 最先端のAI計算基盤を世界 初導入 国産LLMの自社開発 国内最大級モデルの実現 生成AI時代における トランスフォーメーションを 支援 ソフトバンク Gen-AX SB Intuitions ソフトバンクグループ AGI革命を加速する群戦略 AIへの積極投資を実行 生成AIの社会実装 (SaaS/コンサル) 日本語に特化した 大規模言語モデルの構築 国内最大級の AI計算機版の整備 クリスタル・ インテリジェンス 連携 連携 連携
  3. ソフトバンクと SambaNova の関係 4 ©︎ 2025 SB Intuitions Corp. •

    https://sambanova.ai/ja/press/sambanova-expands-deployment-with-softbank-corp-fast-ai-inference-apac より
  4. Sarashina 5 ©︎ 2025 SB Intuitions Corp. SB Intuitions株式会社が開発するAIモデルシリーズ 日本語データセットでゼロからトレーニングしているLLM

    日本語の理解や生成において高い性能を発揮する。 言語特性への対応 文化・文脈への理解 規制・倫理への対応 『漢字・ひらがな・カタカナ共存』や 『敬語・方言のニュアンス』を学習し、 汎用モデルでは捉えられない 日本語の複雑さを自然に反映できる。 日本語の表現には、 文化的背景や暗黙の了解が (「忖度」「空気を読む」など)密接に関わる。 こうしたニュアンスをより正確に反映できる。 各国の法規制や倫理観は異なる。 日本語モデルを国内で開発することで、 日本の法律や社会的規範に沿った 運用が可能になる。 日本語で生成AIを作る意義
  5. Speculative Decoding(SD) • 小型の Draft Model で Token を生成し、大型の Target

    Model で一括検証して推論を高速化 • Acceptance Rate が高いほど検証済み Token が増え、スループットが向上 6 ©︎ 2025 SB Intuitions Corp. Autoregressive decoding Speculative Decoding Input tokens Once upon a time Output tokens , there was a + + + boy + Model(70B) Input tokens Once upon a time Draft tokens , there was a + + + girl + Draft Model(7B) Speculative Window(k)= 5 + + , there was a boy Verify tokens ✓ ✓ ✓ ✓ ✗ Target Model(70B) Accepts Tokens Bonus Tokens 𝐴𝑐𝑐𝑒𝑝𝑡𝑎𝑛𝑐𝑒 𝑅𝑎𝑡𝑒 = 𝐴𝑐𝑐𝑒𝑝𝑡𝑠 𝑇𝑜𝑘𝑒𝑛𝑠 𝐷𝑟𝑎𝑓𝑡 𝑇𝑜𝑘𝑒𝑛𝑠
  6. ベンチマーク環境 • SambaNova SN40L-16 • 検証用として SambaNova SN40L-16 の専用ノードをご提供いただき、ベンチマークを実施しました •

    GPU とは異なる Reconfigurable Dataflow Architecture を採用 • Three-tier Dataflow Memory 構成: • 8 GB On-Chip SRAM • 1 TB HBM3 • 24 TB DDR • Speculative Decoding:Target Model = Sarashina2 70B, Draft Model = Sarashina2 7B • NVIDIA DGX H100 • NVIDIA H100 Tensor Core GPU ×8基を搭載 • Memory 構成: • 約940.7 MB On-Chip Memory • 8 ×(33,792 KB(Register file)+ 33,792 KB (L1/Shared)+ 50 MB(L2)) • 640 GB HBM3 • 推論サーバは vLLM v0.8.5.post1 を使用 • Autoregressive decoding(wo/SD):Sarashina2 70B(v1 Engine) • Speculative Decoding(w/SD):Target Model = Sarashina2 70B, Draft Model = Sarashina2 7B(v0 Engine) • Speculative Window の設定: • Batch Size = 1 のとき 9 • Batch Size > 1 のとき 5 7 ©︎ 2025 SB Intuitions Corp.
  7. ベンチマーク手法とサーバーサイドの Throughput 指標 vLLM Benchmark OpenAI API • vLLM Benchmark

    を使用 • Endpoint: OpenAI API 互換の Create Completion(/v1/completions) • Dataset: random • Number of prompts: 1, 2, 4, 8, 16, 32, 64 • Input tokens: 128, 256, 512, 1024, 2048 • Output tokens: 128, 256, 512, 1024, 2048 • 除外: Input tokens = 2048 かつ Output tokens = 2048 • Throughput [tokens/s] 指標 • 定義 TTFT = Time to First Token, 𝑇𝑃𝑂𝑇 Time per Output Token = 𝐿𝑎𝑡𝑒𝑛𝑐𝑦 − 𝑇𝑇𝐹𝑇 𝑂𝑢𝑡𝑝𝑢𝑡 𝑇𝑜𝑘𝑒𝑛𝑠 − 1 𝐵𝑎𝑡𝑐ℎ 𝑆𝑖𝑧𝑒 𝑇ℎ𝑟𝑜𝑢𝑔ℎ𝑝𝑢𝑡 = 𝐵𝑎𝑡𝑐ℎ 𝑆𝑖𝑧𝑒 𝑀𝑒𝑑𝑖𝑎𝑛 𝑇𝑃𝑂𝑇 • 集計方法 • 各 Input tokens と 各Output tokens の組み合わせごとに測定し、最小値と最大値を除外した平均値を算出 • 測定条件と解釈 • SambaNova Cloud はインターネット経由のみでアクセスするため TTFT の影響が小さい Batch Size Throughput を採 用 • ユーザサイドの Output Throughput とは傾向が異なる点に注意 8 ©︎ 2025 SB Intuitions Corp.
  8. 結果 • SN40L-16 は、H100 w/SD より 2.3 ~ 3.0 倍高速

    • SN40L-16 と H100 w/SD の Acceptance Rate は、0.95 以上と非常に高い 9 ©︎ 2025 SB Intuitions Corp. 0 1,000 2,000 3,000 4,000 5,000 6,000 1 2 4 8 16 32 64 Batch Size Throughput [tokens/s] Batch Size SN40L-16 H100 w/SD H100 wo/SD
  9. まとめ • サーバサイドでの Throughput は、期待していた通りに良い値だった • きちんと Batch Size に応じてスケールしている

    • 大きなメモリ容量が処理速度の向上に寄与している可能性が高い • Batch Size = 64 の条件下で、H100 w/SD は H100 wo/SD より Throughput が低い • SD では小規模な GEMM / Attention が多発し、 CUDA Graphs や fused kernels の効果が出にく いため、スループットが低下した可能性が高い • 今回のベンチマークに際し多大なご協力を賜りました SambaNova の皆さまに、心より御礼 申し上げます 10 ©︎ 2025 SB Intuitions Corp.