Upgrade to Pro — share decks privately, control downloads, hide ads and more …

20260930_Gemma4_Hands-on

Avatar for tsho tsho
September 30, 2026

 20260930_Gemma4_Hands-on

Avatar for tsho

tsho

September 30, 2026

More Decks by tsho

Other Decks in Technology

Transcript

  1. tsho / 田中 翔 (Sho Tanaka) - Lead Developer Advocate

    @ Snowflake - ex-Google gTech Ads, ML/Data MLOps community 運営 Google Developer Expert, AI/ML. TPU Builder OSS conf 登壇 (AI/ML/Data) (一部予定) - Devoox, SciPy Conf, PyCon Gr, TW, Apache Code over Community etc Linkedin.com/in/tsho
  2. ローカル LLM の定義比較 用語 重みの公開 学習データ・コード 商用利用・用途制限 原則公開 データ情報・完全な学 習

    / 推論コード等が 必要 原則として任意目的 で利用可能(ライセン ス条件あり) Open Weight Model 公開 非公開または一部公 開が多い モデルごとに異なる。 商用利用や用途制限 があり得る Open Data 付き Open Weight Model 原則公開 学習データは公開、 ソースは非公開 Open Source Model モデルによる 一部引用: ローカルLLMでどこまでコードが書けるか -LLM基礎知識
  3. まとめ:ローカル LLM のメリット  コスト管理  セキュリティ 減価償却 vs 従量課金

    /定額 ・学習データに使われない 設備投資による計画的な減価償却と、 従量課金リスクの回避・コスト予測可 能性の向上。 フロンティアモデルも flagをoffにすれ ば使われない....認識.... ・情報が外にでない オンプレミス/ローカル環境内で機密 データの処理が完全に完結。 Source: xxxxx
  4. ローカル LLMのサービング 高スループット・プロダクション型 ローカル・デスクトップ手軽実行型 サーバー運用・複数APIリクエストの高速処理向け PCローカル環境・手軽な動作確認・UI操作向け ▪ vLLM ▪ llama.cpp

    ・PagedAttention技術によりKVキャッシュを効率化 ・高い連続バッチ処理能力と圧倒的な推論速度 ・大規模プロダクション環境の標準的選択肢 ▪ SGLang ・複雑なLLMプログラム・プロンプトの高速実行 ・RadixAttentionによる複数呼び出し間のキャッシュ共 有 ・構造化出力 (JSON等) やエージェント処理に最適化 Source: Local LLM Serving Tools Comparison Source: xxxxx ・C/C++による軽量実装。GGUF量子化モデルを CPU/GPUで高速実行 ▪ Ollama ・llama.cppを内蔵し、CLIでDocker感覚でモデルを簡単 管理・REST API提供 ▪ LM Studio ・GUI付きデスクトップアプリ。検索・DL・チャット・ローカル サーバー化が完結
  5. Gemma4 4 モデルサイズ E2B, E4B, 26B, 31B 256K トークン 最大コンテキスト長

    📱 Edge Models (E2B / E4B) Apache 2.0 商用利用可能なオープンライセンス Gemini 3 と共通の研究・技術を基盤に開発 💻 Workstation Models (26B / 31B) • オンデバイス最適化: スマホやIoT機器で効率的な実行に 最適化 • 高い推論性能: ローカル環境で高度な推論能力を発揮 • 効率的アーキテクチャ: MoE (26B A4B) & Dense (31B) • マルチモーダル: テキスト、画像、音声入力に対応。出力 はテキスト • 高度な理解力: 画像・動画理解とコード生成:可変解像度 の画像と動画フレームに対応 • 新技術: PLEによるパラメータ効率化と、 KVキャッシュ共有 によるメモリ削減 • コンテキスト: 256Kトークン対応 • コンテキスト: 128Kトークン対応 🚀 主要機能と拡張機能 🧠 思考モード (Thinking) 🛠 エージェント & ツール利用 🌐 多言語 & コーディング 回答前に段階的な推論を行い、複雑な問題に対応 Native Function Callingサポートで自律型エージェ ントの構築に対応 140以上の言語で事前学習。コード生成・修正に対応 し、コーディング性能も向上