Upgrade to Pro — share decks privately, control downloads, hide ads and more …

自分で立ててみるLLMサービス

 自分で立ててみるLLMサービス

2026/10/5 さくらの夕べ 地域コミュニティナイト - 小江戸らぐ & LOCAL編 -

Avatar for 世良泰明

世良泰明

October 05, 2026

More Decks by 世良泰明

Other Decks in Technology

Transcript

  1. 自己紹介 名前: 世良泰明(せら やすあき) 職業: インフラエンジニア(?) k8sを使って開発するお仕事 某製造業@横浜 社会人6年目 参加コミュニティ:

    - 小江戸らぐ - クラウドネイティブ界隈など twitter: @y_sera15 自宅K8sクラスター Intel NUC 3台 + Synology NAS
  2. 質問 みなさん、AI使ってますか? - Chat GPT - Google Gemini - Github

    Copilot - Claude Code - jev - dots などなど...
  3. 質問 みなさん、AI使ってますか? - Chat GPT - Google Gemini - Github

    Copilot - Claude Code - jev - dots などなど... これらはあくまで「サービス」なので、エンジニアなら中の仕組みは知っておきたい
  4. AIサービスの仕組み AIサービス PC AIチャット インターネット LLMモデル 周辺サービス AIコーディング 推論エンジン HW(GPU等

    ) チャットログ管理 インターネット検索 webUI などなど 本来のAIの仕組みと、サービスがやってくれていることの境目が分からなくなりがち → ローカルLLMなら自分で組み立てられる
  5. 推論エンジン LLMを動かすソフトウェア PC やっていること AIチャット - 推論処理 - キャッシュ管理 -

    API提供(OpenAI互換) インターネット 代表的なOSS AIコーディング - vLLM - サーバー向け - 並列処理が可能 - (まともに動かすなら)GPU必須 AIサービス LLMモデル 周辺サービス 推論エンジン HW(GPU等 ) チャットログ管理 インターネット検索 webUI などなど - llama.cpp - 小規模環境向け - CPUだけでも動く - 入門はOllamaかLLM Stdio越し - その他最近話題のもの(一部モデルのみ対応) - Strata: 一般PC向け - Tensorfold: DGX SparkとMacに特化 モデルを動かすにはそれなりの計算リソースが必要 → 特に、GPUのメモリ(VRAMが鍵)
  6. LLMモデル AIの本体 PC 実体はただの数値パラメータの集まり - オープンなモデル: Huggingfaceで公開 AIチャット - パラメータ数:

    数十億(1B)~数千億(100B) インターネット - (※↑一般人が手に届く範囲ではの話) - (ざっくり)1B ≒ 1GBのメモリ/VRAM必要 AIサービス LLMモデル 周辺サービス - 提供形態: - safetensor: vLLM(等)向け AIコーディング - gguf: llama.cpp系向け 推論エンジン 代表的なモデル - Gemma4 シリーズ(2B~31B) HW(GPU等 ) - 2026/4にGoogleがリリース - 複数のサイズが提供されている - 日本語がしっかりしてる - Qwen3.x シリーズ - アリババが提供 - 最新の3.8は2026/8にリリース - コーディングが得意 チャットログ管理 インターネット検索 webUI などなど モデルを動かすにはそれなりの計算リソースが必要 → 特に、GPUのメモリ(VRAMが鍵)
  7. 我が家の参考例 VSCode + Cline(拡張機能) Qwen3.8 27B NVFP4 - vLLMのAPIエンドポイントを指定 PC

    - チャットで指示してローカルでコード生成 - AIサービス LLMモデル AIコーディング 自宅NW vLLM - 推論エンジン HW(GPU等) → そんなあなたにちょうど良いサービスが... コンテナで稼働させている HWに合わせてNvidia GPU用 のものを選択 APIエンドポイントが 立ち上がる DGX Spark - 128GBユニファイドメモリ - そんなリッチな環境無いから私には無理かも...? 2026/8に出たモデル コーディング目的で使用 有効桁を落とした(量子化した) モデルを使用 → サイズ/処理速度に影響 (GPUに100GB程割当て可能) CPU: arm64 GPU: Nvidia blackwell
  8. さくらの高火力DOK リッチなGPUを積んだコンテナが使い放題(従量課金) H100プランの場合 - 料金: 1000円/1h - スペック: VRAM80GB, メモリ192GB

    - 初めての人は3000円分のクレジット付き ※ 一部界隈でV100が流行っているようですが, V100は古いGPUのため生成AI向きでは無いので 今回は見なかったことにします (さくらのサービスとしてもV100プランは2027年に廃止予定)
  9. 使い方 1. さくらインターネットに登録・サインイン 2. hugging faceのアカウント・認証トークン作成 3. Dockerhubでアクセストークンの作成 4. 高火力DOKでコンテナ起動

    5. ローカルからアクセス 今回は、 - モデル: unsloth/Qwen3.8-27B-NVFP4 - 推論エンジン: vLLM - 活用方法: AIコーディング(VSCode + Cline) で実施する流れを紹介
  10. アクセストークンの作成(Hugging Face) Hugging Face 1. アカウントを作成 2. アカウント設定画面の Access Tokens

    -> Create new tokenをクリック 3. Token Type: Readとして作成 4. トークンを控える
  11. アクセストークンの作成 DockerHub 1. アカウントを作成 2. アカウント設定画面の Personal Access Tokens ->

    Generate new tokenをクリック 3. Token Type: Readとして作成 4. トークンを控える
  12. コンテナのデプロイ タスクの画面から、コンテナをデプロイ イメージ: vllm/vllm-openai:v0.31.0-ubuntu2404 HTTPポート: 8000 起動直後のログ レジストリ認証情報: <先程登録したDockerhubのもの> プラン:

    H100(80GB) 最大時間: 1h 環境変数: - HF_TOKEN: <HuggingFaceのトークン> - コマンド(以下改行消して入力): unsloth/Qwen3.8-27B-NVFP4 --enable-auto-tool-choice --tool-call-parser=qwen3_coder --reasoning-parser=qwen3 --max-model-len=262144 --speculative-config='{"method": "mtp", "num_speculative_tokens": 3}' --enable-prefix-caching --trust-remote-code --max-num-seqs=8 起動直後にモデルのダウンロード& vLLMは最初にVRAMへモデルを展開するため起動に時間がかかる
  13. まとめ AIサービスの仕組みを知るべく、モデルを自分でデプロイする流れを紹介 AIサービス PC AIチャット インターネット LLMモデル 周辺サービス AIコーディング 推論エンジン

    HW(GPU等 ) チャットログ管理 インターネット検索 webUI などなど LLMモデルや推論エンジン、コーディングツールをいろいろ差し替えてみたりすると楽しいです