Upgrade to Pro — share decks privately, control downloads, hide ads and more …

ローカルLLM、実際どこまで使えるか

Sponsored · SiteGround - Reliable hosting with speed, security, and support you can count on.

 ローカルLLM、実際どこまで使えるか

2026/07/26 に開催されたAI社会実装勉強会第61回 (https://machine-learning-workshop.connpass.com/event/401208/) の発表資料です。

More Decks by 西岡 賢一郎 (Kenichiro Nishioka)

Other Decks in Technology

Transcript

  1. ② 結局、使えるの? 実測 何を測るかで、答えが変わる 罠の6類型 罠 具体例:ブラウザ操作をどう測るか ① ローカルのHTMLを自前サーバで配信(決定論・オフライン・実サイト 測るもの

    捏造 無い情報を「無い」と言えるか 転記 蒸留かコピペか 漏洩 ログ中の秘密を出さないか 偽緊急度 絶叫する些末案件か、静かなデータ損失か 無条件受諾 スコープを守れるか 実行芝居 やっていないのに「やった」と言わないか を触らない) ② 正解は推測できないコード(実際に見に行かないと通らない) ③ デコイを置く(間違ったリンクを踏んだら不合格) ④ 難易度の梯子:読む→選ぶ→3ページ集計 ルーティングの決定則:正確性では決まらない (1) 即答が要る → クラウド (2) 夜間バッチにできる → ローカル (3) 罠で落ちた軸の業務は、そのモデ (4) 品質差は判定役を立てて測ってか ルに任せない ら
  2. ② 結局、使えるの? 実測 その答えは、 1か月で書き換わった 2026年6月 2026年7月 コーディングは qwen3-coder 一択

    ※6月の結論が誤りだったのではない。前提が変わった 私見 1か月 → ornith参戦。9Bで7/10、35bに肉薄
  3. ② 結局、使えるの? 実測 ただし、評判はドメインを跨がない 同じ ornith-35b でも 9/9 コーディングは全勝 1/3

    業務browserでは失敗 金額誤読・会社名を捏造 ※各9タスク/3タスクの小規模比較。"業務全般がダメ"という意味ではない
  4. ③ みんなどう使ってる? 実測 うちでは毎日、裏で動き続けている 38 tok/s うちの環境で、ある密モデル(gemma4:31b-mlx)比 約9倍(MoE / qwen3.6:35b-a3b)

    常駐要約はクラウドだとトークン代が青天井。だからローカル 注意 MoEは速い。ただしメモリは重み分が丸ごと要る(実測 21GB台)
  5. ④ で、どうすれば? 持ち帰ってほしいのは、測り方と配線 結論は毎月腐る。腐らないのは仕組み ① ② ③ 余ってる Mac/PCにOllama "機密×非同期"の1タスク(まず要

    自動化したいなら、モデル任せに 約)から せず工程を固定して配線する クラウドも自分で判定できる:kimi-k2.7-codeはHaiku価格帯で44タスク全勝 (N=1留保)
  6. 教科書と、実際に測った結果 公式ドキュメント 補足 公式 設定 既定 効果 OLLAMA_FLASH_ATTENTION=1 版により自動 KV量子化の前提。無効だと黙って無視されると報告

    (※公式FAQには記載なし・開発repoの issue) OLLAMA_KV_CACHE_TYPE=q8_0 f16 KVが約半分と報告(※公式の数字ではなく第三者実測) 。q4_0は劣化が大きく非推奨 OLLAMA_NUM_PARALLEL 1 必要RAM = num_parallel × コンテキスト長 OLLAMA_CONTEXT_LENGTH 4096 KVは長さに比例。エージェント用途は64kが下限 OLLAMA_MAX_LOADED_MODELS 3(GPU数×3) 数の制限ではない。メモリが空けば複数載る OLLAMA_KEEP_ALIVE 5分 常駐させたいモデルは長く うちで測ったら 実測 事前の想定 実測の結果( 2026-07-20) Ollamaは1モデルずつしか載らない 誤り。32GB機で2本の同時ロードに成功 64GB機なら35B+9Bは同居する しなかった 。後から来たモデルが前を追い出した コンテキスト長がメモリを支配する エンジン次第 。llama.cpp系は比例(6,528→26,112 MiB)、MLX系は8k〜128kで21.14GB 固定 q8_0を入れれば半減する 対象モデルはMLXランナーで効いていない可能性 出典:Ollama公式FAQ/Apple Siliconでの実測/自宅2台での実機測定(2026-07-20)
  7. 新しいモデルを本番に上げる判定ルール 補足 区分 対象 ルール A 絶対条件 ガードレール(機密漏れ・逸脱) 前は通っていた項目が落ちたら NO-GO

    。安全性の後退は昇格不可 B 非退行 既存の中核業務(起草・接地・ブラウザ・多段 ツール) 前がPASSなら今回もPASS C ツール規律 偽のツール呼び出し・ループ 0件・上限内 D 非機能 レイテンシ・トークン・コスト 許容レンジ内 E 品質 判定役による起草品質 非退行以上(引き分け可) GO条件=A全合格 かつ B・C非退行 かつ D許容内 かつ E非退行以上 判定の粒度=合計点の増減でなく「前は通っていたものが落ちたか」を最優先