Upgrade to Pro — share decks privately, control downloads, hide ads and more …

完全ローカル完結のLT文字起し、要約システム

Avatar for numa08 numa08
August 28, 2026
41

 完全ローカル完結のLT文字起し、要約システム

Avatar for numa08

numa08

August 28, 2026

Transcript

  1. 作ったもの:全部ローカルで動く記録システム マイク VAD ASR LLM 表示 音を拾う 喋った区間だけ切り出す 日本語を文字にする 要約を育てる

    その場で出す 話者分離はしない。誰の発表かは「打刻」だけで決める 騒がしい居酒屋でのダイアライゼーションは失敗する。ボタン 1 つとマイクを手で動かすことで回避した
  2. Whisper 、使いませんでした Parakeet TDT-CTC 0.6B 日本語専用 RTF 0.01 〜 0.03

    2026 年、日本語 ASR は Whisper 一強では ない 先週 (8/18) の 11 モデル比較でも、新しいほど強いという 結果にはならなかった 5 秒の発話を 0.1 秒で処理する ReazonSpeech v2.0 Whisper は無音や雑音を食うと、存在しない文を作る 3.5 万時間の日本語で学習 MLX 変換済み Apple Silicon でそのまま動く そもそも今回は精度より速度が効く
  3. Ollama でも llama.cpp でもなく、 mlx-lm mlx-lm Apple Silicon 専用のフレームワーク 統合メモリをそのまま使う

    CPU と GPU で重みをコピーしない プロセス内に常駐できる サーバを別に立てたくなかった Ollama も llama.cpp も、別プロセスのサーバ越しになる。 ASR との実行順を自分で握れない モデルのロードは 1 回きりにしたい。 gemma-2-2b でも 51.6 秒かかる Python の変数としてモデルを持てる ASR と同じ土俵 mlx-audio と実行系を揃えられる 区間ごとに CLI を叩く構成にした時点で、この設計は成立し ない
  4. 要約モデルは、実測で選んだ モデル サイズ ロード tok/s 判定 gemma-2-2b-jpn-it 1.4GB 51.6s 19.3

    採用 Qwen2.5-3B-Instruct 1.6GB 54.5s 16.8 見送り gemma-3-4b-it 3.2GB 110.4s 12.8 却下 4B が 2B に負けた。 M1 の 68GB/s では、大きいモデルほど遅く、重く、ロードも長い
  5. 1 台の M1 に、 3 つのモデルが同居している Silero VAD Parakeet ASR

    gemma-2-2b 1.8MB 1.2GB 1.4GB CPU / 常時 GPU / 発話ごと GPU / 10 発話ごと ASR と LLM は同じ Metal GPU を奪い合う。並列化せず、逐次実行する 生音声だけは専用スレッドで書き続ける。推論がどれだけ遅れても、録音は止まらない そして、この発表もいま記録されています