Upgrade to Pro — share decks privately, control downloads, hide ads and more …

小型ローカルAIで日本語の音声会話botを作った話

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.

 小型ローカルAIで日本語の音声会話botを作った話

LiquidAI社が日本語特化のモデルを発表していたので、それを使って日本語の会話ボットを作ってみた。

Avatar for wancoimo

wancoimo

July 26, 2026

More Decks by wancoimo

Other Decks in Programming

Transcript

  1. LIQUID AI / VOICE BOT 02 Liquid AI:会社概要と日本語対応の経緯 会社概要 本社

    設立 日本拠点 米国マサチューセッツ州 ケンブリッジ 2023年 日本法人:Liquid AI株式会社 (公式は日付非公開) CTCが2024年に出資を発表 特色 データセンターの外で動く基盤モデル 低遅延・プライバシー・実機ハードウェアの制約を前提に、端末上で動くLFMを開発 日本語対応の経緯 2024.10 2025.07 2026.01 CTCと協業 LFM2 LFM2.5-JP 日本語LLMの共同開発・ 多言語対応の重点言語に 日本語アプリ向けモデルを公開 技術検証を発表 日本語を含める (文化・言語ニュアンスを重視)
  2. LIQUID AI / VOICE BOT 03 今回試した2つの日本語モデル TEXT LLM AUDIO

    LLM LFM2.5-1.2B-JP-202606 LFM2.5-Audio-1.5B-JP 日本語に特化した 音声認識と音声合成を扱う 1.2Bパラメータのチャットモデル 1.5Bパラメータの音声モデル 会話・応答生成 ASR / TTS
  3. LIQUID AI / VOICE BOT 04 Audioモデルは、軽量で応答が速い 試用した印象 ASR Whisper

    small程度の認識精度と感じた TTS 女性音声は1種類だが、自然に聞こえる 実行感 小型モデルでメモリ使用量が少なく、応答が速い ※ ASR精度・応答速度は、発表者の実装環境における主観評価 音声入力をテキスト化 テキストを音声化 ローカル実行に向く
  4. LIQUID AI / VOICE BOT 05 一体型ではなく、4段パイプラインにした VADで発話区間を切り出すため、分離しても実装量は大きく増えない VAD ASR

    LLM TTS 発話区間を検出 Audio-1.5B-JP 1.2B-JP-202606 Audio-1.5B-JP 分離した理由 • VADの処理が必要 • ツール制御をLLM側で実装したい • モデルごとの挙動を個別に調整できる
  5. LIQUID AI / VOICE BOT 06 会話botとしては、LLM側の制御に課題が残った LFM2.5-1.2B-JP-202606 追加した機能 自由会話は自然

    顔認証 利用者を識別して会話を開始 役割・出力形式・ツール実行条件を含む 会話bot用プロンプトでは、意図した制御を 毎回同じように得るには調整が必要だった ※ 課題は発表者のプロンプト・実装条件での観察 擬似フルデュプレックス 音声再生中も次の入力を受ける
  6. LIQUID AI / VOICE BOT まとめ:Audioは有望、JP LLMは用途を選ぶ 今回わかったこと 01 LFM2.5-Audio-1.5B-JP

    ASR・TTSともに実用的。小型でローカル会話botに使いやすい 02 LFM2.5-1.2B-JP-202606 自然な日本語会話はできるが、bot制御にはプロンプト検証が必要 03 次の展開 LFM2.5-VLを使い、カメラ画像も入力できる会話botへ 08