Upgrade to Pro — share decks privately, control downloads, hide ads and more …

今話題のAI「Jev」って何? 宇宙最速で学ぶ会

Avatar for みのるん みのるん PRO
September 17, 2026

今話題のAI「Jev」って何? 宇宙最速で学ぶ会

今話題のAI「Jev」って何? 宇宙最速で学ぶ会 - connpass
https://minorun365.connpass.com/event/407308/

Avatar for みのるん

みのるん PRO

September 17, 2026

More Decks by みのるん

Other Decks in Technology

Transcript

  1. 欲しいのは文章ではなく「判断」だけ、という場面 請求の話 → 経理へ 問い合わせが届いた 「請求が⼆重です」 if(判断) どの話? 不具合の話 →

    開発へ それ以外 → 営業へ Claude Code が打つコマンド、危ない?(はい/いいえ) 届いた問い合わせの担当は?(請求・技術・営業) でも LLM に聞くと、毎回ていねいな文章が返ってくる 4
  2. 何が嬉しいの? 発表ブログの比較表から 学習のさせ方 返ってくるもの 生成のしかた 速さ 料金 自信 これまでの LLM

    人の好みに合わせる(RLHF) 文字列。パースが要る 1トークンずつ順番に 3〜329秒 入力 $0.2〜10、出力は約5倍 聞いても過大 Jev 較正された判断(RLCD) 型の決まった値と確率 1回の呼び出しで同時に 0.07〜0.5秒 入力 $0.042、出力 $0 常に確信度を返す 14
  3. LLMは、1トークンずつ順番に書いている 1つ書くごとに、モデル全体を1回動かす 問い合わせ⽂ +「JSONで答えて」 { "dep art ment ": …

    全部書き終わるまで待ってから、JSON にパースして検証 数秒〜数分。型が崩れる・余計な文が混ざる、も起こりうる 17
  4. 全部の答えが、確率つきで同時に返ってくる! state(状況) 問い合わせ⽂ questions(質問) 3つまとめて Jev 1回の呼び出し 担当は 技術 0.93

    怒り 0.98/2 確信度 0.87 ⾄急は yes 0.88 出力トークンは無料。答えは必ず、選択肢の中に収まります 19
  5. 似たものとの違い やり方 中身 Jev との違い Structured Output JSON の形に縛る 生成は生成。速さもほぼ同じ

    専用の分類モデル 自前で学習させる データと運用が要る Jev 言葉で聞き、確率で答える 学習なし。並列。確信度つき 21
  6. 質問の型は、3つだけ! 型 聞き方 返るもの Choice 請求・技術・営業、どの部署の話? 選んだ1つと、全選択肢の確率 Score 怒りの度合いは、3段階のどこ? 0〜2

    の位置と、各段階の確率 Noul この問い合わせは至急? yes の確率 0〜1 3種類を1回の呼び出しに、まとめて混ぜられます 22
  7. 問い合わせ1件に、質問を1つ投げる const result = await evaluate({ model: 'typesafe-ai/jev', state: 'Stripe連携が3日前から失敗しています。至急です。',

    questions: { department: { type: 'choice', instructions: '担当する部署は?', criteria: { billing: '請求', technical: '不具合', sales: '契約', }, }, }, }); 24
  8. 返ってきたのがこれ { } "department": { "type": "choice", "choice": "technical", "probabilities":

    { "billing": 0.07, "technical": 0.93, "sales": 0.00 } } 文章はゼロ。答えと、選択肢ごとの確率だけ 質問を3つに増やしても、往復は 中央値 0.35 秒 25
  9. Slack のメッセージも、領収書も、同じ形 状況(state) 「明日15時の定例、 30分ずらせますか?」 スタバ 1,290円 メモ「顧客と打ち合わせ」 DB の削除保護を

    false にする diff 聞いたこと 意図は? 返信は要る? 科目は? 私的利用の疑いは? 危険度は? 人のレビューは要る? 返ってきた答え 日程調整(1.00) 要る(0.91) 会議費(1.00) 疑い薄い(0.23) 高(1.8/2) 要る(0.83) 26
  10. 確信度で、自動・確認・人へ、の3段階に分ける const dept = result.answers.department; const conf = result.providerMetadata.typesafe.confidence.department; if

    (conf < 0.5) { routeToHuman(ticket); } else if (conf > 0.9) { assignTo(dept.choice); } else { askUserToConfirm(dept.choice); } // 迷っている。人へ回す // 自信あり。自動で割り当て // その間。本人に確認 しきい値は「間違えたときの取り返しのつかなさ」で変える 「分からない」と言えるので、コード側で安全に分岐できる 29
  11. 同じ質問、JevとLLMで何秒? 0.35 秒 1.34 秒 Jev Claude Haiku 4.5 10回の中央値

    10回の中央値 同じ問い合わせ・同じ3問・同じ Gateway、東京から計測 30
  12. 発表から3日で、世界で作られたもの① browser-use ブラウザ操作エージェント。 操作と操作先を Jev が選び、 Google Flights の検索が 7.1

    秒 jevmeter 動画の「はぐらかし」メーター。 字幕1文ごとに5問を投げ、 討論1本 5,955 判定で 5セント 35
  13. ② コード変更の危険度チェック コミット前の diff を Jev に見せる 「本番データを失う? メッセージは正確? 人のレビュー要?」

    実測では DB の削除保護を外す変更に、危険度 1.8/2、 人のレビュー 0.83。こういう変更だけ止める 39