Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Agentic Software Factoryに、すごく賢いIF文を。 / super sm...

Avatar for r-kagaya r-kagaya
October 04, 2026

Agentic Software Factoryに、すごく賢いIF文を。 / super smart IF statement into the Agentic Software Factory.

「Jev使ってみてどうだった? ~試してわかった活用のヒント~」の登壇資料です!
https://findy.connpass.com/event/407342/

Avatar for r-kagaya

r-kagaya

October 04, 2026

More Decks by r-kagaya

Other Decks in Programming

Transcript

  1. 使ってみてどうだった? ~試してわかった活用のヒント~ Jev に、 Agentic Software Factory IF すごく賢い 文を。

    規約を確かめ、知識を選び、PRのリスクを判定する。 株式会社 r.kagaya Asterminds
  2. 自己紹介 ( ) r.kagaya @ry0_kaga (アスターマインズ)株式会社 共同創業者・CTO Asterminds 年にログラスへ入社。 経営管理SaaSの開発、開発生産性の改善に従事。

    生成AI/LLMチームを立ち上げ、 新規AIプロダクトの立ち上げを担当。 2025年8月に独立、現職。 2022 『AIエンジニアリング』の翻訳を担当 オライリージャパンより出版
  3. の公開から半月で、使い方も選択肢も広がった Jev 9/15 9/16 9/20 9/25 9/29 10/1 が を公開

    判断用モデルを早期アクセスで提供 Vercelが対応、OpenJevのリポジトリが作成 OpenJev(現SemIf)は、オープンモデルを使う独立実装 LangChainが、Jevによる評価の実験を公開 保存したエージェントの実行結果を、Jevで採点 LangChainが、Jev+LangGraphの実装例を公開 文書を分類し、次の処理や人への確認へ振り分ける OpenAIがDecisions APIを発表 画像も入力可能。発表時点では限定プレビュー CloudflareがClef / Clef-flashを公開 TypeSafe Jev 互換の判断モデルを、オープンソースで提供 Jev API 年〜 月 2026 9 10
  4. の概要をおさらい Jev 文章やコードを分類・採点し、判定や評価を返す。 コードや文章に質問を添え、確率・候補の選択・評価値で答えを受け取る。 何を聞くか 答えの形式 返ってくるもの 当てはまるか の確率 yes

    この変更は規約に反する? Noul 続ける/変える/人に相談 Choice 選択した候補 この知識は作業に関係する? Score 評価値 どれを選ぶか どれくらいか 速く・安く、小さな判断を何度も呼び出せる。 〜 の値 0 1 確率分布・確信度も返す 確率分布・確信度も返す
  5. ハーネスを、役割と実行方法の二軸で捉える ユーザーハーネス:利用者がエージェントに加えるガイドとセンサー。 ガイド 計算的 コードで処理 推論的 モデルで判断 センサー 行動前に、進め方を導く 行動後の結果を確かめる

    作業を導く 結果を検査する 決まった処理で 文脈や規約を読んで 作業を導く 決まった条件で 結果の意味を読んで 修正点を判断する 行動を導くガイドと、結果を確かめるセンサーを組み合わせる。
  6. で、意味を読むセンサーを足す Jev 変更を読んで、規約を守れたか判断する。今回取り組むのは右下。 ガイド 計算的 コードで処理 推論的 モデルで判断 センサー 行動前に、進め方を導く

    行動後の結果を確かめる 作業を導く 結果を検査する 決まった処理で 文脈や規約を読んで 作業を導く 決まった条件で で規約チェック Jev テストの弱体化・名前のずれ 規約は読ませていたが、守れたかを確かめるセンサーも欲しかった。
  7. 開発に組み込んだ、三つのJevの使い方 規約チェックと知識選別を追加し、PRの判定モデルを置き換えてみた。 1 規約チェックのフック 新しくチェックを追加 2 作業前の知識選別 作業前の知識を選別 3 PR

    のリスク判定 既存のLLMからJevへ 変更の意味を読み、規約違反や確認漏れを指摘する。 過去の学びから、今の作業に役立つものを選ぶ。 自動マージに使うリスク判定を、LLMからJevへ。
  8. Smart Linter / Semantic Sensor 例:挙動を変える実装が追加されたのに、テストが変わっていない。 検査項目:テストの弱体化・エラーの握りつぶし・テスト不足 コード:変更の条件 テスト変更なし 実装の追加あり

    移動やimport整理は除く :挙動への影響 コードが指摘を返す 判定の確率が0.7以上 両方の条件を満たした場合 Jev 挙動を変える + 可能性がある テストの変更を 求める コードの条件とJevの判定がそろったときだけ、指摘を返す。
  9. 変更したコードと質問を渡し、確率を受け取る 経由の短縮例。質問文は説明用の日本語訳。 AI SDK const { answers } = await

    experimental_evaluate({ model: "typesafe-ai/jev", state: { subjects: [changedCode] }, questions: { q0: { type: "boolean", instructions: " ", } }, }); const p = answers.q0.probability; テストを弱める変更か 編集・コミットの途中で、変更をチェックできる。 が返すもの Jev p 規約違反の確率 p≥ 閾値 フックで指摘する
  10. 過去の学びから、今の作業に役立つものを選ぶ コードで候補を集める 過去の学び パス・タグで検索 今回の作業内容 何を実装・修正するか で関連度を評価する 評価基準 今の作業に役立つか? 3

    作業の進め方が変わる 2 作業の参考になる 1 同じ分野 0 無関係 Jev 作業前に渡す 基準を満たした 上位3件まで タイトルと要点を渡す 必要なら全文を参照 選んだ知識が作業に役立ったかを確かめ、Jevへの質問や選ぶ基準を調整する。
  11. 判断基準と評価データがあれば、モデルを替えやすい のリスク判定は、低リスク・高リスクの分類問題として考える。 自社の基準で判定したPRを用意し、モデルの答えと照らし合わせる。 PR 正解:低リスク 正解:高リスク 判定:低リスク 判定:高リスク 一致 必要以上に止める

    高リスクを見逃す 特に減らしたい誤り 自動化できるPRが減る 一致 1 自社の基準で判定を付ける 2 同じ例でモデルを比べる 3 質問と閾値を調整する 判断基準と評価データは、Jev以外の判断APIでも使える。 今のうちに整備しておけば、モデルを替えるときも精度を比較できる。
  12. の中には、たくさんの判断がある Software Factory エージェントに何を任せ、何を確認して公開するかを、作業の各段階で判断する。 01 / SIGNALS 02 / ORCHESTRATION

    03 / AGENT FLEET Issues Build Goals & specs Code · Tests Changes PRs & reviews Task routing Shared work state Approve · Hold · Stop Logs & incidents Investigation · Fixes Learn · Refine · Repeat Release Checks · Findings Operate SHARED FOUNDATION Human approval Review Alerts Feedback 04 / DELIVERY Knowledge CI checks Jev decisions