Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
Agentic Software Factoryに、すごく賢いIF文を。 / super sm...
Search
r-kagaya
October 04, 2026
Programming
150
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Agentic Software Factoryに、すごく賢いIF文を。 / super smart IF statement into the Agentic Software Factory.
「Jev使ってみてどうだった? ~試してわかった活用のヒント~」の登壇資料です!
https://findy.connpass.com/event/407342/
r-kagaya
October 04, 2026
More Decks by r-kagaya
See All by r-kagaya
速く作れる。その次は、速く確かめられる開発へ 〜AIネイティブ開発を支える、Shift Down〜 / Can build fast. Next, moving to development where we can verify fast.
rkaga
8
5.3k
AI活用は、個人から組織へ|マルチプレイヤーエージェントハーネス「QM」の社内活用事例 / AI use is moving from individuals to orgs
rkaga
1
330
AI Engineeringは、AIプロダクトだけのものか? 〜AIがソフトウェアを作る時代の新しい当たり前〜 / No AI in your product. AI Engineering in your development.
rkaga
5
880
エンジニアにデザインハーネスを 〜デザインプロセスを規定するためのハーネス〜 / Design harness from an engineer's perspective
rkaga
2
3.8k
「AIで開発し、AIを届ける」をEvalでつなぐ 〜AIネイティブに始めるプロダクト開発の実践〜 / Connecting "Develop with AI, deliver AI" with Eval
rkaga
5
6.3k
ハーネスエンジニアリングにどう向き合うか 〜ルールファイルを超えて開発プロセスを設計する〜 / How to approach harness engineering
rkaga
31
32k
そのAIレビュー、レビューしてますか? / Are you reviewing those AI reviews?
rkaga
7
5.7k
AIエージェント、”どう作るか”で差は出るか? / AI Agents: Does the "How" Make a Difference?
rkaga
5
2.5k
Context is King? 〜Verifiability時代とコンテキスト設計 / Beyond "Context is King"
rkaga
10
4.1k
Other Decks in Programming
See All in Programming
Findy - エンジニア向け会社紹介/Findy Company Deck
findyinc
6
400k
AI時代のコードレビューは人に向けるな、仕組みに向けろ
texmeijin
5
3.3k
Ghostty + Neovimで作る 透明でカッコ良い開発環境
j341nono
0
150
AI Agent時代のリアーキテクチャ戦略と実践
hokaccha
9
5.3k
市販E-Readerを乗っ取れ 〜Embedded Swiftで電子ペーパーガジェットを制御する〜
trickart
0
230
ハーネス設計入門 〜 基礎知識の整理から実務へのステップアップ 〜
kinopeee
20
20k
Intent as Code
shoppingjaws
6
1.1k
JAWS-UG 東京支部が始める、JAWS-UG支部コラボ / JAWS-UG lunchtime LT Collaboration
y0hgi
0
170
iOSDCのペンライトを自動制御したい!
akkeylab
0
340
Embedded Swiftで作る自作USBデバイス によるiOSデバイスの自動テスト / iOSDC Japan 2026 glassfiber
glassfiber
0
250
setup-vp GitLab対応の裏側
naokihaba
0
140
選挙速報を多くのユーザーへ 届ける Live Activities 設計
hamayokokuririn
0
200
Featured
See All Featured
Ethics towards AI in product and experience design
skipperchong
2
410
Leadership Guide Workshop - DevTernity 2021
reverentgeek
1
380
Visual Storytelling: How to be a Superhuman Communicator
reverentgeek
2
700
Distributed Sagas: A Protocol for Coordinating Microservices
caitiem20
333
23k
Optimising Largest Contentful Paint
csswizardry
37
4k
ReactJS: Keep Simple. Everything can be a component!
pedronauck
666
130k
Build The Right Thing And Hit Your Dates
maggiecrowley
39
3.5k
It's Worth the Effort
3n
188
29k
エンジニアに許された特別な時間の終わり
watany
109
250k
The Anti-SEO Checklist Checklist. Pubcon Cyber Week
ryanjones
0
250
Color Theory Basics | Prateek | Gurzu
gurzu
1
480
Speed Design
sergeychernyshev
33
2.1k
Transcript
使ってみてどうだった? ~試してわかった活用のヒント~ Jev に、 Agentic Software Factory IF すごく賢い 文を。
規約を確かめ、知識を選び、PRのリスクを判定する。 株式会社 r.kagaya Asterminds
自己紹介 ( ) r.kagaya @ry0_kaga (アスターマインズ)株式会社 共同創業者・CTO Asterminds 年にログラスへ入社。 経営管理SaaSの開発、開発生産性の改善に従事。
生成AI/LLMチームを立ち上げ、 新規AIプロダクトの立ち上げを担当。 2025年8月に独立、現職。 2022 『AIエンジニアリング』の翻訳を担当 オライリージャパンより出版
最近、Jevって触ってます?
の公開から半月で、使い方も選択肢も広がった Jev 9/15 9/16 9/20 9/25 9/29 10/1 が を公開
判断用モデルを早期アクセスで提供 Vercelが対応、OpenJevのリポジトリが作成 OpenJev(現SemIf)は、オープンモデルを使う独立実装 LangChainが、Jevによる評価の実験を公開 保存したエージェントの実行結果を、Jevで採点 LangChainが、Jev+LangGraphの実装例を公開 文書を分類し、次の処理や人への確認へ振り分ける OpenAIがDecisions APIを発表 画像も入力可能。発表時点では限定プレビュー CloudflareがClef / Clef-flashを公開 TypeSafe Jev 互換の判断モデルを、オープンソースで提供 Jev API 年〜 月 2026 9 10
の概要をおさらい Jev 文章やコードを分類・採点し、判定や評価を返す。 コードや文章に質問を添え、確率・候補の選択・評価値で答えを受け取る。 何を聞くか 答えの形式 返ってくるもの 当てはまるか の確率 yes
この変更は規約に反する? Noul 続ける/変える/人に相談 Choice 選択した候補 この知識は作業に関係する? Score 評価値 どれを選ぶか どれくらいか 速く・安く、小さな判断を何度も呼び出せる。 〜 の値 0 1 確率分布・確信度も返す 確率分布・確信度も返す
例えば、テストを弱める変更かどうかを聞く 聞くこと 変更前後のテストコード 不具合があっても通るように、 テストを弱めたか? 返ってくるもの 「yes」の確率(0〜1) 渡すもの 確率を受け取り、指摘するかどうかはコードで決める。
いわば、すごく賢いIF文。 意味の判断をJevに聞き、結果で次の処理を分ける。
速く・安くなると、活用の考え方は二つある 01 02 既存のLLMで行っていた PRのリスク判定を置き換える。 編集のたびに規約を確かめ、 作業の前に読む知識を選ぶ。 今までの判断を、 速く・安くする 今まで省いていた判断も、
こまめに入れる 置き換えるだけでなく、判断を入れる頻度と場面も変えられる。
毎回注意していたことを、 チェックにしてみた。
ハーネスを、役割と実行方法の二軸で捉える ユーザーハーネス:利用者がエージェントに加えるガイドとセンサー。 ガイド 計算的 コードで処理 推論的 モデルで判断 センサー 行動前に、進め方を導く 行動後の結果を確かめる
作業を導く 結果を検査する 決まった処理で 文脈や規約を読んで 作業を導く 決まった条件で 結果の意味を読んで 修正点を判断する 行動を導くガイドと、結果を確かめるセンサーを組み合わせる。
で、意味を読むセンサーを足す Jev 変更を読んで、規約を守れたか判断する。今回取り組むのは右下。 ガイド 計算的 コードで処理 推論的 モデルで判断 センサー 行動前に、進め方を導く
行動後の結果を確かめる 作業を導く 結果を検査する 決まった処理で 文脈や規約を読んで 作業を導く 決まった条件で で規約チェック Jev テストの弱体化・名前のずれ 規約は読ませていたが、守れたかを確かめるセンサーも欲しかった。
開発に組み込んだ、三つのJevの使い方 規約チェックと知識選別を追加し、PRの判定モデルを置き換えてみた。 1 規約チェックのフック 新しくチェックを追加 2 作業前の知識選別 作業前の知識を選別 3 PR
のリスク判定 既存のLLMからJevへ 変更の意味を読み、規約違反や確認漏れを指摘する。 過去の学びから、今の作業に役立つものを選ぶ。 自動マージに使うリスク判定を、LLMからJevへ。
Smart Linter / Semantic Sensor 例:挙動を変える実装が追加されたのに、テストが変わっていない。 検査項目:テストの弱体化・エラーの握りつぶし・テスト不足 コード:変更の条件 テスト変更なし 実装の追加あり
移動やimport整理は除く :挙動への影響 コードが指摘を返す 判定の確率が0.7以上 両方の条件を満たした場合 Jev 挙動を変える + 可能性がある テストの変更を 求める コードの条件とJevの判定がそろったときだけ、指摘を返す。
確認が抜けていたら、PRを作る前に止める 画面の挙動を変えたのに、QAのスクショや動画がないPRは止めたい。 エージェントの作業 画面の挙動を変更 を作ろうとする。 PR フックの指摘 の証拠がない QA スクショか動画を求める。
指摘を受けた応答 実機で確認する 確認に戻ると回答。 「確認してね」という指示を、確認漏れに気づける仕組みにした。
変更したコードと質問を渡し、確率を受け取る 経由の短縮例。質問文は説明用の日本語訳。 AI SDK const { answers } = await
experimental_evaluate({ model: "typesafe-ai/jev", state: { subjects: [changedCode] }, questions: { q0: { type: "boolean", instructions: " ", } }, }); const p = answers.q0.probability; テストを弱める変更か 編集・コミットの途中で、変更をチェックできる。 が返すもの Jev p 規約違反の確率 p≥ 閾値 フックで指摘する
過去の学びから、今の作業に役立つものを選ぶ コードで候補を集める 過去の学び パス・タグで検索 今回の作業内容 何を実装・修正するか で関連度を評価する 評価基準 今の作業に役立つか? 3
作業の進め方が変わる 2 作業の参考になる 1 同じ分野 0 無関係 Jev 作業前に渡す 基準を満たした 上位3件まで タイトルと要点を渡す 必要なら全文を参照 選んだ知識が作業に役立ったかを確かめ、Jevへの質問や選ぶ基準を調整する。
自動マージのリスク判定を、LLMからJevに切り替えた 自動マージに使うリスク判定を、以前からLLMで行っていた。 これまで 今回試したこと 既存のLLM のリスクを判定 PR 切り替え Jev のリスクを判定
PR 安くて使いやすい。それだけでも、置き換えてみる価値があった。
判断基準と評価データがあれば、モデルを替えやすい のリスク判定は、低リスク・高リスクの分類問題として考える。 自社の基準で判定したPRを用意し、モデルの答えと照らし合わせる。 PR 正解:低リスク 正解:高リスク 判定:低リスク 判定:高リスク 一致 必要以上に止める
高リスクを見逃す 特に減らしたい誤り 自動化できるPRが減る 一致 1 自社の基準で判定を付ける 2 同じ例でモデルを比べる 3 質問と閾値を調整する 判断基準と評価データは、Jev以外の判断APIでも使える。 今のうちに整備しておけば、モデルを替えるときも精度を比較できる。
おわりに
画面レビューとブラウザQAは、置き換えなかった デザインレビューもブラウザQAも、既存の仕組みを置き換えるには至らず…。 デザインレビュー 見た目を確かめたいが、 Jevには画像を渡せない。 余白や重なりは、画像で確認したい。 既存の画像対応モデルを そのまま使うことにした。 ブラウザQAエージェント 操作の選択は、
Jevでも組み込めたが… の候補を選び、Playwrightで操作。 元々、別のQAの仕組みもあった。 切り替える必要は感じなかった。 DOM 組み込めるかだけでなく、既存の仕組みより便利になるかも考えたい。
の中には、たくさんの判断がある Software Factory エージェントに何を任せ、何を確認して公開するかを、作業の各段階で判断する。 01 / SIGNALS 02 / ORCHESTRATION
03 / AGENT FLEET Issues Build Goals & specs Code · Tests Changes PRs & reviews Task routing Shared work state Approve · Hold · Stop Logs & incidents Investigation · Fixes Learn · Refine · Repeat Release Checks · Findings Operate SHARED FOUNDATION Human approval Review Alerts Feedback 04 / DELIVERY Knowledge CI checks Jev decisions
まとめ は、文章やコードの意味を判断する「すごく賢いIF文」。 規約チェック・知識選別・PRリスク判定に組み込めた。 速く・安く呼べるので、こまめに確認でき、繰り返し試せる。 精度の確認と調整は必要だが、 分類問題なので、対話タスクより評価しやすかった。 Jev 判断基準と評価例を残しておけば、モデルを替えるときも精度を比較できる。
終わり