jevを業務に入れる前に、どの判断を任せられるか、何で測るか、どう切り替えるかを、実験結果をもとにまとめた。
10種類の判断を、目標正解率95%のカバレッジ(人の確認なしで任せられる割合)で比べた。投稿が有害かどうか、エージェントが作業を始めるべきか、Issueの種類の分類では89〜100%を任せられた。一方で、Issueの優先度や、TypeScriptの不具合報告か仕様どおりかの判定は1〜19%にとどまった。結果を分けたのは、答えが文面の中にあるかどうかである。チームの事情やコードの中身で決まる判断は任せられなかった。コストは日本語の4つの判断でClaude Haiku 4.5の20分の1以下だった。
導入の手順は機械学習の開発とほぼ同じで、学習の代わりにプロンプトを直す。資料では、次の流れを実際の数値とともに紹介している。途中でつまずいた点も載せた。正解ラベルにノイズがあった。コンテキストを足すと逆に正解率が下がる判断があった。マルチターンの記録の評価では、LLMの評価が見つけた失敗の約半分を見逃した。
あわせて、作ったもの(jev Sound Director、nod、synth-pop、jev-triage)も紹介している。