Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
jev エージェントの⼩さな判断を 任せてみる
Search
Haruki Kondo
October 01, 2026
1
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
jev エージェントの⼩さな判断を 任せてみる
Haruki Kondo
October 01, 2026
More Decks by Haruki Kondo
See All by Haruki Kondo
Midnight Builder Workshop Tokyo Vol.1 — ZKアプリを実際に作ってみよう!
mashharuki
2
100
AdGate for WebMCP
mashharuki
1
31
ClaudeCodeでモバイルアプリ開発の苦手意識を克服した話
mashharuki
1
1.5k
【AWS CDK Conference 2026】起動時間24msのエミュレーター「floci」でAWS CDK開発を ローカル環境でも爆速化する!
mashharuki
1
590
NEAR Legion Tokyo: Meetup #4 - IronClaw × NEAR Intents 自動化ナイト なんでも自動化してみよう!
mashharuki
0
23
爆速 !Mantle上でのオンチェーンAI Agent開発
mashharuki
0
140
Building AI Agents on Solana〜Mastra Framework を活用した次世代エージェント開発〜
mashharuki
0
140
開発者のためのSovereign AI: IronClaw 深掘り解説
mashharuki
0
100
Solana × x402 × AWS でつくるSuper AI Payment Gateway
mashharuki
0
140
Featured
See All Featured
The Anti-SEO Checklist Checklist. Pubcon Cyber Week
ryanjones
0
250
"I'm Feeling Lucky" - Building Great Search Experiences for Today's Users (#IAC19)
danielanewman
230
23k
Applied NLP in the Age of Generative AI
inesmontani
PRO
4
2.5k
ReactJS: Keep Simple. Everything can be a component!
pedronauck
666
130k
AI Search: Implications for SEO and How to Move Forward - #ShenzhenSEOConference
aleyda
1
1.4k
Testing 201, or: Great Expectations
jmmastey
46
8.3k
Measuring & Analyzing Core Web Vitals
bluesmoon
9
1k
Dealing with People You Can't Stand - Big Design 2015
cassininazir
367
27k
Breaking role norms: Why Content Design is so much more than writing copy - Taylor Woolridge
uxyall
1
430
svc-hook: hooking system calls on ARM64 by binary rewriting
retrage
2
590
Test your architecture with Archunit
thirion
2
2.4k
Building Applications with DynamoDB
mza
96
7.2k
Transcript
jev 生成AIエージェント実践会 / 2026.10.20 エージェントの小さな判断を 任せてみる Haruki / @haruki_web3 1
ABOUT ME 自己紹介 Haruki @haruki_web3 Web3エンジニアコミュニティ運営 AWS Community Builder 2
次に実行すべき処理をどう選ぶ? 「今は取引しないで、 USDCの残高だけ見せて。」 残高を表示 交換する 説明する 3
SYSTEM ONE 型付きの判断を返す「jev」 TypeSafeのSystem Oneモデル。入力と質問から、判断と確率を返す。 状態 + 質問 jev 型付きの判断
Choice:選ぶ Score:段階で評価 Noul:Yesの確率 判断理由の説明文は生成しない。今回は候補から選ぶChoiceを使う。 4
実際のAPIリクエスト 同じ入力に、2つの問いを投げる state.request:「100 USDCをETHに交換してください。」 intent / 意図 何をしたいか? 交換・残高確認・説明・不明 readiness
/ 確認要否 依頼内容は明確か? 追加確認なし・確認が必要 1回の呼び出しで独立・並列に評価。片方の答えをもう片方へ渡す処理ではない。 5
この発表で提案する分担 判断はjev、説明はLLMへ 必要な処理 分担の例 候補から選び、確率で分岐する 説明文・コード・複雑な回答を生成 金額計算・上限・認可を検査 jevを試す LLMに任せる コードで扱う
LLMでも分類できる。自分の入力で精度・待ち時間・費用を比較して選ぶ。 6
依頼文の分類デモ / 実API結果のリプレイ 取引案・確認・停止をコードで選ぶ 100 USDCをETHに交換 取引案を作る 数量はあとで決める 確認に回す 1000
USDCをETHに交換 コードで停止 金額は別フィールド。デモ上限500 USDC。ウォレット接続・取引送信なし。 7
依頼文分類 / 質問を直して再評価 問いを具体化すると、結果が変わった 23/30 最初の質問 → 27/30 条件を具体化した質問 「今、実行してよいか」から
「情報は足りているか、実行は保留されているか」へ。 2問とも期待ラベルと一致した件数。同じ自作30件で調整・再評価。 8
実ログに残った限界 期待と異なった3件も、確認に回った 「さっきの取引の反対をお願い。」 意図の判断 swap を選択 confidence 0.98 期待ラベルは unclear
確認要否の判断 clarify を選択 コードは「確認」へ confidence=判断の迷いの少なさ(0〜1)。正解する確率とは違う。 候補に確率が集中すると高く、分かれると低い。高くても間違うことはある。 9
今日から試すこと まず1つの分類を切り出して試す 1 候補が決まった、小さな判断を選ぶ 2 実例を用意して、期待と答えを比べる 3 コードの条件と組み合わせる docs.typesafe.ai →
Quick start 10
補足 / APIの型 返す値は、三つの型から選ぶ 型 返すもの 問いの例 Choice Score Noul
候補と候補別の確率 段階番号の確率加重平均 Yesの確率(0〜1) どの担当へ送る? どの程度の緊急度? 確認を求めている? Choice/Scoreにはconfidence。Noulには独立したconfidenceはない。 11
補足 / 測定条件 今回の測定で、言えること 項目 質問の修正後 呼び出し API往復時間 期待ラベルとの一致 固定モデル
30件・各2問・逐次実行 中央値230.5ms / p95 566ms 2問とも一致 27/30件 jev-1.13.0 2026-09-25、この実行環境で測定。LLM比較・取引送信は未実施。 12
補足 / 日本語で使うとき 日本語の入力は、実例で確かめる 公式の言語対応 主な学習言語は英語。 日本語を含むCJKは、英語と同等の精度ではない。 今回は日本語の自作30件で確認。 本番の入力と、未使用の評価データでも確かめる。 出典:TypeSafe
Models / Language support(2026-09-30確認)。 13
補足 / 実ログから 高いconfidenceでも、条件は別に検査 1000 USDCをETHに交換してください。 jev:swap / ready、どちらもconfidence 1.0
コード:500 USDCを超えるため停止 「明確な依頼」と「実行条件を満たす」は別の判断。 14
補足 / API応答 実際の応答は、2問それぞれに返る 「100 USDCをETHに交換してください。」 answers.intent choice:swap 確率:swap 1.00
confidence:1.00 answers.readiness choice:ready 確率:ready 1.00 confidence:1.00 このあとコードが別フィールドのamount=100を確認し、取引案を表示する。 15
補足 / 実ログの分布 0.60を選んでも、confidenceは0.47 「ETHからUSDCに替える方法を知りたい。今は実行しません。」 swap explain intentのconfidence:0.47 → 確認へ
confidence=判断の迷いの少なさ。候補の確率や、正解する確率とは別の値。 0.60 0.40 16
補足 / 質問定義の改善案・未測定 「実行しない」は説明依頼にも出てくる 「替える方法を知りたい。今は実行しません。」 説明・残高確認なら 回答対象が明確 → ready 情報が不足
→ clarify 交換実行の依頼なら 数量未定・保留・事前確認 → clarify 条件を適用する対象を分ける。既存の27/30は、この改善案の結果ではない。 17
補足 / 実ログの限界 高confidenceでも期待と異なる 「さっきの取引の反対をお願い。」 intent swap 0.99 confidence 0.98
期待ラベルはunclear ケース25。「さっき」の内容はstateに渡していない。 readiness clarify 0.98 confidence 0.97 結果は確認へ 18
補足 / 応用構成 判断から取引案までの分担 取引案 取引要求 jevで意図分類 コードで制約確認 保留 19
判断結果をコードの分岐につなぐ 通常処理 ⼊⼒ jev コードの分岐 確認が必要 LLM・⼈に確認 confidence とルールを併⽤ confidenceは正解率ではない。不足情報はユーザーに確認し、条件はコードで検査。
20
補足 / 関連研究 記憶の扱いにも、判断の分担を使う Jev-Mem(2026年9月のプレプリント) 記憶の分類・検索の制御 → System One 複雑な推論・回答の合成
→ System Two jev本体の学習論文ではなく、メモリ制御への応用研究。 21
補足 / 一次資料 コードと資料をたどる TypeSafe Quick start 入出力と最小リクエスト typesafe-ai/typesafe-sdk-js 型定義・通信処理
TypeSafe Agent Skill Claude Code / Codexから試す Jev 1.13 jaggedness 公式が公開する弱点 22
補足 / さらに読む パターンと研究の出典 System patterns intent / confidence /
fan-out / composite Confidence 確率分布との関係 Jev-Mem System-One-Controlled Agentic Memory State 質問へ渡す共通の入力 23
補足 / 別デモ・オンチェーン取引の分類 取引データを分類し、選んだものを説明 入力はオンチェーンの取引データ。 jevで分類し、 Geminiで説明文を生成。 画面は別デモの参考。依頼文分類の27/30とは入力・質問・評価が異なる。 24
補足 / 別デモの画面・結果部分を拡大 判別できない結果も、そのまま表示する この画面では「不明」と分類。confidenceは正解率ではない。 依頼文分類とは別の質問・入力。オンチェーン分類の精度を示す測定ではない。 25
補足 / 別デモの画面・結果部分を拡大 候補を選んでも、迷いが残ることがある 候補別の確率とconfidenceを見て、次の処理を決める。 画面上の分類結果を紹介する参考例。正しいAA操作と検証した結果ではない。 26
補足 / 別デモ・Geminiの説明 説明文では、事実と推定を分けて読む チェーン上の事実 jevの分類結果 Geminiによる説明 それぞれを区別して確認。 説明文を生成するのはGemini。jevが判断理由を返しているわけではない。 27