Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
ADK を使ってエージェントを評価してみた
Search
hirataikue
March 16, 2026
Technology
35
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
ADK を使ってエージェントを評価してみた
雲勉 Google Cloud Tech Night
hirataikue
March 16, 2026
More Decks by hirataikue
See All by hirataikue
Google Cloud 認定資格 英語試験合格への道
hirataikue
2
67
新卒エンジニアがAWS認定資格を全冠して得られたもの
hirataikue
1
450
Other Decks in Technology
See All in Technology
セキュリティ研修【MIXI 26新卒技術研修】
mixi_engineers
PRO
31
26k
データエンジニアこそ組織のオントロジーに向き合うべき — 問いに答えるAIから、事業を動かすAIへ
gappy50
7
2.8k
Oracle Base Database Service 技術詳細
oracle4engineer
PRO
15
110k
数値で見る Microsoft MVP 〜Spec Kit と GitHub Copilot Agent で作るデータ可視化ダッシュボード〜
yutakaosada
0
180
Retriever と Reranker、結局どうする?
kazuaki
1
530
reFACToring
moznion
1
1k
AIエージェントに財布を渡す日 ― 承認付き"買い物エージェント"を作って実演
yama3133
0
110
AIツールを導入しても生産性はあがらない? カオナビが直面した 3つの壁と乗り越え方。/ Overcoming 3 Barriers to AI-Driven Productivity at kaonavi
kaonavi
0
480
20260608_Codexの可能性_ノンプログラマー向け_大城追記
doradora09
PRO
0
660
CTOキーノート:AI時代の「つなぐ」を再定義 ― 真のIoTとリアルワールドAI【SORACOM Discovery 2026】
soracom
PRO
0
330
データ活用研修 データマネジメント【MIXI 26新卒技術研修】
mixi_engineers
PRO
4
820
もう一度考える SRE チームの作り方・育て方 / Rethinking SRE #1: Building and Growing SRE Teams
rrreeeyyy
1
170
Featured
See All Featured
The Language of Interfaces
destraynor
162
27k
Connecting the Dots Between Site Speed, User Experience & Your Business [WebExpo 2025]
tammyeverts
11
980
Agile that works and the tools we love
rasmusluckow
331
22k
Odyssey Design
rkendrick25
PRO
2
740
Reflections from 52 weeks, 52 projects
jeffersonlam
356
21k
Mozcon NYC 2025: Stop Losing SEO Traffic
samtorres
1
450
Sharpening the Axe: The Primacy of Toolmaking
bcantrill
46
2.9k
Marketing to machines
jonoalderson
1
5.6k
Improving Core Web Vitals using Speculation Rules API
sergeychernyshev
21
1.6k
SEO in 2025: How to Prepare for the Future of Search
ipullrank
3
3.7k
First, design no harm
axbom
PRO
2
1.2k
DevOps and Value Stream Thinking: Enabling flow, efficiency and business value
helenjbeal
1
270
Transcript
開江 太一 DX開発事業部 フルスタックセクション テックフロンティアグループ ADK を使って エージェントを評価してみた 雲勉 Google Cloud Tech
Night
開江 太一 ・2024 年新卒入社 / 入社 2 年目 ・Google Cloud
の生成 AI サービスを活用したシステム開発に従事 ・Google Cloud Partner Top Engineer 2026 ・Google Cloud Partner All Certification Holders 2025 アイレット株式会社 ひ ら く え た い ち 経歴 DX開発事業部 フルスタックセクション テックフロンティアグループ
01 02 03 アジェンダ エージェントの評価 とは ADK でエージェントを評価する まとめ
エージェントの評価とは?
AI が生成した回答の評価 • 従来のプログラム ◦ 例:「1 + 1」→ 答えは必ず「2」 ◦
評価:完全一致で判定可能
AI が生成した回答の評価 • 従来のプログラム ◦ 例:「1 + 1」→ 答えは必ず「2」 ◦
評価:完全一致で判定可能 • 生成 AI ◦ 例:「東京の魅力を教えて」 ◦ 回答A:「美味しい食事が沢山あります。」 ◦ 回答B:「歴史と現代が融合した街です。」 ◦ 評価:どちらも正解 ▪ 回答の「意味的な妥当性 」や「好ましさ」を測る必要がある
エージェントの評価とは 回答評価(Final response evaluation) 最終的な回答は正確か? 軌跡評価(Trajectory evaluation) 質問 呼出 返却
回答 正しいツールを正しい順序で呼び出したか? 回答を評価するだけでは、エージェントが正しいプロセスを経たか判断できない → エージェントの実行過程も含めて評価する
ADK でエージェントを評価する
ADK(Agent Development Kit) Google が提供する、 AI エージェント開発のためのフレームワーク • 複数の専門エージェントを連携させ、複雑なワーク
フローを実現 • 豊富なツールにより、外部データソースや API との 連携をサポート • あらかじめ定義されたテストケースに対し、 エージェントのパフォーマンスを体系的に評価可能
ADK でエージェントを評価する エージェント評価の実行方法は 3 種類用意されている • ADK Web UI(adk web)
◦ Web インターフェースを通じてエージェントを評価する • CLI(adk eval) ◦ コマンドラインからエージェントの評価を実行する • pytest ◦ Python テストの中に評価処理を組み込む
ADK Web UI(adk web) • エージェントと会話して、理想的な会話セッションを作成する ◦ Trace タブで回答の内部ロジックを確認可能 ◦
エージェントが正しくツールを使用せずに回答した場合は、不適切と判断
ADK Web UI(adk web) • 評価セットに現在のセッションを追加して評価を実行する ◦ Tool trajectory avg
score ▪ エージェントが実行したツールが、テストケースとどれだけ一致しているかを判定 ◦ Response match score ▪ 最終的な回答が、基準となる回答とどの程度類似しているかを判定(ROUGE-1)
回答の揺らぎをどう扱うか 正解データ: 「明日の東京の天気は、朝から晩まで激しい雨が降るでしょう。」 AIの回答:「翌日の都内は、終日を通して豪雨となる見込みです。」 • ROUGE-1(単語一致) ◦ 評価:『明日』≠『翌日』、『東京』≠『都内』 ◦ 判定:FAIL
回答の揺らぎをどう扱うか 正解データ: 「明日の東京の天気は、朝から晩まで激しい雨が降るでしょう。」 AIの回答:「翌日の都内は、終日を通して豪雨となる見込みです。」 • ROUGE-1(単語一致) ◦ 評価:『明日』≠『翌日』、『東京』≠『都内』 ◦ 判定:FAIL
• LLM-as-a-judge(意味一致) ◦ 評価:『明日/翌日』、『東京/都内』『激しい雨/豪雨』 ◦ 判定:PASS ▪ チャットボットなど、「表現の自由度 」が高いタスクに適している
CLI(adk eval) • CLI を使って評価セットの評価を実行する ◦ test_config.json でエージェントの評価基準をカスタム可能 • final_response_match_v2:LLM
を使用して意味的な一致を判定する • safety_v1:有害コンテンツ(ヘイトスピーチ、PII の漏洩)をチェックする • rubric_based_final_response_quality_v1:言葉遣いなどのカスタムルール ◦ etc…
CLI(adk eval) • CLI を使って評価セットの評価を実行する ◦ Evalset ファイル( json)でデータセットを定義する ◦
Web UI から Evalset を出力することも可能
まとめ
まとめ • AI エージェントは「回答」だけでなく「実行過程」も含めて評価する • LLM-as-a-judge を用いることで、自由度が高いタスクでも正当な評価が可能になる • ADK には複雑な評価プロセスを体系化・効率化できる機能が備わっている
◦ Web UI(adk web) ◦ CLI(adk eval)
ご清聴ありがとうございました