Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
ADK を使ってエージェントを評価してみた
Search
hirataikue
March 16, 2026
Technology
54
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
ADK を使ってエージェントを評価してみた
雲勉 Google Cloud Tech Night
hirataikue
March 16, 2026
More Decks by hirataikue
See All by hirataikue
Google Cloud 認定資格 英語試験合格への道
hirataikue
2
72
新卒エンジニアがAWS認定資格を全冠して得られたもの
hirataikue
1
480
Other Decks in Technology
See All in Technology
メルカリにおけるAI時代の高速プロトタイピング基盤「Arca」
ryotarai
18
13k
Snowflake Horizon Catalog と Apache Iceberg で作る オープンなデータ基盤
kitagawaz
0
340
10年欲しかった音楽管理アプリを、AIと一緒に作りはじめた
judau
1
190
AIエージェント時代のPlatform as a Product —— テックリードがPdMとして回す発見・導入・計測 / Platform as a Product in the AI Agent Era
toshi0607
1
530
「大丈夫そう?」をObservabilityで確かめる
mrmtsu
0
240
20260915deck.gl-raster を使ってみた
rena1208
0
170
Lambda MicroVMsが分からなすぎたので使い所を1から考えてみた
tsukuboshi
1
250
覗いてみよう 関数型ビジュアル言語×2Dグラフィックスの世界
yohyamasaki
0
150
3人で1000GPU超を統合運用する?マルチクラウド&オンプレを跨ぐ、構築と運用のリアル!
kazukun0716
2
770
GitHub Agentic Workflows を触ってみる
htkym
2
880
Oracle Cloud Infrastructure(OCI):Onboarding Session(はじめてのOCI/Oracle Supportご利⽤ガイド)
oracle4engineer
PRO
3
21k
TiDBファミリーにDWHが新登場!! TiDB最新情報 / TiDB update 202609
yoshiakiyamasaki
0
160
Featured
See All Featured
The agentic SEO stack - context over prompts
schlessera
0
940
Pawsitive SEO: Lessons from My Dog (and Many Mistakes) on Thriving as a Consultant in the Age of AI
davidcarrasco
0
250
Organizational Design Perspectives: An Ontology of Organizational Design Elements
kimpetersen
PRO
1
840
Tell your own story through comics
letsgokoyo
1
1.1k
Heart Work Chapter 1 - Part 1
lfama
PRO
10
36k
Impact Scores and Hybrid Strategies: The future of link building
tamaranovitovic
0
440
10 Git Anti Patterns You Should be Aware of
lemiorhan
PRO
659
62k
The Spectacular Lies of Maps
axbom
PRO
1
1.1k
Joys of Absence: A Defence of Solitary Play
codingconduct
1
530
Java REST API Framework Comparison - PWX 2021
mraible
34
9.7k
Side Projects
sachag
456
43k
実際に使うSQLの書き方 徹底解説 / pgcon21j-tutorial
soudai
PRO
203
76k
Transcript
開江 太一 DX開発事業部 フルスタックセクション テックフロンティアグループ ADK を使って エージェントを評価してみた 雲勉 Google Cloud Tech
Night
開江 太一 ・2024 年新卒入社 / 入社 2 年目 ・Google Cloud
の生成 AI サービスを活用したシステム開発に従事 ・Google Cloud Partner Top Engineer 2026 ・Google Cloud Partner All Certification Holders 2025 アイレット株式会社 ひ ら く え た い ち 経歴 DX開発事業部 フルスタックセクション テックフロンティアグループ
01 02 03 アジェンダ エージェントの評価 とは ADK でエージェントを評価する まとめ
エージェントの評価とは?
AI が生成した回答の評価 • 従来のプログラム ◦ 例:「1 + 1」→ 答えは必ず「2」 ◦
評価:完全一致で判定可能
AI が生成した回答の評価 • 従来のプログラム ◦ 例:「1 + 1」→ 答えは必ず「2」 ◦
評価:完全一致で判定可能 • 生成 AI ◦ 例:「東京の魅力を教えて」 ◦ 回答A:「美味しい食事が沢山あります。」 ◦ 回答B:「歴史と現代が融合した街です。」 ◦ 評価:どちらも正解 ▪ 回答の「意味的な妥当性 」や「好ましさ」を測る必要がある
エージェントの評価とは 回答評価(Final response evaluation) 最終的な回答は正確か? 軌跡評価(Trajectory evaluation) 質問 呼出 返却
回答 正しいツールを正しい順序で呼び出したか? 回答を評価するだけでは、エージェントが正しいプロセスを経たか判断できない → エージェントの実行過程も含めて評価する
ADK でエージェントを評価する
ADK(Agent Development Kit) Google が提供する、 AI エージェント開発のためのフレームワーク • 複数の専門エージェントを連携させ、複雑なワーク
フローを実現 • 豊富なツールにより、外部データソースや API との 連携をサポート • あらかじめ定義されたテストケースに対し、 エージェントのパフォーマンスを体系的に評価可能
ADK でエージェントを評価する エージェント評価の実行方法は 3 種類用意されている • ADK Web UI(adk web)
◦ Web インターフェースを通じてエージェントを評価する • CLI(adk eval) ◦ コマンドラインからエージェントの評価を実行する • pytest ◦ Python テストの中に評価処理を組み込む
ADK Web UI(adk web) • エージェントと会話して、理想的な会話セッションを作成する ◦ Trace タブで回答の内部ロジックを確認可能 ◦
エージェントが正しくツールを使用せずに回答した場合は、不適切と判断
ADK Web UI(adk web) • 評価セットに現在のセッションを追加して評価を実行する ◦ Tool trajectory avg
score ▪ エージェントが実行したツールが、テストケースとどれだけ一致しているかを判定 ◦ Response match score ▪ 最終的な回答が、基準となる回答とどの程度類似しているかを判定(ROUGE-1)
回答の揺らぎをどう扱うか 正解データ: 「明日の東京の天気は、朝から晩まで激しい雨が降るでしょう。」 AIの回答:「翌日の都内は、終日を通して豪雨となる見込みです。」 • ROUGE-1(単語一致) ◦ 評価:『明日』≠『翌日』、『東京』≠『都内』 ◦ 判定:FAIL
回答の揺らぎをどう扱うか 正解データ: 「明日の東京の天気は、朝から晩まで激しい雨が降るでしょう。」 AIの回答:「翌日の都内は、終日を通して豪雨となる見込みです。」 • ROUGE-1(単語一致) ◦ 評価:『明日』≠『翌日』、『東京』≠『都内』 ◦ 判定:FAIL
• LLM-as-a-judge(意味一致) ◦ 評価:『明日/翌日』、『東京/都内』『激しい雨/豪雨』 ◦ 判定:PASS ▪ チャットボットなど、「表現の自由度 」が高いタスクに適している
CLI(adk eval) • CLI を使って評価セットの評価を実行する ◦ test_config.json でエージェントの評価基準をカスタム可能 • final_response_match_v2:LLM
を使用して意味的な一致を判定する • safety_v1:有害コンテンツ(ヘイトスピーチ、PII の漏洩)をチェックする • rubric_based_final_response_quality_v1:言葉遣いなどのカスタムルール ◦ etc…
CLI(adk eval) • CLI を使って評価セットの評価を実行する ◦ Evalset ファイル( json)でデータセットを定義する ◦
Web UI から Evalset を出力することも可能
まとめ
まとめ • AI エージェントは「回答」だけでなく「実行過程」も含めて評価する • LLM-as-a-judge を用いることで、自由度が高いタスクでも正当な評価が可能になる • ADK には複雑な評価プロセスを体系化・効率化できる機能が備わっている
◦ Web UI(adk web) ◦ CLI(adk eval)
ご清聴ありがとうございました