Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
【CA.ai #4】Vertex AI Gen AI Evaluation Service の...
Search
Kazuki Hara
September 03, 2026
Programming
2
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
【CA.ai #4】Vertex AI Gen AI Evaluation Service の活用事例紹介
https://cyberagent.connpass.com/event/383129/
Kazuki Hara
September 03, 2026
More Decks by Kazuki Hara
See All by Kazuki Hara
Build with AI:ADKとGemini CLIで自分だけのAIアシスタントを作ろう!
harappa80
0
6
【CA.ai #3】Google ADKを活用したAI Agent開発と運用知見
harappa80
1
490
Other Decks in Programming
See All in Programming
バグを直したら useEffect が消えた
colorful12
3
800
ソフトウェアラスタライザ
fadis
1
760
FastAPI の並行処理モデルを完全に理解する
hoto17296
9
3.4k
Can LLMs Replicate 4 Years of Compose Migration? Exploring the boundaries of automation with 279 XML files from a real product
makun
0
120
30年振りにコンパイラの定数整数除算を改善した
herumi
9
4.4k
이 함수, 실패하면 어떻게 되나요? null부터 Rich Errors까지, Kotlin 에러 처리 15년
haeti2
0
110
ソフトウェアエンジニアにとっての生成AI - 特性を知って使い倒す / generative ai for software enginner
kishida
7
2.3k
夏だ!祭りだ!祭りとはドメインモデリングでは?
ryugen04
0
510
DroidKaigi 2026 「個人開発という実験場: Android エンジニアが手にする4つの自由」
slashnephy
0
180
PyO3 で既存 Python 評価器を Rust core 化する ー wasm-bindgen でブラウザにも配るための設計
kdash
1
190
Deep dive into the select statement (GopherCon UK)
jespino
0
170
源内ハンズオン概要編
hideg
0
240
Featured
See All Featured
Neural Spatial Audio Processing for Sound Field Analysis and Control
skoyamalab
0
440
How To Stay Up To Date on Web Technology
chriscoyier
790
250k
Bash Introduction
62gerente
615
220k
Documentation Writing (for coders)
carmenintech
77
5.5k
Connecting the Dots Between Site Speed, User Experience & Your Business [WebExpo 2025]
tammyeverts
11
1k
Bootstrapping a Software Product
garrettdimon
PRO
306
120k
Rails Girls Zürich Keynote
gr2m
96
14k
Breaking role norms: Why Content Design is so much more than writing copy - Taylor Woolridge
uxyall
1
390
A Soul's Torment
seathinner
7
3.5k
Test your architecture with Archunit
thirion
2
2.4k
Faster Mobile Websites
deanohume
310
32k
Exploring the relationship between traditional SERPs and Gen AI search
raygrieselhuber
PRO
2
4.3k
Transcript
Vertex AI Gen AI Evaluation Service の活用事例紹介 2026/03/05 「CA.ai#4 〜AIOpsの最前線〜」
株式会社サイバーエージェント MIU AI戦略本部 原 和希
1.自己紹介 2.今日皆さんに持ち帰って欲しいこと 3.事例①〜占いチャットアプリ〜 4.事例②〜記事校正支援用エージェント〜 5.まとめ
原 和希 株式会社サイバーエージェント / MIU AI戦略本部 AIエンジニア • Google Developer
Experts (Google Cloud: AI) • CyberAgent Developer Experts (Google Cloud/ ML) • X: @harappa80
LLMを使った機能・アプリケーションを 開発している方 ✋
出力評価 (LLM-as-a-Judgeとか) をしている方 ✋
今日皆さんに 持ち帰って欲しいこと
今日話すこと • 事例紹介 ◦ 出力評価の重要性 ◦ Vertex AI Gen AI
Evaluation Serviceの強み
LLMをサービスインする時に決めること • LLM • システムプロンプト • パラメータ etc. エージェントの場合は加えて、 •
ツール(とディスクリプション) これらは何度も出力・確認して調整していくもの
出力評価の必要性 前述の変数の決定に加えて... • あらゆるユーザー入力に対応できている? • 意図せぬ出力(意味不明な記号とか文字とか)は出ない? • プロンプトインジェクションなどの攻撃には堅牢? LLMは非決定論的振る舞いをするため、完璧な対応は難しいが、 サービス品質に関わる問題。可能な範囲での対策はしておくべき。
None
事例① 〜占いチャットアプリ〜
サービス •
直面していた課題
アーキテクチャ • LangChainをVertex AI SDKでラップ • 結果はGCSへ格納 ◦ → エンジニア:
専用アプリ(Streamlit), Notebook ◦ → ビジネスメンバー: スプレッドシート
アプローチ Rubric(評価基準 ) User prompt Response Vertex AI Gen AI
Evaluation Service LLM as a Judge スコア & 評価理由
Vertex AI Gen AI Evaluation Serviceの良いところ①
重要なポイント ① 専門家の暗黙知をルーブリックに落とし込む • 「理想の出力」とはどのようなものか? ◦ ドメイン専門家にヒアリング(こだわりや優位性) ◦ 定性評価からはじめて良し悪しを分解していく •
ルーブリックを継続的に改善していく ◦ 人手評価と LLM-as-a-Judge の結果を突き合わせて信頼性を検証
重要なポイント ② ユースケースを網羅したデータセットを作成 • 想定される入力に対して理想の出力を用意する ◦ 既存のデータが使用・参考にする • 10 件程度の高品質なデータセットからはじめて、徐々に増やす
• 品質担保のためのデータと改善領域にフォーカスした、チャレンジングな データを使う
None
事例② 〜記事校正支援用エージェント〜
現在開発しているアプリケーション とあるメディアサイトの記事校正支援用 AIエージェント 📝 • 業務効率化が目的 • 社内用のWebアプリケーションとして提供 • ADKで開発,
VertexAI AgentEngineへデプロイ
事例①の時からのアップデート • エージェントのための評価機能 ◦ Trajectory(軌跡) 評価 • 適応型ルーブリックが追加 ◦ 自動的にルーブリックリストを生成
◦ guidelinesパラメータでカスタマイズも可能 • SDKがGenAI Client(from vertexai import Client)に移行 ◦ 旧(from vertexai.evaluation import EvalTask)
課題 🤔 instructionやツール定義(説明文)が曖昧だと、 ツールを使わずに出力をしてしまうことがある 🤔 複数のサブエージェントがあり、 ルートエージェントが適切に呼び出しているかを評価したい
評価観点 1. ツールの実行内容・順序を評価 2. 最終出力を評価 Root Agent(LLMAgent) Agent-as-a-Tool① Agent-as-a-Tool② Tools
Agent-as-a-Tool③ Tools
評価観点 1. ツールの実行内容・順序を評価 2. 最終出力を評価 Sub AgentをAgent-as-a-Toolとして使用 Root Agent(LLMAgent) Agent-as-a-Tool①
Agent-as-a-Tool② Tools Agent-as-a-Tool③ オーケストレートに対しての Trajectory評価 Tools
評価観点 1. ツールの実行内容・順序を評価 2. 最終出力を評価 Root Agent(LLMAgent) Agent-as-a-Tool① Agent-as-a-Tool② Tools
Agent-as-a-Tool③ Tools Agent as a ToolはToolとして扱われるので eventが含まれない サブエージェント に対しての Trajectory評価
評価観点 1. ツールの実行内容・順序を評価 LLM as a Judge カスタム &適応型ルーブリック 2.
最終出力を評価 出力 Root Agent(LLMAgent) Agent-as-a-Tool① Agent-as-a-Tool② Tools Agent-as-a-Tool③ Tools
Vertex AI Gen AI Evaluation Serviceの良いところ② • ADK×AgentEngineとの親和性の高さ ◦ AgentEngineへのリクエスト〜評価をサポート
◦ 評価に必要なAgentのメタデータを簡単に渡せる ▪ メタデータ: instruction,ツール定義(関数名・引数・説明文)など ◦ 上記を考慮して、適応型ルーブリックが動的に基準を作成
まとめ
まとめ • AI機能をサービスインする際に出力評価は大切。 • Vertex AI Gen AI Evaluation Service
を使えばマネージドで実現可能 • 最も重要なのは「良い出力」を「言語化」 すること
None
None