Upgrade to Pro — share decks privately, control downloads, hide ads and more …

【CA.ai #4】Vertex AI Gen AI Evaluation Service の...

【CA.ai #4】Vertex AI Gen AI Evaluation Service の活用事例紹介

Avatar for Kazuki Hara

Kazuki Hara

September 03, 2026

More Decks by Kazuki Hara

Other Decks in Programming

Transcript

  1. Vertex AI Gen AI Evaluation Service の活用事例紹介 2026/03/05 「CA.ai#4 〜AIOpsの最前線〜」

    株式会社サイバーエージェント MIU AI戦略本部 原 和希
  2. 原 和希 株式会社サイバーエージェント / MIU AI戦略本部 AIエンジニア • Google Developer

    Experts (Google Cloud: AI) • CyberAgent Developer Experts (Google Cloud/ ML) • X: @harappa80
  3. LLMをサービスインする時に決めること • LLM • システムプロンプト • パラメータ etc. エージェントの場合は加えて、 •

    ツール(とディスクリプション) これらは何度も出力・確認して調整していくもの
  4. アーキテクチャ • LangChainをVertex AI SDKでラップ • 結果はGCSへ格納 ◦ → エンジニア:

    専用アプリ(Streamlit), Notebook ◦ → ビジネスメンバー: スプレッドシート
  5. アプローチ Rubric(評価基準 ) User prompt Response Vertex AI Gen AI

    Evaluation Service LLM as a Judge スコア & 評価理由
  6. 事例①の時からのアップデート • エージェントのための評価機能 ◦ Trajectory(軌跡) 評価 • 適応型ルーブリックが追加 ◦ 自動的にルーブリックリストを生成

    ◦ guidelinesパラメータでカスタマイズも可能 • SDKがGenAI Client(from vertexai import Client)に移行 ◦ 旧(from vertexai.evaluation import EvalTask)
  7. 評価観点 1. ツールの実行内容・順序を評価 2. 最終出力を評価 Root Agent(LLMAgent) Agent-as-a-Tool① Agent-as-a-Tool② Tools

    Agent-as-a-Tool③ Tools Agent as a ToolはToolとして扱われるので eventが含まれない サブエージェント に対しての Trajectory評価
  8. 評価観点 1. ツールの実行内容・順序を評価 LLM as a Judge カスタム &適応型ルーブリック 2.

    最終出力を評価 出力 Root Agent(LLMAgent) Agent-as-a-Tool① Agent-as-a-Tool② Tools Agent-as-a-Tool③ Tools
  9. Vertex AI Gen AI Evaluation Serviceの良いところ② • ADK×AgentEngineとの親和性の高さ ◦ AgentEngineへのリクエスト〜評価をサポート

    ◦ 評価に必要なAgentのメタデータを簡単に渡せる ▪ メタデータ: instruction,ツール定義(関数名・引数・説明文)など ◦ 上記を考慮して、適応型ルーブリックが動的に基準を作成
  10. まとめ • AI機能をサービスインする際に出力評価は大切。 • Vertex AI Gen AI Evaluation Service

    を使えばマネージドで実現可能 • 最も重要なのは「良い出力」を「言語化」 すること