Upgrade to Pro — share decks privately, control downloads, hide ads and more …

AI Agent評価構築 webinar introduction

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest. →
Avatar for Keisuke Kamata Keisuke Kamata
September 09, 2026
250

AI Agent評価構築 webinar introduction

Avatar for Keisuke Kamata

Keisuke Kamata

September 09, 2026

More Decks by Keisuke Kamata

Transcript

  1. 1

  2. 2

  3. AI活用を事業成果につなげるために必要な開発環境 組織全体のAI活用目標: AI活用を事業成果につなげ、コスト削減と新規事業創出の両方を実現する 組織全体の AI活用に向けて進める AI Agent開発環境 • • •

    • • 1 AI Agent開発library 安全な実行環境整備 社内データ・ツールへのアクセス整備 利用モデルの配備 … 継続的な評価体系の構築 • AI Agentの最終的な課題解決率を高め、維持する た めに評価体系が必要となる。 • 評価には時間がかかり、何度も行うものであるの で、AI Agentの更新に迅速に対応できる属人化しな い(オフライン)評価体系を構築する必要がある。 • オフライン評価だけではカバーできないポイントが多 いため、開発時だけでなく、本番運用時の品質劣化 を検知するオンライン評価体制も必要になる。 2 自前, Azure, GCP, Azure … OpenAI, Claude, Open Weight Model… コスト最適化 • ROIを高めるには、 AI Agentが消費する APIコストを 把握し、削減対象を分析できるよう必要がある。 3 多くの AI Agentを開発・改善・保守する体制 の構築 • 増え続ける AI Agentの開発依頼に限られたエンジニ アで対応するために、 AI Agent開発基盤やテンプ レートの構築に加え、 Coding Agentも自律的な改善 プロセスを導入する必要がある。 4
  4. AI活用を事業成果につなげるために必要な開発環境 1 継続的な評価体系の構築 2 コスト最適化 多くの AI Agentを開発・改善・保守する体制 の構築 3

    実装する上で難しいポイント • どのように評価体系を構築すべきかが分からない。 • AI AgentのTraceに特化した Observabilityを行なって いない場合、分析に必要な十分な情報がない。 • • 短期の開発が乱立する中では、自作ワークフローが 増え、評価体系が個人に依存し、組織全体で統一化 されない。 Coding Agentを用いた自己改善の開発はまだ業界と して発展途上であるため、どこまで取り組めば良いか わからない。 • 技術の進化が速いため、コスト削減の方法を継続的 に把握し、具体的な施策に落とし込むことができな い。 • Harnessを作っても、 Repositoryが肥大化してしまう。 個人の工夫の範囲が多く、組織での共通化が進まな い。 W&B Weaveが提供する価値 • 組織で再現可能性があり、個人に依存しない評価体 • AI Agentの完全なトレースをすぐに行うことができる 系をバージョン管理しながら徐々に作ることができる ため、ツール利用のループなどの不具合を特定する • 必然的に個人に依存をしない Agent Opsを構築する ことができるので、引き継ぎを行いやすい ことができる • 可視化のためのコードなどを書く必要がなく、最小限 で幅広いケースに対応した評価体系を作ることがで きる • 本番運用時にすぐに使えるオンラインモニタリングを • W&B Skills/MCPを使い、 Coding Agentを使った効 率的なコスト分析も可能になる • Coding Agentを用いた Self Improvementのための HarnessにWeaveが入ることで、リポジトリが肥大化 しない、再利用可能なワークフローを作ることができ る 使って、本番で出てくるユーザーの不満や AI Agent の不具合にいち早く気づく体制を作ることができる 5
  5. AI活用を事業成果につなげるために必要な開発環境 1 継続的な評価体系の構築 2 コスト最適化 多くの AI Agentを開発・改善・保守する体制 の構築 3

    実装する上で難しいポイント どのように評価体系を構築すべきかが分からない。 9/10 • AI AgentのTraceに特化した Observabilityを行なって 9/30 • いない場合、分析に必要な十分な情報がない。 • 短期の開発が乱立する中では、自作ワークフローが 増え、評価体系が個人に依存し、組織全体で統一化 されない。 • 技術の進化が速いため、コスト削減の方法を継続的 に把握し、具体的な施策に落とし込むことができな い。 Coding Agentを用いた自己改善の開発はまだ業界と 6/18 • して発展途上であるため、どこまで取り組めば良いか わからない。 • Harnessを作っても、 Repositoryが肥大化してしまう。 個人の工夫の範囲が多く、組織での共通化が進まな い。 W&B Weaveが提供する価値 • 組織で再現可能性があり、個人に依存しない評価体 • AI Agentの完全なトレースをすぐに行うことができる 系をバージョン管理しながら徐々に作ることができる ため、ツール利用のループなどの不具合を特定する • 必然的に個人に依存をしない Agent Opsを構築する ことができるので、引き継ぎを行いやすい ことができる • 可視化のためのコードなどを書く必要がなく、最小限 で幅広いケースに対応した評価体系を作ることがで きる • 本番運用時にすぐに使えるオンラインモニタリングを • W&B Skills/MCPを使い、 Coding Agentを使った効 率的なコスト分析も可能になる • Coding Agentを用いた Self Improvementのための HarnessにWeaveが入ることで、リポジトリが肥大化 しない、再利用可能なワークフローを作ることができ る 使って、本番で出てくるユーザーの不満や AI Agent の不具合にいち早く気づく体制を作ることができる 6