Upgrade to Pro — share decks privately, control downloads, hide ads and more …

AI Agent評価構築 webinar introduction

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
Avatar for Keisuke Kamata Keisuke Kamata
September 09, 2026
120

AI Agent評価構築 webinar introduction

Avatar for Keisuke Kamata

Keisuke Kamata

September 09, 2026

More Decks by Keisuke Kamata

Transcript

  1. 1

  2. 2

  3. AI活用を事業成果につなげるために必要な開発環境 組織全体のAI活用目標: AI活用を事業成果につなげ、コスト削減と新規事業創出の両方を実現する 組織全体の AI活用に向けて進める AI Agent開発環境 • • •

    • • 1 AI Agent開発library 安全な実行環境整備 社内データ・ツールへのアクセス整備 利用モデルの配備 … 継続的な評価体系の構築 • AI Agentの最終的な課題解決率を高め、維持する た めに評価体系が必要となる。 • 評価には時間がかかり、何度も行うものであるの で、AI Agentの更新に迅速に対応できる属人化しな い(オフライン)評価体系を構築する必要がある。 • オフライン評価だけではカバーできないポイントが多 いため、開発時だけでなく、本番運用時の品質劣化 を検知するオンライン評価体制も必要になる。 2 自前, Azure, GCP, Azure … OpenAI, Claude, Open Weight Model… コスト最適化 • ROIを高めるには、 AI Agentが消費する APIコストを 把握し、削減対象を分析できるよう必要がある。 3 多くの AI Agentを開発・改善・保守する体制 の構築 • 増え続ける AI Agentの開発依頼に限られたエンジニ アで対応するために、 AI Agent開発基盤やテンプ レートの構築に加え、 Coding Agentも自律的な改善 プロセスを導入する必要がある。 4
  4. AI活用を事業成果につなげるために必要な開発環境 1 継続的な評価体系の構築 2 コスト最適化 多くの AI Agentを開発・改善・保守する体制 の構築 3

    実装する上で難しいポイント • どのように評価体系を構築すべきかが分からない。 • AI AgentのTraceに特化した Observabilityを行なって いない場合、分析に必要な十分な情報がない。 • • 短期の開発が乱立する中では、自作ワークフローが 増え、評価体系が個人に依存し、組織全体で統一化 されない。 Coding Agentを用いた自己改善の開発はまだ業界と して発展途上であるため、どこまで取り組めば良いか わからない。 • 技術の進化が速いため、コスト削減の方法を継続的 に把握し、具体的な施策に落とし込むことができな い。 • Harnessを作っても、 Repositoryが肥大化してしまう。 個人の工夫の範囲が多く、組織での共通化が進まな い。 W&B Weaveが提供する価値 • 組織で再現可能性があり、個人に依存しない評価体 • AI Agentの完全なトレースをすぐに行うことができる 系をバージョン管理しながら徐々に作ることができる ため、ツール利用のループなどの不具合を特定する • 必然的に個人に依存をしない Agent Opsを構築する ことができるので、引き継ぎを行いやすい ことができる • 可視化のためのコードなどを書く必要がなく、最小限 で幅広いケースに対応した評価体系を作ることがで きる • 本番運用時にすぐに使えるオンラインモニタリングを • W&B Skills/MCPを使い、 Coding Agentを使った効 率的なコスト分析も可能になる • Coding Agentを用いた Self Improvementのための HarnessにWeaveが入ることで、リポジトリが肥大化 しない、再利用可能なワークフローを作ることができ る 使って、本番で出てくるユーザーの不満や AI Agent の不具合にいち早く気づく体制を作ることができる 5
  5. AI活用を事業成果につなげるために必要な開発環境 1 継続的な評価体系の構築 2 コスト最適化 多くの AI Agentを開発・改善・保守する体制 の構築 3

    実装する上で難しいポイント どのように評価体系を構築すべきかが分からない。 9/10 • AI AgentのTraceに特化した Observabilityを行なって 9/30 • いない場合、分析に必要な十分な情報がない。 • 短期の開発が乱立する中では、自作ワークフローが 増え、評価体系が個人に依存し、組織全体で統一化 されない。 • 技術の進化が速いため、コスト削減の方法を継続的 に把握し、具体的な施策に落とし込むことができな い。 Coding Agentを用いた自己改善の開発はまだ業界と 6/18 • して発展途上であるため、どこまで取り組めば良いか わからない。 • Harnessを作っても、 Repositoryが肥大化してしまう。 個人の工夫の範囲が多く、組織での共通化が進まな い。 W&B Weaveが提供する価値 • 組織で再現可能性があり、個人に依存しない評価体 • AI Agentの完全なトレースをすぐに行うことができる 系をバージョン管理しながら徐々に作ることができる ため、ツール利用のループなどの不具合を特定する • 必然的に個人に依存をしない Agent Opsを構築する ことができるので、引き継ぎを行いやすい ことができる • 可視化のためのコードなどを書く必要がなく、最小限 で幅広いケースに対応した評価体系を作ることがで きる • 本番運用時にすぐに使えるオンラインモニタリングを • W&B Skills/MCPを使い、 Coding Agentを使った効 率的なコスト分析も可能になる • Coding Agentを用いた Self Improvementのための HarnessにWeaveが入ることで、リポジトリが肥大化 しない、再利用可能なワークフローを作ることができ る 使って、本番で出てくるユーザーの不満や AI Agent の不具合にいち早く気づく体制を作ることができる 6