$30 off During Our Annual Pro Sale. View Details »
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
Search
あんどお
November 10, 2025
Technology
0
6
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
Agent作るときにあると嬉しいOps周りのはなし
あんどお
November 10, 2025
Tweet
Share
More Decks by あんどお
See All by あんどお
Strands AgentsのEvaluatorをLangfuseにぶち込んでみた
andoooooo_bb
0
78
Other Decks in Technology
See All in Technology
AgentCoreとStrandsで社内d払いナレッジボットを作った話
motojimayu
1
380
「図面」から「法則」へ 〜メタ視点で読み解く現代のソフトウェアアーキテクチャ〜
scova0731
0
430
Identity Management for Agentic AI 解説
fujie
0
290
Agent Skillsがハーネスの垣根を超える日
gotalab555
5
2.2k
AIBuildersDay_track_A_iidaxs
iidaxs
3
680
AlmaLinux + KVM + Cockpit で始めるお手軽仮想化基盤 ~ 開発環境などでの利用を想定して ~
koedoyoshida
0
130
Databricks向けJupyter Kernelでデータサイエンティストの開発環境をAI-Readyにする / Data+AI World Tour Tokyo After Party
genda
1
620
M&Aで拡大し続けるGENDAのデータ活用を促すためのDatabricks権限管理 / AEON TECH HUB #22
genda
0
140
20251218_AIを活用した開発生産性向上の全社的な取り組みの進め方について / How to proceed with company-wide initiatives to improve development productivity using AI
yayoi_dd
0
480
SQLだけでマイグレーションしたい!
makki_d
0
1.1k
20251222_サンフランシスコサバイバル術
ponponmikankan
2
120
AIの長期記憶と短期記憶の違いについてAgentCoreを例に深掘ってみた
yakumo
4
470
Featured
See All Featured
JAMstack: Web Apps at Ludicrous Speed - All Things Open 2022
reverentgeek
1
290
Chrome DevTools: State of the Union 2024 - Debugging React & Beyond
addyosmani
9
1k
Digital Projects Gone Horribly Wrong (And the UX Pros Who Still Save the Day) - Dean Schuster
uxyall
0
100
The #1 spot is gone: here's how to win anyway
tamaranovitovic
1
860
For a Future-Friendly Web
brad_frost
180
10k
Dominate Local Search Results - an insider guide to GBP, reviews, and Local SEO
greggifford
PRO
0
12
Conquering PDFs: document understanding beyond plain text
inesmontani
PRO
4
2.1k
Lessons Learnt from Crawling 1000+ Websites
charlesmeaden
0
940
YesSQL, Process and Tooling at Scale
rocio
174
15k
Practical Tips for Bootstrapping Information Extraction Pipelines
honnibal
25
1.7k
Product Roadmaps are Hard
iamctodd
PRO
55
12k
DevOps and Value Stream Thinking: Enabling flow, efficiency and business value
helenjbeal
1
64
Transcript
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
はじめに 得られること - Agentってなんなの?の基礎知識 - 最近のAgentの使われ方とそれに伴う課題 - AgentOpsってどうやるの?langfuseを例にした説明 対象者 -
Agentに興味がある人 - Agent作ってみたけどいまいちうまくいかない人 - AgentOpsについて興味を持ち始めた人
こんなことありませんか、、、、、、??? Agentに仕事任せたら、いつの間にか変なことしてた あとよろしくー 働けや!! でも、なんでAgentがラリったのかわからないな、、、 どこの処理が異常なのかわからないのが問題
そもそもAgentってなに? Agentは抽象的な課題でも自分で試行錯誤して解決できる、シゴできくん ユーザの指示に従い出力を返す LLM:脳みそだけ 自律的に試行錯誤を繰り返し 目的を達成する Agent:脳みそ+自律 議事録をサマリして できません or
妄想で書きました (ハルシネーション) 議事録をサマリして できました 議事録どこ? いつのやつ? わからんなぁ 議事録どこ? いつのやつ? 自分で探そ 聞き返そ わかった!
そもそもAgentってなに? Agentを武器(tool)で強化したりチームを組ませたりできる チーム・組織を組ませる (Agent同士で連携) 武器で強化 (MCPなどで接続) slack Github Google Slides
などなど ボスAgent サブAgent
Agentの活用:ロープレ評価Agent ロープレ評価Agent ロープレAI 定性的な評価はAgent、定量的な評価はツールを用いて処理 ロープレの 会話履歴 [AIに与えられている情報] 役割、ロープレ手順、深掘りポイント 役割の評価Agent 計算ツール
まとめAgent 会話の流れ評価Agent
Agent開発での課題 異常が発生した時にどこを直せばいいのかわからない 調整・変更 役割の評価Agent 計算ツール まとめAgent 会話の流れ評価Agent 出力 入力 会話ログ
評価結果 実装1: 3点/100点 実装2: 95点/100点 実装3: 54点/100点 プロンプトチューニング、処理ロジック変更など 結果が めっちゃブレる
Agent開発での課題 異常が発生した時にどこを直せばいいのかわからない 役割評価Agent 計算ツール まとめAgent 会話の流れ評価Agent 出力 入力 会話ログ 評価結果
実装1: 3点/100点 実装2: 95点/100点 実装3: 54点/100点 【課題】 Agentの挙動が ブラックボックス どこが異常かわからない ↓ 直したくても直せない 調整・変更 プロンプトチューニング、処理ロジック変更など 結果が めっちゃブレる
Langfuseの登場 LangfuseはLLMやAgentの動きを可視化し、追跡できるようにするツール どんな情報が入力されたか どんな情報を取得したか どんなツールを使ったか? などが見えるようになる OSSでセルフホスト可能 通常プランでもプレミアムと近い 機能が利用可能 更新が活発でほぼ毎週アップデートあり
今回はメインの3つの機能をザクっとご紹介!!
Langfuseの機能:トレース Agentが何しているか?を表示してくれる機能 Agentの呼び出し LLMの呼び出し トレースの名前 トレース画面
Langfuseの機能:プロンプト管理 Agentへの指示(プロンプト)を管理しやすくする機能 バージョン管理も可能 タグの付け替えで 簡単にプロンプト変更 プロンプトの変更も簡単
Langfuseの機能:評価(LLM as a judge) Agentのアウトプットを評価してくれる機能 アウトプット 1 アウトプット 2 アウトプット
3 評価項目 (LLM as a judge) 評価結果 0.5 1.0 0.8 管理・検知 Agent アウトプット ダッシュボード
Langfuseの活用 機能を組み合わせるとプロンプトの試行錯誤は Biz側で回せる(かも) トレース プロンプト管理 プロンプトを 変更する 何が起きて るかみる Good/Badを
評価する 評価 Agentを 動かす