Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
Search
Sponsored
·
SiteGround - Reliable hosting with speed, security, and support you can count on.
→
あんどお
November 10, 2025
Technology
0
11
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
Agent作るときにあると嬉しいOps周りのはなし
あんどお
November 10, 2025
Tweet
Share
More Decks by あんどお
See All by あんどお
Strands AgentsのEvaluatorをLangfuseにぶち込んでみた
andoooooo_bb
0
140
Other Decks in Technology
See All in Technology
Exadata Fleet Update
oracle4engineer
PRO
0
1.1k
コスト削減から「セキュリティと利便性」を担うプラットフォームへ
sansantech
PRO
3
1.6k
私たち準委任PdEは2つのプロダクトに挑戦する ~ソフトウェア、開発支援という”二重”のプロダクトエンジニアリングの実践~ / 20260212 Naoki Takahashi
shift_evolve
PRO
2
200
Kiro IDEのドキュメントを全部読んだので地味だけどちょっと嬉しい機能を紹介する
khmoryz
0
210
登壇駆動学習のすすめ — CfPのネタの見つけ方と書くときに意識していること
bicstone
3
130
pool.ntp.orgに ⾃宅サーバーで 参加してみたら...
tanyorg
0
710
Oracle AI Database移行・アップグレード勉強会 - RAT活用編
oracle4engineer
PRO
0
110
Claude Code for NOT Programming
kawaguti
PRO
1
100
ランサムウェア対策としてのpnpm導入のススメ
ishikawa_satoru
0
220
【Ubie】AIを活用した広告アセット「爆速」生成事例 | AI_Ops_Community_Vol.2
yoshiki_0316
1
120
Agent Skils
dip_tech
PRO
0
130
usermode linux without MMU - fosdem2026 kernel devroom
thehajime
0
240
Featured
See All Featured
State of Search Keynote: SEO is Dead Long Live SEO
ryanjones
0
120
How to build a perfect <img>
jonoalderson
1
4.9k
Building Flexible Design Systems
yeseniaperezcruz
330
40k
Hiding What from Whom? A Critical Review of the History of Programming languages for Music
tomoyanonymous
2
430
[RailsConf 2023] Rails as a piece of cake
palkan
59
6.3k
AI Search: Implications for SEO and How to Move Forward - #ShenzhenSEOConference
aleyda
1
1.1k
Between Models and Reality
mayunak
1
190
Making Projects Easy
brettharned
120
6.6k
Discover your Explorer Soul
emna__ayadi
2
1.1k
ラッコキーワード サービス紹介資料
rakko
1
2.3M
A Soul's Torment
seathinner
5
2.3k
Amusing Abliteration
ianozsvald
0
100
Transcript
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
はじめに 得られること - Agentってなんなの?の基礎知識 - 最近のAgentの使われ方とそれに伴う課題 - AgentOpsってどうやるの?langfuseを例にした説明 対象者 -
Agentに興味がある人 - Agent作ってみたけどいまいちうまくいかない人 - AgentOpsについて興味を持ち始めた人
こんなことありませんか、、、、、、??? Agentに仕事任せたら、いつの間にか変なことしてた あとよろしくー 働けや!! でも、なんでAgentがラリったのかわからないな、、、 どこの処理が異常なのかわからないのが問題
そもそもAgentってなに? Agentは抽象的な課題でも自分で試行錯誤して解決できる、シゴできくん ユーザの指示に従い出力を返す LLM:脳みそだけ 自律的に試行錯誤を繰り返し 目的を達成する Agent:脳みそ+自律 議事録をサマリして できません or
妄想で書きました (ハルシネーション) 議事録をサマリして できました 議事録どこ? いつのやつ? わからんなぁ 議事録どこ? いつのやつ? 自分で探そ 聞き返そ わかった!
そもそもAgentってなに? Agentを武器(tool)で強化したりチームを組ませたりできる チーム・組織を組ませる (Agent同士で連携) 武器で強化 (MCPなどで接続) slack Github Google Slides
などなど ボスAgent サブAgent
Agentの活用:ロープレ評価Agent ロープレ評価Agent ロープレAI 定性的な評価はAgent、定量的な評価はツールを用いて処理 ロープレの 会話履歴 [AIに与えられている情報] 役割、ロープレ手順、深掘りポイント 役割の評価Agent 計算ツール
まとめAgent 会話の流れ評価Agent
Agent開発での課題 異常が発生した時にどこを直せばいいのかわからない 調整・変更 役割の評価Agent 計算ツール まとめAgent 会話の流れ評価Agent 出力 入力 会話ログ
評価結果 実装1: 3点/100点 実装2: 95点/100点 実装3: 54点/100点 プロンプトチューニング、処理ロジック変更など 結果が めっちゃブレる
Agent開発での課題 異常が発生した時にどこを直せばいいのかわからない 役割評価Agent 計算ツール まとめAgent 会話の流れ評価Agent 出力 入力 会話ログ 評価結果
実装1: 3点/100点 実装2: 95点/100点 実装3: 54点/100点 【課題】 Agentの挙動が ブラックボックス どこが異常かわからない ↓ 直したくても直せない 調整・変更 プロンプトチューニング、処理ロジック変更など 結果が めっちゃブレる
Langfuseの登場 LangfuseはLLMやAgentの動きを可視化し、追跡できるようにするツール どんな情報が入力されたか どんな情報を取得したか どんなツールを使ったか? などが見えるようになる OSSでセルフホスト可能 通常プランでもプレミアムと近い 機能が利用可能 更新が活発でほぼ毎週アップデートあり
今回はメインの3つの機能をザクっとご紹介!!
Langfuseの機能:トレース Agentが何しているか?を表示してくれる機能 Agentの呼び出し LLMの呼び出し トレースの名前 トレース画面
Langfuseの機能:プロンプト管理 Agentへの指示(プロンプト)を管理しやすくする機能 バージョン管理も可能 タグの付け替えで 簡単にプロンプト変更 プロンプトの変更も簡単
Langfuseの機能:評価(LLM as a judge) Agentのアウトプットを評価してくれる機能 アウトプット 1 アウトプット 2 アウトプット
3 評価項目 (LLM as a judge) 評価結果 0.5 1.0 0.8 管理・検知 Agent アウトプット ダッシュボード
Langfuseの活用 機能を組み合わせるとプロンプトの試行錯誤は Biz側で回せる(かも) トレース プロンプト管理 プロンプトを 変更する 何が起きて るかみる Good/Badを
評価する 評価 Agentを 動かす