Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
Search
Sponsored
·
Ship Features Fearlessly
Turn features on and off without deploys. Used by thousands of Ruby developers.
→
あんどお
November 10, 2025
Technology
18
0
Share
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
Agent作るときにあると嬉しいOps周りのはなし
あんどお
November 10, 2025
More Decks by あんどお
See All by あんどお
Strands AgentsのEvaluatorをLangfuseにぶち込んでみた
andoooooo_bb
0
190
Other Decks in Technology
See All in Technology
大規模環境でどのように監視を実現する?
yuobayashi
1
140
Kaggle未経験社員をメダリストに育てる「AIドラゴン桜」
lycorptech_jp
PRO
0
550
A Harness for Behaviour: how to get AI to generate code that does what we intend, or "TDD in the age of AI"
xpmatteo
0
410
JavaScript実装の自作プログラミング言語をTypeScript実装に移行した話
keisukeikeda
1
150
自称宇宙最速で不合格となったAIP-C01にリベンジを果たすべくAIで問題集アプリを作ってみた。
yama3133
0
120
Claude Code x Accounting
kawaguti
PRO
1
320
シンデレラなんかになりたくない!ガラスの靴が割れた時代にどう歩く?
nomizone
0
190
権限管理設計を完全に理解した
rsugi
1
200
TypeScript で Platform SDK を作る技術
toiroakr
1
270
ECSのTerraformモジュールにコントリビュートした話
harukasakihara
1
340
まだ道半ば、AI-DLCを歩み始めている話
news_it_enj
2
170
業務に残された「良くない型」で考える「TypeScriptの難しさ」
sajikix
3
2k
Featured
See All Featured
Making Projects Easy
brettharned
120
6.6k
Code Review Best Practice
trishagee
74
20k
Building Better People: How to give real-time feedback that sticks.
wjessup
370
20k
Chasing Engaging Ingredients in Design
codingconduct
0
190
Understanding Cognitive Biases in Performance Measurement
bluesmoon
32
2.9k
Dealing with People You Can't Stand - Big Design 2015
cassininazir
367
27k
Balancing Empowerment & Direction
lara
6
1.1k
Evolving SEO for Evolving Search Engines
ryanjones
0
200
Facilitating Awesome Meetings
lara
57
6.9k
Speed Design
sergeychernyshev
33
1.7k
End of SEO as We Know It (SMX Advanced Version)
ipullrank
3
4.2k
AI: The stuff that nobody shows you
jnunemaker
PRO
7
660
Transcript
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
はじめに 得られること - Agentってなんなの?の基礎知識 - 最近のAgentの使われ方とそれに伴う課題 - AgentOpsってどうやるの?langfuseを例にした説明 対象者 -
Agentに興味がある人 - Agent作ってみたけどいまいちうまくいかない人 - AgentOpsについて興味を持ち始めた人
こんなことありませんか、、、、、、??? Agentに仕事任せたら、いつの間にか変なことしてた あとよろしくー 働けや!! でも、なんでAgentがラリったのかわからないな、、、 どこの処理が異常なのかわからないのが問題
そもそもAgentってなに? Agentは抽象的な課題でも自分で試行錯誤して解決できる、シゴできくん ユーザの指示に従い出力を返す LLM:脳みそだけ 自律的に試行錯誤を繰り返し 目的を達成する Agent:脳みそ+自律 議事録をサマリして できません or
妄想で書きました (ハルシネーション) 議事録をサマリして できました 議事録どこ? いつのやつ? わからんなぁ 議事録どこ? いつのやつ? 自分で探そ 聞き返そ わかった!
そもそもAgentってなに? Agentを武器(tool)で強化したりチームを組ませたりできる チーム・組織を組ませる (Agent同士で連携) 武器で強化 (MCPなどで接続) slack Github Google Slides
などなど ボスAgent サブAgent
Agentの活用:ロープレ評価Agent ロープレ評価Agent ロープレAI 定性的な評価はAgent、定量的な評価はツールを用いて処理 ロープレの 会話履歴 [AIに与えられている情報] 役割、ロープレ手順、深掘りポイント 役割の評価Agent 計算ツール
まとめAgent 会話の流れ評価Agent
Agent開発での課題 異常が発生した時にどこを直せばいいのかわからない 調整・変更 役割の評価Agent 計算ツール まとめAgent 会話の流れ評価Agent 出力 入力 会話ログ
評価結果 実装1: 3点/100点 実装2: 95点/100点 実装3: 54点/100点 プロンプトチューニング、処理ロジック変更など 結果が めっちゃブレる
Agent開発での課題 異常が発生した時にどこを直せばいいのかわからない 役割評価Agent 計算ツール まとめAgent 会話の流れ評価Agent 出力 入力 会話ログ 評価結果
実装1: 3点/100点 実装2: 95点/100点 実装3: 54点/100点 【課題】 Agentの挙動が ブラックボックス どこが異常かわからない ↓ 直したくても直せない 調整・変更 プロンプトチューニング、処理ロジック変更など 結果が めっちゃブレる
Langfuseの登場 LangfuseはLLMやAgentの動きを可視化し、追跡できるようにするツール どんな情報が入力されたか どんな情報を取得したか どんなツールを使ったか? などが見えるようになる OSSでセルフホスト可能 通常プランでもプレミアムと近い 機能が利用可能 更新が活発でほぼ毎週アップデートあり
今回はメインの3つの機能をザクっとご紹介!!
Langfuseの機能:トレース Agentが何しているか?を表示してくれる機能 Agentの呼び出し LLMの呼び出し トレースの名前 トレース画面
Langfuseの機能:プロンプト管理 Agentへの指示(プロンプト)を管理しやすくする機能 バージョン管理も可能 タグの付け替えで 簡単にプロンプト変更 プロンプトの変更も簡単
Langfuseの機能:評価(LLM as a judge) Agentのアウトプットを評価してくれる機能 アウトプット 1 アウトプット 2 アウトプット
3 評価項目 (LLM as a judge) 評価結果 0.5 1.0 0.8 管理・検知 Agent アウトプット ダッシュボード
Langfuseの活用 機能を組み合わせるとプロンプトの試行錯誤は Biz側で回せる(かも) トレース プロンプト管理 プロンプトを 変更する 何が起きて るかみる Good/Badを
評価する 評価 Agentを 動かす