Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
あんどお
November 10, 2025
Technology
0
16
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
Agent作るときにあると嬉しいOps周りのはなし
あんどお
November 10, 2025
Tweet
Share
More Decks by あんどお
See All by あんどお
Strands AgentsのEvaluatorをLangfuseにぶち込んでみた
andoooooo_bb
0
170
Other Decks in Technology
See All in Technology
Navigation APIと見るSvelteKitのWeb標準志向
yamanoku
2
120
Astro Islandsの 内部実装を 「日本で一番わかりやすく」 ざっくり解説!
knj
0
290
Physical AI on AWS リファレンスアーキテクチャ / Physical AI on AWS Reference Architecture
aws_shota
1
150
GitHub Actions侵害 — 相次ぐ事例を振り返り、次なる脅威に備える
flatt_security
2
1.6k
スピンアウト講座05_実践活用事例
overflowinc
0
1.3k
CREがSLOを握ると 何が変わるのか
nekomaho
0
120
Phase11_戦略的AI経営
overflowinc
0
1.7k
スピンアウト講座01_GitHub管理
overflowinc
0
1.5k
Zephyr(RTOS)でOpenPLCを実装してみた
iotengineer22
0
110
「AIエージェントで変わる開発プロセス―レビューボトルネックからの脱却」
lycorptech_jp
PRO
0
150
Phase01_AI座学_基礎
overflowinc
0
4.2k
スピンアウト講座02_ファイル管理
overflowinc
0
1.4k
Featured
See All Featured
Six Lessons from altMBA
skipperchong
29
4.2k
For a Future-Friendly Web
brad_frost
183
10k
Save Time (by Creating Custom Rails Generators)
garrettdimon
PRO
32
2.5k
The Hidden Cost of Media on the Web [PixelPalooza 2025]
tammyeverts
2
250
Taking LLMs out of the black box: A practical guide to human-in-the-loop distillation
inesmontani
PRO
3
2.1k
Navigating the moral maze — ethical principles for Al-driven product design
skipperchong
2
310
What does AI have to do with Human Rights?
axbom
PRO
1
2.1k
We Have a Design System, Now What?
morganepeng
55
8k
Making Projects Easy
brettharned
120
6.6k
Beyond borders and beyond the search box: How to win the global "messy middle" with AI-driven SEO
davidcarrasco
3
86
GitHub's CSS Performance
jonrohan
1032
470k
Impact Scores and Hybrid Strategies: The future of link building
tamaranovitovic
0
240
Transcript
Agentの「今、何してる?」がわかる! AgentOpsのはじめ方
はじめに 得られること - Agentってなんなの?の基礎知識 - 最近のAgentの使われ方とそれに伴う課題 - AgentOpsってどうやるの?langfuseを例にした説明 対象者 -
Agentに興味がある人 - Agent作ってみたけどいまいちうまくいかない人 - AgentOpsについて興味を持ち始めた人
こんなことありませんか、、、、、、??? Agentに仕事任せたら、いつの間にか変なことしてた あとよろしくー 働けや!! でも、なんでAgentがラリったのかわからないな、、、 どこの処理が異常なのかわからないのが問題
そもそもAgentってなに? Agentは抽象的な課題でも自分で試行錯誤して解決できる、シゴできくん ユーザの指示に従い出力を返す LLM:脳みそだけ 自律的に試行錯誤を繰り返し 目的を達成する Agent:脳みそ+自律 議事録をサマリして できません or
妄想で書きました (ハルシネーション) 議事録をサマリして できました 議事録どこ? いつのやつ? わからんなぁ 議事録どこ? いつのやつ? 自分で探そ 聞き返そ わかった!
そもそもAgentってなに? Agentを武器(tool)で強化したりチームを組ませたりできる チーム・組織を組ませる (Agent同士で連携) 武器で強化 (MCPなどで接続) slack Github Google Slides
などなど ボスAgent サブAgent
Agentの活用:ロープレ評価Agent ロープレ評価Agent ロープレAI 定性的な評価はAgent、定量的な評価はツールを用いて処理 ロープレの 会話履歴 [AIに与えられている情報] 役割、ロープレ手順、深掘りポイント 役割の評価Agent 計算ツール
まとめAgent 会話の流れ評価Agent
Agent開発での課題 異常が発生した時にどこを直せばいいのかわからない 調整・変更 役割の評価Agent 計算ツール まとめAgent 会話の流れ評価Agent 出力 入力 会話ログ
評価結果 実装1: 3点/100点 実装2: 95点/100点 実装3: 54点/100点 プロンプトチューニング、処理ロジック変更など 結果が めっちゃブレる
Agent開発での課題 異常が発生した時にどこを直せばいいのかわからない 役割評価Agent 計算ツール まとめAgent 会話の流れ評価Agent 出力 入力 会話ログ 評価結果
実装1: 3点/100点 実装2: 95点/100点 実装3: 54点/100点 【課題】 Agentの挙動が ブラックボックス どこが異常かわからない ↓ 直したくても直せない 調整・変更 プロンプトチューニング、処理ロジック変更など 結果が めっちゃブレる
Langfuseの登場 LangfuseはLLMやAgentの動きを可視化し、追跡できるようにするツール どんな情報が入力されたか どんな情報を取得したか どんなツールを使ったか? などが見えるようになる OSSでセルフホスト可能 通常プランでもプレミアムと近い 機能が利用可能 更新が活発でほぼ毎週アップデートあり
今回はメインの3つの機能をザクっとご紹介!!
Langfuseの機能:トレース Agentが何しているか?を表示してくれる機能 Agentの呼び出し LLMの呼び出し トレースの名前 トレース画面
Langfuseの機能:プロンプト管理 Agentへの指示(プロンプト)を管理しやすくする機能 バージョン管理も可能 タグの付け替えで 簡単にプロンプト変更 プロンプトの変更も簡単
Langfuseの機能:評価(LLM as a judge) Agentのアウトプットを評価してくれる機能 アウトプット 1 アウトプット 2 アウトプット
3 評価項目 (LLM as a judge) 評価結果 0.5 1.0 0.8 管理・検知 Agent アウトプット ダッシュボード
Langfuseの活用 機能を組み合わせるとプロンプトの試行錯誤は Biz側で回せる(かも) トレース プロンプト管理 プロンプトを 変更する 何が起きて るかみる Good/Badを
評価する 評価 Agentを 動かす