Strands AgentsのEvaluatorをLangfuseにぶち込んでみた

Strands AgentsのEvaluatorを Langfuseにぶち込んでみた 2025/12/20 安藤弘輝

自己紹介安藤弘輝 Hiroki Ando # 所属システム本部 / テクノロジー戦略室
/ AI Agent開発チーム # 普段の業務内容・AI活用の推進・生成AIの評価基盤開発・生成AIを使ったサービスの開発 # 経歴等・通信キャリアで新規サービス企画・プロマネ・ベンチャーで与信スコアリングモデルの開発 # 趣味や一言脳筋としてトライアスロンやフルマラソンなどを通し、種々の限界に挑んでいます。最近はハンターハンターを読んで念能力開発のヒントを探してます。レバレジーズ株式会社

アジェンダ - 背景 - Strands AgentsのEvaluatorをLangfuseに入れてみた - まとめ

Agent作ったぞ！でも、、こんなことありませんか、、、、、、？？？ Agentに仕事任せたら、いつの間にか変なことしてたあとよろしくー働けや！！でも、なんでAgentが暴走したのかわからないな、、、 StandsのEvaluation機能とLangfuseを組み合わせたら解決できるのでは？

StrandsのEvaluation機能でAgentの動きを評価してみる Evaluation機能でAgentが正しい動きをしているかを数値で把握できる Input Agentの動作を評価 Evaluation機能 Agent Output スコア

Evaluatorの種類 No. Evaluator 評価観点評価内容 1 FaithfulnessEvaluator 忠実性エージェントの応答が会話履歴に対して忠実か 2
GoalSuccessRateEvaluator 目標達成率会話においてすべての目標が正常に達成されたか 3 HarmfulnessEvaluator 有害性エージェントの応答に有害コンテンツが含まれているか 4 HelpfulnessEvaluator 有用性ユーザーの視点から見たエージェントの応答の有用性 5 InteractionsEvaluator インタラクション精度マルチエージェントの各ステップの適切性、情報の流れ 6 OutputEvaluator 出力精度出力の内容、品質、期待される出力との一致度 7 ToolParameterAccuracyEvaluator ツールパラメータ精度コンテキストからの情報を忠実に使用しているか 8 ToolSelectionAccuracyEvaluator ツール選択精度適切なタイミングで適切なツールが選択されているか 9 TrajectoryEvaluator 実行経路タスク実行のステップやツールの順序の適切性 9つのEvaluatorがプリセットされている

Evaluatorの種類 No. Evaluator 評価観点評価内容 1 FaithfulnessEvaluator 忠実性エージェントの応答が会話履歴に対して忠実か 2
GoalSuccessRateEvaluator 目標達成率会話においてすべての目標が正常に達成されたか 3 HarmfulnessEvaluator 有害性エージェントの応答に有害コンテンツが含まれているか 4 HelpfulnessEvaluator 有用性ユーザーの視点から見たエージェントの応答の有用性 5 InteractionsEvaluator インタラクション精度マルチエージェントの各ステップの適切性、情報の流れ 6 OutputEvaluator 出力精度出力の内容、品質、期待される出力との一致度 7 ToolParameterAccuracyEvaluator ツールパラメータ精度コンテキストからの情報を忠実に使用しているか 8 ToolSelectionAccuracyEvaluator ツール選択精度適切なタイミングで適切なツールが選択されているか 9 TrajectoryEvaluator 実行経路タスク実行のステップやツールの順序の適切性 9つのEvaluatorがプリセットされている今回はこちらを利用

Agentが正しく四則演算できるか検証 4 * 5= 3 * 5 - 5 =
10 + 10 * 100 - 3 = AgentがToolsを利用して計算入力の準備実行経路(trajectory) [mul] [mul, sub] [add, mul, sub] add sub mul div 4 5 = 20 3 5 5 = 10 10 10 100 3 = 107 Tools 計算結果の取得 Step1 Agent実行と結果の取得 Step2 テストケース作成回答の作成テストケースの準備 [mul] [mul, sub] [add, mul, sub] 正解はこれ、、、 expected_trajectory Step3 Evaluation と可視化 Strands Agent この回答でテストしよう、、、 Evaluation機能 Langfuse 可視化

TrajectoryEvaluatorでAgent評価してみた Step1-1 : trajectory(実行経路)で利用するtoolを準備する Agentの実行経路で利用させる toolを定義する (今回はサンプルとして四則演算ツールを定義 )

TrajectoryEvaluatorでAgent評価してみた Step1-2 : Agentの実行と、出力されたresponseからtrajectory(実行経路)を取得する Agentの responseを取得 responseから trajectoryを取得

TrajectoryEvaluatorでAgent評価してみた Step2 : 回答となるexpected_trajectory(実行経路)を含めたテストケースを作成 expected_trajectoryを取得するテストケースを作成する

TrajectoryEvaluatorでAgent評価してみた Step3-1 : Agentの出力と期待する回答となるexpected_trajectoryの一致度を評価する評価の実行

スコア: [1.0] 総合スコア: 1.0 テスト合否: [True] テストケース: [{'input': '4 *
5=', 'actual_output': 'The result of 4 * 5 is 20.\n', 'name': 'single', 'expected_output': None, 'expected_trajectory': ['mul'], 'actual_trajectory': [{'name': 'mul', 'input': {'a': 4, 'b': 5}, 'tool_result': '20'}], 'metadata': None, 'actual_interactions': None, 'expected_interactions': None}] 評価理由: ["The AI agent used the multiplication tool ('mul') exactly ~~ 割愛 ~~ expected trajectory."] 詳細結果: [[EvaluationOutput(score=1.0, test_pass=True, reason="The ~~ 割愛 ~~, label='Perfect Match')]] TrajectoryEvaluatorでAgent評価してみた Step3-2 : 結果を確認する評価結果：Agentの動作結果と回答が完全に一致　→Agentが正しく指示通りに動作したことが確認できる

評価結果をLangfuseにぶち込んでみる LLMOpsに特化したLangfuseでは、評価結果をGUIでまとめて確認できるので便利 run_experiment機能は複数の evaluatorクラスをオブジェクトとして扱えるため複数evaluatorを利用して色々な観点で評価したい場合にとても便利 ◼langfuseのrun_experiment機能の使用例

Evaluationの結果をrun_experimentのデータ形式に合うように整形する整形はとっても簡単！StrandのEvaluation結果のoverall_scoreとreasonsをrun_experimentの value, commentに入力するだけ！評価結果 Langfuseの run_experimentクラスに引数を渡す LangfuseのUI 評価結果のコメント(理由など)
評価結果(score)

まとめ - Strands Agentのevaluation機能は多機能で優秀なEvaluator - Langfuseの評価機能への組み込みも簡単で他の Evaluatorとも簡単に併用できる Agentの評価に正解はないですがいろんなツールを試して地道にベストプラクティスを模索していきます！！

Strands AgentsのEvaluatorをLangfuseにぶち込んでみた

Strands AgentsのEvaluatorをLangfuseにぶち込んでみた

あんどお

More Decks by あんどお

Other Decks in Technology

Featured

Transcript