Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
20260818_AgentCoreRecommendationは本当に効くの?
Search
Hiroshi Kato
August 18, 2026
690
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
20260818_AgentCoreRecommendationは本当に効くの?
Hiroshi Kato
August 18, 2026
More Decks by Hiroshi Kato
See All by Hiroshi Kato
20260822_晴れの国を守り続けることができるのか
kahiro
0
160
20260705_ADOTでLambdaを観測してみた.pdf
kahiro
0
64
TelemetryAPIでLambda関数の外側を覗く
kahiro
0
13
20260318_AIによるデザインレビュ〜「画像の美しさ」をスコアに変換する〜
kahiro
0
98
DurableExecutionを実装検証から理解する.pdf
kahiro
1
51
20260110_オンプレ思考からクラウドネイティブ思考への転換レシピ
kahiro
0
21
20251114_Amazon_Q_DeveloperでMCPを使う_最初の一歩__.pdf
kahiro
0
22
20250829_LambdaとStepFunctionsどちらを選ぶべき_コスト視点で考えてみる.pdf
kahiro
1
500
Step_Functions_をはじめよう_JSONataによる進化_.pdf
kahiro
2
170
Featured
See All Featured
Primal Persuasion: How to Engage the Brain for Learning That Lasts
tmiket
0
450
Discover your Explorer Soul
emna__ayadi
2
1.3k
Side Projects
sachag
456
43k
The Director’s Chair: Orchestrating AI for Truly Effective Learning
tmiket
1
300
A better future with KSS
kneath
240
18k
Building Applications with DynamoDB
mza
96
7.2k
jQuery: Nuts, Bolts and Bling
dougneiner
66
8.6k
Principles of Awesome APIs and How to Build Them.
keavy
128
18k
I Don’t Have Time: Getting Over the Fear to Launch Your Podcast
jcasabona
35
2.8k
Done Done
chrislema
186
16k
Building Experiences: Design Systems, User Experience, and Full Site Editing
marktimemedia
0
600
Building a A Zero-Code AI SEO Workflow
portentint
PRO
0
720
Transcript
AgentCore Recommendationは 本当に効くの? JAWS-UG 名古屋 2026年8月18日(火)
自己紹介 加藤 寛士(かとう ひろし) • クラウドエンジニア • JAWS-UG 名古屋運営 •
AWS community builders(serverless) @Hircha12
Recommendationとは? Build Deploy Assess エージェントを実装する Runtime に載せる 観測し、評価する Recommendation =
Assess の「最適化」機能 トレースを分析し、システムプロンプト・ツール説明の改善案を出す
検証内容 意図的に出来の悪いエージェントを作り、 Recommendationが改善案を出すことができるか 用意したエージェント ①基準 • • 明確なプロンプト 丁寧なツール説明 ②出来の悪いプロンプト
• 間違いを誘導する プロンプト ③出来の悪いツール説明 • 誤解を生むツール説明
基準となるエージェント 時刻ツール Runtime Strands Agents LLM: Haiku 4.5 システムプロンプト 計算ツール
基準となるエージェント:動かしてみる Q:今の東京の時刻は? あと37×19は? ①基準 A:東京の現在時刻:2026年x月x日 19時38分40秒、37×19=703
基準となるエージェント:観測してみる オブザーバビリティ:1実行 = 1トレース = 複数スパン
基準となるエージェント:観測詳細 Q:今の東京の時刻は? あと37×19は? 全体 2,926ms (1)リクエスト受信、Strandsエージェント起動 (2)mcp tools/list:使えるツール一覧を確認 (3)LLM① 判断:「時刻ツール+計算ツールを使う」と決める
279ms 68ms 1,280ms (4)時刻ツールを実行 4ms (5)計算ツールを実行 1ms (6)LLM② 回答生成:結果から「東京の現在時刻、37×19=703」を作る A:東京の現在時刻:2026年x月x日 19時38分40秒、37×19=703 1,294ms
出来の悪いエージェント ②出来の悪いプロンプト ③出来の悪いツール説明 時刻ツール システムプロンプト 計算ツール
出来の悪いエージェント:動かしてみる Q:今の東京の時刻は? あと37×19は? ①基準 ②出来の悪いプロンプト ③出来の悪いツール説明 A:東京の現在時刻:2026年x月x日 19時38分40秒、37×19=703 出来の悪いエージェントも正解を出力した
出来の悪いエージェント:動かしてみる Q:今の東京の時刻は? あと738×649は? ①基準 ②出来の悪いプロンプト ③出来の悪いツール説明 正解(478,962) 不正解(479,262) 正解(478,962) Q:今の東京の時刻は?
あと9876×5432は? ①基準 正解(53,646,432) ②出来の悪いプロンプト 不正解(53,661,632) 暗算し誤答する(稀に正解する) ③出来の悪いツール説明 正解(53,646,432)
出来の悪いエージェント:動かしてみる Q:今の東京の時刻は? あと37×19は? ①基準 総スパン:11 LLM呼び出し:2 ②出来の悪いプロンプト 総スパン:11 LLM呼び出し:2 ③出来の悪いツール説明
総スパン:15 LLM呼び出し:3 A:東京の現在時刻:2026年x月x日 19時38分40秒、37×19=703 正解=良いエージェントではない
出来の悪いツール説明:観測詳細 Q:今の東京の時刻は? あと37×19は? 正解に至るも、無駄なスパンが発生 ・実行時間が伸びる ・トークン量が増える (1)リクエスト受信、Strandsエージェント起動 (2)mcp tools/list:使えるツール一覧を確認 (3)LLM①
判断:「時刻ツール+計算ツールを使う」と決める (4)計算ツールを実行 (使えない文字:×をツールに渡してしまう) (5)時刻ツールを実行 (6)LLM② 判断:結果から「×を*に変更して計算ツールを再度使う」と決める (7)計算ツールを再実行 (8)LLM③ 回答生成:結果から「東京の現在時刻、37×19=703」を作る A:東京の現在時刻:2026年x月x日 19時38分40秒、37×19=703
観測結果の整理 ②出来の悪いプロンプト ぱっと見では正常、 内容を見ると誤答がある 内容を判断しないと 良し悪しが分からない 評価器を用いて Recommendation生成 トレースに客観的に 出力されている
トレースログから Recommendation生成 ③出来の悪いツール説明 ツールエラー・リトライ が発生している
トレースログからRecommendation生成 Recommendation作成 データソースに CloudWatchログを設定 実行
トレースログからRecommendation生成 対象となるツール名とツール説明を入力する
トレースログからRecommendation生成 エージェントとエンドポイントの自動設定が可能
トレースログからRecommendation生成 実行結果 推奨ツールの説明が生成される
評価器を用いてRecommendation生成 評価器を作成 Recommendation作成 データソースに CloudWatchログを設定 リワードシグナルに 作成した評価器を設定 実行
評価器を用いてRecommendation生成 どのように評価するのかを定義
評価器を用いてRecommendation生成 どのように採点するのかを定義
評価器を用いてRecommendation生成 対象となるシステムプロンプトを入力する
評価器を用いてRecommendation生成 作成した評価器を選択
評価器を用いてRecommendation生成 実行結果 推奨システムプロンプトが生成される
まとめ Recommendationは効いた →2種の欠陥とも、失敗を自動検知し、的確な改善案を生成した • LLMは軽度な出来の悪さを吸収してしまうことがある • 出来の悪さは誤答だけではなく、非効率(リトライ・レイテンシ・トークン増)でも現れる • 作って終わりではなく、運用データで検証を回すことが重要(Recommendationはその一部)