Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Bedrock RAG Evaluationを活用したRAGの定量的評価方法の紹介
Search
Yodeee
December 05, 2024
Technology
350
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Bedrock RAG Evaluationを活用した RAGの定量的評価方法の紹介
Yodeee
December 05, 2024
More Decks by Yodeee
See All by Yodeee
OCI上で実現するAIエージェント開発方法の紹介
yodeee
0
51
re:Inventから見えたレガシーモダナイぜーションのこれから
yodeee
0
160
Moxie
yodeee
0
26
Agents for Amazon Bedrockで何ができるようになるのか
yodeee
2
1.2k
Amazon Verified Permissionsをプロダクトにどう組み込むかを考える
yodeee
0
230
アウトプットし始めたら QOL (Quality of Learning) が爆上がりした話
yodeee
0
140
Pulumi AIで開発体験は変わるのか
yodeee
0
120
GPT × Alexa × AWS で 英会話学習スキルを作った話
yodeee
0
310
Other Decks in Technology
See All in Technology
Alphaモジュール使っていいのかい!?いけないのかい!?どっちなんだいっ!?
watany
1
320
reFACToring
moznion
0
220
AI x 開発生産性を取り巻く予算戦略と投資対効果
i35_267
7
3.1k
伝票作成AIエージェントを支える、LLMOpsとインフラの選択肢 / AICon2026_takeda
rakus_dev
0
270
仕様駆動開発、導入半年。「本当に速くなってるの?」にデータで答える / AICon2026_hirakawa
rakus_dev
0
330
データと地図で読む 大井町の「かわるもの、かわらないもの」
yoshiyama_hana
0
160
”AIを使う” から ”AIに任せる” へ ─ 開発プロセスを再設計してAIを組織標準にするまで
cyberagentdevelopers
PRO
2
140
AI時代のPlaywright活用(システムテストを自動化する ー 実行エンジンにPla ywrightを選んだ理由)
ynisqa1988
2
990
AI Coding Agent時代のcdk-nagガードレール 〜組織ルールを強制CIで守り抜く設計の挑戦〜
mhrtech
3
520
どこまでAIに任せるか 〜確率論と決定論の境界決定〜
shukob
0
500
大量データに対しても、生成AIを用いてリーズナブルにデータ加工をしたい!Databricksのai_queryについて調べてみた
kamoshika
2
290
AmplifyHostingConstructからSSRフレームワークのためのホスティング設計を考察する/amplify-hosting-construct
fossamagna
1
310
Featured
See All Featured
Designing for humans not robots
tammielis
254
26k
SEO for Brand Visibility & Recognition
aleyda
0
4.6k
[RailsConf 2023 Opening Keynote] The Magic of Rails
eileencodes
31
10k
Visualizing Your Data: Incorporating Mongo into Loggly Infrastructure
mongodb
49
10k
State of Search Keynote: SEO is Dead Long Live SEO
ryanjones
0
220
Sam Torres - BigQuery for SEOs
techseoconnect
PRO
0
440
A designer walks into a library…
pauljervisheath
211
24k
Sharpening the Axe: The Primacy of Toolmaking
bcantrill
46
2.9k
Claude Code どこまでも/ Claude Code Everywhere
nwiizo
65
57k
Jamie Indigo - Trashchat’s Guide to Black Boxes: Technical SEO Tactics for LLMs
techseoconnect
PRO
0
520
Leading Effective Engineering Teams in the AI Era
addyosmani
9
2.2k
Why Mistakes Are the Best Teachers: Turning Failure into a Pathway for Growth
auna
0
190
Transcript
Bedrock RAG Evaluationを活用した RAGの定量的評価方法の紹介 ~ハンズオン参加レポート~ Fin-JAWS 第37回 ~re:Invent ラスベガス現地開催
依田 涼太 Ryota YODA • 金融系ソフトウェアを設計、開発 • 現在は米国シリコンバレーでAI等の 先端技術の調査・開発を担当 •
re:Invent初参加 (ホテル間の距離を全く計算しておらず、い くつかのセッション聞き逃した) @YodeeeTech
生成AIにおけるRAG評価の重要性 • 金融機関のAI利用アンケートによると 「情報検索」分野のAI活用において、期 待を下回るという評価がされている • 金融におけるAI活用では、誤った情報に よる回答生成を避けるためにもRAGの継 続的かつ定量的な評価が不可欠 日本銀行
2024年10月 「金融機関における生成AIの 利用状況とリ スク管理 -アンケート調査結果」 https://www.boj.or.jp/research/brp/fsr/data/fsrb241021-1.pdf
Bedrock Knowledge Bases の RAG Evaluation機能が Preview リリース (米国時間12/1に発表) https://aws.amazon.com/about-aws/whats-new/2024/12/amazon-bedrock-knowledge-bases-rag-evaluation-preview/
RAG評価機能は①データの取り出し (Retrieval)と ②生成 (Generation)の評価を行う ① ②
RAGの評価には下記の項目が使用 + Coherence
• 新機能のKnowledge Base RAG Evaluation機能を活用し、 データ取得結果と生成結果を評価がどのように行え るのかを検証する ハンズオンセッションの概要 ~ AIM311
Evaluate the performance of your generative AI app in Amazon Bedrock ~
Step1: テストデータとしてJSONL形式で用意し、S3に格納 { "conversationTurns": [{ "prompt": { "content": [{ "text":
"Calculate the year-over-year percentage change in cash and cash equivalents for Octank Financial from 2020 to 2021." }] }, "referenceResponses": [{ "content": [{ "text": "2020 cash and cash equivalents: $350 million, 2021 cash and cash equivalents: $480 million, Percentage change = (2021 value - 2020 value) / 2020 value * 100 = ($480 million - $350 million) / $350 million * 100 = 37.14% increase" }] }] }] } プロンプト文 正解文
Step2: 評価モデルや評価メトリクスを設定する 評価する際に使用するモデルの設定 評価メトリクスの設定
事前に定義した評価項目のスコア結果を コンソール上で確認可能 設定した評価項目ごとのスコア 複数の評価結果を比較可能
評価結果はS3にJSONL形式で出力されるため、 BIツールやPythonを使用した独自の分析が可能
• RAG Evaluation機能により、Knowledge Baseからの取得結果、 LLMによる生成結果を複数の観点で定量的に評価できるようになった • 現状は自分でテストデータを作成し、S3に格納する必要がある。 Guardrail機能への統合などにより、使いやすくなるかも • ユースケースとしてはLLM
Opsに組み込み、RAGの自動テストなどの 活用が考えられる まとめ