Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Bedrock RAG Evaluationを活用したRAGの定量的評価方法の紹介
Search
Yodeee
December 05, 2024
Technology
360
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Bedrock RAG Evaluationを活用した RAGの定量的評価方法の紹介
Yodeee
December 05, 2024
More Decks by Yodeee
See All by Yodeee
OCI上で実現するAIエージェント開発方法の紹介
yodeee
0
59
re:Inventから見えたレガシーモダナイぜーションのこれから
yodeee
0
160
Moxie
yodeee
0
26
Agents for Amazon Bedrockで何ができるようになるのか
yodeee
2
1.2k
Amazon Verified Permissionsをプロダクトにどう組み込むかを考える
yodeee
0
230
アウトプットし始めたら QOL (Quality of Learning) が爆上がりした話
yodeee
0
140
Pulumi AIで開発体験は変わるのか
yodeee
0
120
GPT × Alexa × AWS で 英会話学習スキルを作った話
yodeee
0
310
Other Decks in Technology
See All in Technology
案件に一番詳しいAIを Amazon Bedrock AgentCore で作る ― 知見が知見を生むチームへ / Compounding Knowledge with AgentCore
yusukeshimizu
1
140
DatadogのBits Chatが開発組織にもたらしたもの / What Bits Chat Has Brought Us
sms_tech
1
280
Software Supply Chain Attackからクラウド環境を守るためにできること
lhazy
2
280
Digitization部 紹介資料
sansan33
PRO
2
7.7k
今こそ聞きたいソフトウェア設計 ドメイン駆動設計再入門
masuda220
PRO
17
7.6k
少人数チームで実現する、大規模AWSサーバーレス基盤における"揺らがない"信頼性運用
maimyyym
1
110
モバイルアプリ開発概論2026
recruitengineers
PRO
6
650
Webアクセシビリティ入門 2026
recruitengineers
PRO
3
640
【CEDEC2026】コードレビュー支援ツール開発から学ぶ:LLMを用いた業務システムの実践的な運用設計と誤出力対策
cygames
PRO
0
850
SO-101×VLAによる3色キューブのピック&プレース
abeja
0
220
Bits AI を制するものは Datadog を制す / The player that controls Bits AI, controls Datadog
kaminashi
0
120
[ChatGPT Work LT]事務作業が苦手な人のための バックオフィスの「半」自動化
chimaki_iot
0
310
Featured
See All Featured
Applied NLP in the Age of Generative AI
inesmontani
PRO
4
2.4k
16th Malabo Montpellier Forum Presentation
akademiya2063
PRO
0
350
How to Get Subject Matter Experts Bought In and Actively Contributing to SEO & PR Initiatives.
livdayseo
0
170
Visualizing Your Data: Incorporating Mongo into Loggly Infrastructure
mongodb
49
10k
Stop Working from a Prison Cell
hatefulcrawdad
274
21k
The innovator’s Mindset - Leading Through an Era of Exponential Change - McGill University 2025
jdejongh
PRO
1
250
Stewardship and Sustainability of Urban and Community Forests
pwiseman
0
480
From Legacy to Launchpad: Building Startup-Ready Communities
dugsong
0
300
The Invisible Side of Design
smashingmag
301
52k
brightonSEO & MeasureFest 2025 - Christian Goodrich - Winning strategies for Black Friday CRO & PPC
cargoodrich
3
770
Refactoring Trust on Your Teams (GOTO; Chicago 2020)
rmw
35
3.7k
The #1 spot is gone: here's how to win anyway
tamaranovitovic
3
1.1k
Transcript
Bedrock RAG Evaluationを活用した RAGの定量的評価方法の紹介 ~ハンズオン参加レポート~ Fin-JAWS 第37回 ~re:Invent ラスベガス現地開催
依田 涼太 Ryota YODA • 金融系ソフトウェアを設計、開発 • 現在は米国シリコンバレーでAI等の 先端技術の調査・開発を担当 •
re:Invent初参加 (ホテル間の距離を全く計算しておらず、い くつかのセッション聞き逃した) @YodeeeTech
生成AIにおけるRAG評価の重要性 • 金融機関のAI利用アンケートによると 「情報検索」分野のAI活用において、期 待を下回るという評価がされている • 金融におけるAI活用では、誤った情報に よる回答生成を避けるためにもRAGの継 続的かつ定量的な評価が不可欠 日本銀行
2024年10月 「金融機関における生成AIの 利用状況とリ スク管理 -アンケート調査結果」 https://www.boj.or.jp/research/brp/fsr/data/fsrb241021-1.pdf
Bedrock Knowledge Bases の RAG Evaluation機能が Preview リリース (米国時間12/1に発表) https://aws.amazon.com/about-aws/whats-new/2024/12/amazon-bedrock-knowledge-bases-rag-evaluation-preview/
RAG評価機能は①データの取り出し (Retrieval)と ②生成 (Generation)の評価を行う ① ②
RAGの評価には下記の項目が使用 + Coherence
• 新機能のKnowledge Base RAG Evaluation機能を活用し、 データ取得結果と生成結果を評価がどのように行え るのかを検証する ハンズオンセッションの概要 ~ AIM311
Evaluate the performance of your generative AI app in Amazon Bedrock ~
Step1: テストデータとしてJSONL形式で用意し、S3に格納 { "conversationTurns": [{ "prompt": { "content": [{ "text":
"Calculate the year-over-year percentage change in cash and cash equivalents for Octank Financial from 2020 to 2021." }] }, "referenceResponses": [{ "content": [{ "text": "2020 cash and cash equivalents: $350 million, 2021 cash and cash equivalents: $480 million, Percentage change = (2021 value - 2020 value) / 2020 value * 100 = ($480 million - $350 million) / $350 million * 100 = 37.14% increase" }] }] }] } プロンプト文 正解文
Step2: 評価モデルや評価メトリクスを設定する 評価する際に使用するモデルの設定 評価メトリクスの設定
事前に定義した評価項目のスコア結果を コンソール上で確認可能 設定した評価項目ごとのスコア 複数の評価結果を比較可能
評価結果はS3にJSONL形式で出力されるため、 BIツールやPythonを使用した独自の分析が可能
• RAG Evaluation機能により、Knowledge Baseからの取得結果、 LLMによる生成結果を複数の観点で定量的に評価できるようになった • 現状は自分でテストデータを作成し、S3に格納する必要がある。 Guardrail機能への統合などにより、使いやすくなるかも • ユースケースとしてはLLM
Opsに組み込み、RAGの自動テストなどの 活用が考えられる まとめ