Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Bedrock RAG Evaluationを活用したRAGの定量的評価方法の紹介
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
Yodeee
December 05, 2024
Technology
360
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Bedrock RAG Evaluationを活用した RAGの定量的評価方法の紹介
Yodeee
December 05, 2024
More Decks by Yodeee
See All by Yodeee
OCI上で実現するAIエージェント開発方法の紹介
yodeee
0
62
re:Inventから見えたレガシーモダナイぜーションのこれから
yodeee
0
160
Moxie
yodeee
0
28
Agents for Amazon Bedrockで何ができるようになるのか
yodeee
2
1.2k
Amazon Verified Permissionsをプロダクトにどう組み込むかを考える
yodeee
0
240
アウトプットし始めたら QOL (Quality of Learning) が爆上がりした話
yodeee
0
150
Pulumi AIで開発体験は変わるのか
yodeee
0
130
GPT × Alexa × AWS で 英会話学習スキルを作った話
yodeee
0
320
Other Decks in Technology
See All in Technology
DGX Sparkを2台使って いろいろ動かす話
sonoda_mj
1
130
AI時代に、プロダクトの数だけ積み上がる所有コストをどうエンジニアリングするか / Engineering the Cost of Ownership
kzkmaeda
0
1k
AIに丸投げしないトイル削減 / Eliminating Toil Without Leaving It All to AI
kohbis
2
560
書籍『生成AIの安全性入門』の入門
wataoka
0
220
【視聴者参加型!】AWSセキュリティアンチパターンクイズ
syoshie
0
430
はじめてのDatabricks:技術者向けワークショップ / beginner-workshop
databricksjapan
PRO
0
230
こんなアーキテクチャ図は嫌だ BEYOND THE TIME: 半年後の自分へ贈る15のメッセージ / 15 of Anti-pattern in AWS Architecture Diagrams
naospon
3
250
20260903 Tokyo Jazug Night #62 | Azure エンジニアよ、 その環境は本当にセキュアか?
olivia_0707
1
620
PdMをやめて、 "プロダクトビルダー"という 働き方に変えました / PdM to Product Builder
shikichee
2
720
PM領域でのAI Agentの活用
lycorptech_jp
PRO
0
270
KPIだけでは評価できないプロダクトが考えるべき Evalsという第二の評価系 / Beyond KPIs: Evals as a Second Evaluation Framework for Products #PdEConf
aki_iinuma
4
3.7k
Webとヘルスデータ
yukukotani
0
190
Featured
See All Featured
Building the Perfect Custom Keyboard
takai
2
860
Responsive Adventures: Dirty Tricks From The Dark Corners of Front-End
smashingmag
254
22k
How to build a perfect <img>
jonoalderson
1
6k
[RailsConf 2023 Opening Keynote] The Magic of Rails
eileencodes
31
10k
The Spectacular Lies of Maps
axbom
PRO
1
980
Design in an AI World
tapps
1
300
実際に使うSQLの書き方 徹底解説 / pgcon21j-tutorial
soudai
PRO
201
75k
Rails Girls Zürich Keynote
gr2m
96
14k
Navigating the moral maze — ethical principles for Al-driven product design
skipperchong
2
520
First, design no harm
axbom
PRO
2
1.3k
Ten Tips & Tricks for a 🌱 transition
stuffmc
0
200
How to train your dragon (web standard)
notwaldorf
97
6.8k
Transcript
Bedrock RAG Evaluationを活用した RAGの定量的評価方法の紹介 ~ハンズオン参加レポート~ Fin-JAWS 第37回 ~re:Invent ラスベガス現地開催
依田 涼太 Ryota YODA • 金融系ソフトウェアを設計、開発 • 現在は米国シリコンバレーでAI等の 先端技術の調査・開発を担当 •
re:Invent初参加 (ホテル間の距離を全く計算しておらず、い くつかのセッション聞き逃した) @YodeeeTech
生成AIにおけるRAG評価の重要性 • 金融機関のAI利用アンケートによると 「情報検索」分野のAI活用において、期 待を下回るという評価がされている • 金融におけるAI活用では、誤った情報に よる回答生成を避けるためにもRAGの継 続的かつ定量的な評価が不可欠 日本銀行
2024年10月 「金融機関における生成AIの 利用状況とリ スク管理 -アンケート調査結果」 https://www.boj.or.jp/research/brp/fsr/data/fsrb241021-1.pdf
Bedrock Knowledge Bases の RAG Evaluation機能が Preview リリース (米国時間12/1に発表) https://aws.amazon.com/about-aws/whats-new/2024/12/amazon-bedrock-knowledge-bases-rag-evaluation-preview/
RAG評価機能は①データの取り出し (Retrieval)と ②生成 (Generation)の評価を行う ① ②
RAGの評価には下記の項目が使用 + Coherence
• 新機能のKnowledge Base RAG Evaluation機能を活用し、 データ取得結果と生成結果を評価がどのように行え るのかを検証する ハンズオンセッションの概要 ~ AIM311
Evaluate the performance of your generative AI app in Amazon Bedrock ~
Step1: テストデータとしてJSONL形式で用意し、S3に格納 { "conversationTurns": [{ "prompt": { "content": [{ "text":
"Calculate the year-over-year percentage change in cash and cash equivalents for Octank Financial from 2020 to 2021." }] }, "referenceResponses": [{ "content": [{ "text": "2020 cash and cash equivalents: $350 million, 2021 cash and cash equivalents: $480 million, Percentage change = (2021 value - 2020 value) / 2020 value * 100 = ($480 million - $350 million) / $350 million * 100 = 37.14% increase" }] }] }] } プロンプト文 正解文
Step2: 評価モデルや評価メトリクスを設定する 評価する際に使用するモデルの設定 評価メトリクスの設定
事前に定義した評価項目のスコア結果を コンソール上で確認可能 設定した評価項目ごとのスコア 複数の評価結果を比較可能
評価結果はS3にJSONL形式で出力されるため、 BIツールやPythonを使用した独自の分析が可能
• RAG Evaluation機能により、Knowledge Baseからの取得結果、 LLMによる生成結果を複数の観点で定量的に評価できるようになった • 現状は自分でテストデータを作成し、S3に格納する必要がある。 Guardrail機能への統合などにより、使いやすくなるかも • ユースケースとしてはLLM
Opsに組み込み、RAGの自動テストなどの 活用が考えられる まとめ