Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
仕事で取り組む 生成 AI 時代の対話の品質評価
Search
Asei Sugiyama
September 30, 2024
Technology
170
2
Share
仕事で取り組む 生成 AI 時代の対話の品質評価
Google Cloud Next Tokyo '24 での LT 用の資料です
Asei Sugiyama
September 30, 2024
More Decks by Asei Sugiyama
See All by Asei Sugiyama
Cynefin Framework を用いた AI Native 組織へのパラダイムシフト
asei
0
61
Algorithm behind Gemini Enterprise Agent Designer
asei
0
240
Algothythm behind Gemini Enterprise Agent Designer (with least amount of inputs from human)
asei
0
86
AI との良い付き合い方を僕らは誰も知らない (WSS 2026 静岡版)
asei
1
590
AI との良い付き合い方を僕らは誰も知らない
asei
1
560
最近の生成 AI の活用事例紹介
asei
3
460
AI エージェント活用のベストプラクティスと今後の課題
asei
2
730
エージェントの継続的改善のためのメトリクス再考
asei
3
940
生成AI活用のベストプラクティス集を作ってる件
asei
1
950
Other Decks in Technology
See All in Technology
Building a Study Buddy AI Agent from Scratch: From Passive Chatbots to Autonomous Systems
itchimonji
0
140
エージェント時代の UIとAPI、CLI戦略
coincheck_recruit
0
150
自動テストだけで リリース判断できるチームへ - 鍵はテストの量ではなくリリース判断基準の再設計にあった / Redesigning Release Criteria for Lightweight Releases
ewa
7
3.5k
拝啓、あの夏の僕へ〜あなたも知っているApp Runnerの世界〜
news_it_enj
0
220
雑談は、センサーだった
bitkey
PRO
2
210
[Oracle TechNight#99] 生成AI時代のAI/ML入門 ~ AIとオラクルデータベースの関係 (前半)
oracle4engineer
PRO
2
240
エンタープライズの厳格な制約を開発者に意識させない:クラウドネイティブ開発基盤設計/cloudnative-kaigi-golden-path
mhrtech
0
350
Databricks Academic Series 〜 大規模言語モデル / エージェント編 〜 / academic-series-llm
databricksjapan
0
110
生成AIはソフトウェア開発の革命か、ソフトウェア工学の宿題再提出なのか -ソフトウェア品質特性の追加提案-
kyonmm
PRO
2
860
オライリーイベント登壇資料「鉄リサイクル・産廃業界におけるAI技術実応用のカタチ」
takarasawa_
0
330
20260428_Product Management Summit_Loglass_JoeHirose
loglassjoe
4
7.3k
Digital Independence: Why, When and How
wannesrams
0
300
Featured
See All Featured
Ruling the World: When Life Gets Gamed
codingconduct
0
220
More Than Pixels: Becoming A User Experience Designer
marktimemedia
3
400
Designing Dashboards & Data Visualisations in Web Apps
destraynor
231
54k
[RailsConf 2023 Opening Keynote] The Magic of Rails
eileencodes
31
10k
The SEO identity crisis: Don't let AI make you average
varn
0
460
Technical Leadership for Architectural Decision Making
baasie
3
350
Kristin Tynski - Automating Marketing Tasks With AI
techseoconnect
PRO
0
240
Large-scale JavaScript Application Architecture
addyosmani
515
110k
Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint/Restore in Edge–Cloud Continuum
chikuwait
0
510
Darren the Foodie - Storyboard
khoart
PRO
3
3.3k
The #1 spot is gone: here's how to win anyway
tamaranovitovic
2
1k
世界の人気アプリ100個を分析して見えたペイウォール設計の心得
akihiro_kokubo
PRO
70
39k
Transcript
Proprietary 仕事で取り組む 生成 AI 時代の 対話の品質評価
02 Proprietary Google Cloud Next Tokyo ’24 杉山 阿聖 株式会社
Citadel AI Software Engineer
03 Proprietary 01 なぜ「評価」なのか 02 対話の品質評価 03 生成 AI の比較
04 まとめ アジェンダ
04 Proprietary Google Cloud Next Tokyo ’24 なぜ「評価」なのか
05 Proprietary Google Cloud Next Tokyo ’24 身近に広がる生成 AI •
チャット専用のアプリを超えて さまざまな箇所で使われている • さまざまなサービスや デバイスとの統合は 世界的な潮流として進むと思われる ※画像の置換方法 グレーボックスを選択し、 右クリックで「画像を置 換」を選択し、配置したい画像に差し替えてくださ い。本テキストは削除してください。
06 Proprietary & Confidential ※画像の置換方法 グレーボックスを選択し、 右クリックで「画像を置換」 を選択 し、配置したい画像に差し替えてください。本テキストは削除し てください。
※画像の置換方法 グレーボックスを選択し、 右クリックで「画像を置換」 を選択 し、配置したい画像に差し替えてください。本テキストは削除し てください。 生成 AI は特定分野の 専門知識に弱い • 同じプロンプトから左折の手順 を生成 • 上 : Gemini 1.5 Pro • 下 : ChatGPT 4o • ともに信号機を確認しない
07 Proprietary Google Cloud Next Tokyo ’24 基盤モデルの Finetune •
生成 AI 以前の常識に従えば 業界特化な知識は finetune で与える • 基盤モデルを finetune し 特化モデルを作成することは 技術的に可能 ※画像の置換方法 グレーボックスを選択し、 右クリックで「画像を置 換」を選択し、配置したい画像に差し替えてくださ い。本テキストは削除してください。 Hu, Edward J., et al. "Lora: Low-rank adaptation of large language models." arXiv preprint arXiv:2106.09685 (2021). https://arxiv.org/abs/2106.09685
08 Proprietary Google Cloud Next Tokyo ’24 Finetune で特定分野の 知識を与えるのは困難
• モデルの知らない知識を 意図的に与えた実験 • 知らない知識を与えれば 与えるハルシネーションを 引き起こしやすくなる ※画像の置換方法 グレーボックスを選択し、 右クリックで「画像を置 換」を選択し、配置したい画像に差し替えてくださ い。本テキストは削除してください。 Gekhman, Zorik, et al. "Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?." arXiv preprint arXiv:2405.05904 (2024). https://arxiv.org/abs/2405.05904
09 Proprietary & Confidential Google Cloud Next Tokyo ’24 ※画像の置換方法
グレーボックスを選択し、 右クリックで「画像を置換」 を選択 し、配置したい画像に差し替えてください。本テキストは削除し てください。 Gekhman, Zorik, et al. "Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?."arXiv preprint arXiv:2405.05904 (2024). https://arxiv.org/abs/2405.05904
010 Proprietary Google Cloud Next Tokyo ’24 • 検索と生成 AI
の合せ技 • 検索で特定分野の知識を 与えられるアーキテクチャ • 特定分野の知識を与えたとしても、そ れをモデルが利用できるかは 自明でない • 故に評価が必要 RAG (Retrieval-Augmented Generation) ※画像の置換方法 グレーボックスを選択し、 右クリックで「画像を置 換」を選択し、配置したい画像に差し替えてくださ い。本テキストは削除してください。 Infrastructure for a RAG-capable generative AI application using GKE https://cloud.google.com/architecture/rag-capable-gen-ai-app-using-gke
011 Proprietary Google Cloud Next Tokyo ’24 対話の品質評価
012 Proprietary Google Cloud Next Tokyo ’24 対話の品質評価の 3 つの方法
• ベンチマークを用いた事前評価 : QA4AI ガイドライン • 仮想シナリオを用いた事前評価 : デジタル庁のレポート • 対話ログを用いた事後評価: 弊社での取り組み 評価手法 ベンチマーク 仮想シナリオ 対話ログ 事前評価可能 ✓ ✓ カスタマイズ性 ✓ 特定業務の品質評価 ✓
013 Proprietary Google Cloud Next Tokyo ’24 ベンチマークによる評価 (1/2) •
QA4AI AI プロダクト品質保証 ガイドライン (2024.04 版) • ベンチマークとなる データセットを用いた方法を紹介 • 典型的な「正確性」だけではなく「創造 性‧多様性」といった 新たな品質も整理 ※画像の置換方法 グレーボックスを選択し、 右クリックで「画像を置 換」を選択し、配置したい画像に差し替えてくださ い。本テキストは削除してください。
014 Proprietary Google Cloud Next Tokyo ’24 ベンチマークによる評価 (2/2) •
ベンチマークには課題も 1. 得点として計測する方法に 収束させがち 2. 測りたい品質特性に合った ベンチマークがあるとは限らない 3. 測りたい品質特性の明確化が 事前に必要 ※画像の置換方法 グレーボックスを選択し、 右クリックで「画像を置 換」を選択し、配置したい画像に差し替えてくださ い。本テキストは削除してください。
015 Proprietary & Confidential ※画像の置換方法 グレーボックスを選択し、 右クリックで「画像を置換」 を選択 し、配置したい画像に差し替えてください。本テキストは削除し てください。
※画像の置換方法 グレーボックスを選択し、 右クリックで「画像を置換」 を選択 し、配置したい画像に差し替えてください。本テキストは削除し てください。 仮想シナリオによる 評価の例 • 2023年度 デジタル庁・行政における生 成 AI の適切な利活用に向けた 技術検証 • ユースケースを洗い出し、 ユースケースごとに評価観点を 整理して、評価用データを作成 • カバレッジは良い • 件数の確保には苦労している (10 件)
016 Google Cloud Next Tokyo ’24 過去ログに基づく 評価のワークフロー ※画像の置換方法 グレーボックスを選択し、
右クリックで「画像を置換」 を選択 し、配置したい画像に差し替えてください。本テキストは削除し てください。
017 Proprietary Google Cloud Next Tokyo ’24 過去ログに基づく評価の課題 • スプレッドシートは柔軟なものの手間が多い
• 「良い」という定義をすることが難しい • 評価を自動化しないとスケールしない
018 Proprietary Google Cloud Next Tokyo ’24 生成 AI の比較
019 Google Cloud Next Tokyo ’24 スプレッドシートでの手 動評価は手間 ※画像の置換方法 グレーボックスを選択し、
右クリックで「画像を置換」 を選択 し、配置したい画像に差し替えてください。本テキストは削除し てください。
020 Google Cloud Next Tokyo ’24 ⽣成 AI の評価ツール Lens
for LLMs
021 Google Cloud Next Tokyo ’24 複数モデルの比較
022 Google Cloud Next Tokyo ’24 モデルの傾向の比較
023 Google Cloud Next Tokyo ’24 LLM を用いた評価に おけるバイアスの例
024 Proprietary Google Cloud Next Tokyo ’24 まとめ
025 Proprietary Google Cloud Next Tokyo ’24 対話の品質評価の 3 つの方法
• ベンチマークを用いた事前評価 : QA4AI ガイドライン • 仮想シナリオを用いた事前評価 : デジタル庁のレポート • 対話ログを用いた事後評価: 弊社での取り組み 評価手法 ベンチマーク 仮想シナリオ 対話ログ 事前評価可能 ✓ ✓ カスタマイズ性 ✓ 特定業務の品質評価 ✓
026 Proprietary Google Cloud Next Tokyo ’24 Lens for LLMs
Beta • 今回は時間の都合上、 実際の利用方法の大半を省略 • 登録していただいた方への プライベートベータ版としてご提供中 • ご興味ある方は一声おかけください! ※画像の置換方法 グレーボックスを選択し、 右クリックで「画像を置 換」を選択し、配置したい画像に差し替えてくださ い。本テキストは削除してください。
Thank you 027 Proprietary