Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
最近の Citadel AI の取り組みのご紹介 (Nov, 2024)
Search
Asei Sugiyama
October 08, 2024
Technology
340
2
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
最近の Citadel AI の取り組みのご紹介 (Nov, 2024)
MLSE LLM ドメイン適用 WG向けに最近の取り組みをご紹介した資料です
Asei Sugiyama
October 08, 2024
More Decks by Asei Sugiyama
See All by Asei Sugiyama
AIネイティブの実現:既存の組織をAI前提で見直すための「ゼロベース・ハッカソン」の方法論と実践
asei
1
130
AI ネイティブな組織に Gemini Enterprise Agent Platform がなぜ必要なのか
asei
1
520
AI工学特論: MLOps・継続的評価
asei
11
3.8k
生成 AI 実践ガイド (概略版) AIガバナンス編
asei
0
520
コードを1行も書けなかった僕がエンジニアになるまでの振り返り
asei
0
170
MLOps に至るまで
asei
1
65
Cynefin Framework を用いた AI Native 組織へのパラダイムシフト
asei
0
120
Algorithm behind Gemini Enterprise Agent Designer
asei
0
350
Algothythm behind Gemini Enterprise Agent Designer (with least amount of inputs from human)
asei
0
130
Other Decks in Technology
See All in Technology
CI/CDではもう遅い - 人とAIが迂回しないDevSecOps Verify基盤の再設計 -
kintotechdev
0
110
JSONataとAWS Step Functionsで目指すRuntimelessな世界
mu7889yoon
0
470
高負荷プロダクション環境におけるAWS Lambdaのリアル 〜スケールとコストを左右する実行ライフサイクルの技術仕様〜
maimyyym
2
200
品質と信頼性を地続きにする
grimoh
2
970
積み重なった技術負債への挑戦 〜初手としての全社ゴト化〜
techtekt
PRO
0
1.6k
AIエージェントを最高のパートナーに育てる方法|評価と判断軸を育てる5つのステップ
koichiaoki
1
160
LLMに渡さなかった仕事
nanaism
0
1.4k
「ピッケル本」日本語版は4.0(第6版)が出版されるべき / pickaxe4-nagoyark05
kakutani
2
290
バイブコーディング時代のWebアプリ開発入門~Cloud Runで学ぶセキュアなビルドとデプロイ
waiwai2111
1
150
人間はどの意思決定を手放せるのか
kawasima
15
8.1k
Making AI Agents Safe and Fast- Jev, Obsidian, and the Meta-Harness
x5gtrn
PRO
0
130
Mastering Agentic Development: Harness Engineering for Effective Coding Agents
konippi
3
460
Featured
See All Featured
Stop Working from a Prison Cell
hatefulcrawdad
274
21k
Tips & Tricks on How to Get Your First Job In Tech
honzajavorek
1
770
Statistics for Hackers
jakevdp
799
230k
What does AI have to do with Human Rights?
axbom
PRO
1
2.4k
Leveraging LLMs for student feedback in introductory data science courses - posit::conf(2025)
minecr
1
410
I Don’t Have Time: Getting Over the Fear to Launch Your Podcast
jcasabona
35
2.8k
Done Done
chrislema
187
17k
The Hidden Cost of Media on the Web [PixelPalooza 2025]
tammyeverts
2
500
Why You Should Never Use an ORM
jnunemaker
PRO
61
10k
SEO in 2025: How to Prepare for the Future of Search
ipullrank
3
3.8k
Sam Torres - BigQuery for SEOs
techseoconnect
PRO
0
550
Typedesign – Prime Four
hannesfritz
42
3.2k
Transcript
©2021-2024 Citadel AI Inc. LLM ドメイン適⽤ WG 向け Citadel AI
の取り 組みのご紹介 株式会社 Citadel AI
CONFIDENTIAL ©2021-2024 Citadel AI Inc. TOC - Citadel AI のご紹介
- 対話ログの分析ワークフローのご紹介 - 今後の展望 - ご相談 2
Citadel AI のご紹介 #1 3
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 4 Trusted by Global Companies
Contributing to Trustworthy AI US AISIC (US) The AI Alliance (Meta/IBM) 安全安⼼な「信頼できるAI」を実現
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 5 ミスが許されない AI システムの品質検証 銀行・保険
など 医療・ヘルスケア 自動車・製造業
CONFIDENTIAL ©2021-2024 AI ライフサイクル全体の信頼性‧品質を向上 6 開発中の モデル データセット 1. モデル開発時の自動検証
自動 テスト モデル評価 レポート 2. モデル運用時の自動監視 運用中の モデル 自動 モニタリング 再学習
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 7 ⼤規模⾔語モデルの評価ツール Lens for
LLMs Human Eval Automated Eval Lens Fast ❌ ✅ ✅ Accurate ✅ ❌ ✅ ✅ ⼤量の網羅的な⾃動評価に ✅ 少量の⼈⼿評価を組み合わせ ✅ 両者の強みをインテグレート
対話ログの分析ワークフローの ご紹介 #2 8
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 対話の品質評価の 3 つの⽅法 - ベンチマークを⽤いた事前評価
: QA4AI ガイドライン - 仮想シナリオを⽤いた事前評価 : デジタル庁のレポート - 対話ログを⽤いた事後評価: 弊社での取り組み 9 評価手法 ベンチマーク 仮想シナリオ 対話ログ 事前評価可能 ✓ ✓ カスタマイズ性 ✓ 特定業務の品質評価 ✓
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 対話ログの分析ワークフロー概要 10 全対話ログ サンプル (1000ユーザー)
RAGあり RAGなし 一般質問 100件 (目標) 要約 100件 (目標) 要約 100件 (目標) 翻訳 100件 (目標) 人手による 精度検証 自動化された指標 との比較 人手による 精度検証 自動化された指標 との比較 人手による 精度検証 自動化された指標 との比較 人手による 精度検証 自動化された指標 との比較 Step1. データの確認 Step2. 用途の確認 Step3. 人手での検証 Step4. 自動化の検討 … …
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 分析⽅法のデモ - Lens for LLMs
と Azure OpenAI の画⾯を⽤いてご紹介 1. 対話ログのカテゴリ抽出 2. 対話ログのカテゴリ分類‧評価 11
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 評価 - ⼈⼿で分類したアノテーション結果と、⽣成したプロンプトを⽤いた評価結 果を⽐較 -
カテゴリ抽出では⼈⼿で作成したカテゴリと類似するカテゴリを作成するこ とに成功した - カテゴリ分類では⼈⼿とほぼ変わらない精度で分類可能 - 「⼀般的な知識で回答できない質問かどうか」「健康問題に関する相談を含 んでいるか」「攻撃的なプロンプトを含んでいないか」もプロンプトにより 判定可能 12
今後の展望 #3 13
CONFIDENTIAL ©2021-2024 Citadel AI Inc. モデルの性能改善の3類型 14 モデル データ テスト
モデル データ テスト モデル データ テスト Kaggle型 モデルを改善 Data-Centric型 データを改善 API型 テストを改善 既存のノウハウが乏しい
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 問題意識 - 網羅的な評価観点を最初から取り揃 えることは無理 -
さまざまな⽤途に利⽤できるため、 ユースケースを列挙できない - 世論が変化することで新たな評価基 準があとから出現する 15 モデル データ テスト API型 テストを改善
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 継続的な評価 - 評価 → 指標の設計
→ 評価を反復 - すべての評価観点を最初から網羅す るのではなく、利⽤を通じて徐々に 評価観点を育てていく - 評価を⾏うことで、既存の評価観点 では抜け落ちるケースに気が付き、 新たな評価観点に気がつく 16 モデル データ テスト API型 テストを改善
19