Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
ユーザーシュミレーション AIプロダクトのバグを事前検知
Search
ttnyt8701
August 23, 2026
Programming
10
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
ユーザーシュミレーション AIプロダクトのバグを事前検知
ttnyt8701
August 23, 2026
More Decks by ttnyt8701
See All by ttnyt8701
Gemini CLI のはじめ方
ttnyt8701
1
330
ObsidianをMCP連携させてみる
ttnyt8701
4
7.9k
Claude Codeの使い方
ttnyt8701
3
480
FastMCPでMCPサーバー/クライアントを構築してみる
ttnyt8701
3
780
LangChain Open Deep Researchとは?
ttnyt8701
2
500
Vertex AI Agent Builderとは?
ttnyt8701
4
460
A2A(Agent2Agent )とは?
ttnyt8701
2
550
Amazon Bedrock LLM as a Judgeを試す
ttnyt8701
3
250
Amazon Sagemaker Jump Startを用いて爆速でモデルを作成してみる
ttnyt8701
3
140
Other Decks in Programming
See All in Programming
【高い買い物LT会】初任給で話題の国産フィジカルAIを買った話
akagami
PRO
0
120
LLMは4年分のCompose移行を再現できるのか?実プロダクト279件のXMLで探る自動化の境界線
makun
0
450
{ Android | Kotlin } Gradle Plugin in 2026
ryunen344
1
290
変化を抱擁するドキュメントの作り方 - ビジネスルール駆動開発がもたらす、コードとの新しい関係
ioki
2
130
tsc.rip を支える技術 / Kyoto.なんか #8
susisu
0
4.4k
モバイル交通系ICへのチャージ実例から考える、クロスプラットフォーム開発におけるiOS実機テスト設計とCI運用
yusuga
1
190
go-spidermonkeyでAIエージェントのCode Modeを実装する
syumai
3
1.5k
DroidKaigi 2026 「個人開発という実験場: Android エンジニアが手にする4つの自由」
slashnephy
0
220
巨大モノリシックアプリ モダン化大作戦
ktcryomm
0
310
Webの地図
yosuke_furukawa
PRO
3
3.2k
『寄り添うラジオ』をAIで作る 体験価値から逆算した、会話しないUXと品質設計
theoriatec2024
3
140
AI駆動開発にグラフDBを重ねてみた
satoshi256kbyte
2
760
Featured
See All Featured
Why Your Marketing Sucks and What You Can Do About It - Sophie Logan
marketingsoph
0
400
svc-hook: hooking system calls on ARM64 by binary rewriting
retrage
2
560
The Pragmatic Product Professional
lauravandoore
37
7.4k
First, design no harm
axbom
PRO
2
1.3k
Unsuck your backbone
ammeep
672
58k
StorybookのUI Testing Handbookを読んだ
zakiyama
31
6.9k
The World Runs on Bad Software
bkeepers
PRO
72
12k
The Invisible Side of Design
smashingmag
301
52k
Kristin Tynski - Automating Marketing Tasks With AI
techseoconnect
PRO
0
510
A brief & incomplete history of UX Design for the World Wide Web: 1989–2019
jct
2
500
Build The Right Thing And Hit Your Dates
maggiecrowley
39
3.4k
Navigating the moral maze — ethical principles for Al-driven product design
skipperchong
2
520
Transcript
ユーザーシュミレーション AIプロダクトのバグを事前検知 立野 祐太
品質に関する現状の課題 顧客のバグ報告を受けてから対応する運用が常態化 顧客がデバッカーになってしまっている 顧客満足・解約リスクに直結する 2
現状の品質担保 テスト、 UATをしっかり行っているのになぜバグ報告が頻発する? 2
原因 現状のテストは理想的な使われ方が前提で、実運用の想定外な使われ方に対する品質を担保できていない これらをカバーできるテストの種類が足りていない
解決案 エージェントが様々な使われ方をシュミレーション。想定外の挙動を検証し、早期にバグを発見する
イメージ(世界観) ※夜間はコストを抑えられる 「顧客からの報告」を「事前の発見」に置き換えることが可能になる 5
どう実現するか
必要なデータ シナリオの定義 評価の定義 ゴール+ペルソナ (何をどんな人が検証するのか) 合否の採点表 (ゴール達成 + 性質) シミュレーター層(演者)
評価層(審査員) 顧客を演じて会話を作る─ 採点表は知らない 会話を後から採点する 1
検証精度 検証 精度 = シナリオの質 × 評価の質 シナリオが雑 → 何回まわしても見つからない
/ 評価が弱い → 起きた失敗を見逃す 1
シナリオの質をどうやって高めるか 機能一覧 機能一覧から体系的に生成 新機能もリリース前に作れる 例:「ファイル要約」機能→ 「営業資料を添付して要約を頼む」 抽出してシナリオ生成 シナリオ集 本番ログ 実セッションを匿名化・蒸留
実顧客の壊し方と頻出の重みを供給 例:「あの件まとめといて。やっぱ英語で」 → 曖昧指示+方針変更シナリオ 4
評価の質をどうやって高めるか • • 汎用の基準 専用の基準 エラーかどうか 決めたゴールを達成できているか ハルシネーションが発生しているか 過去の不具合を項目化 定めたルールを項目化
(書式・トーンなど) 最初から張ってある ─ 未知の失敗もかかる 失敗のたびに 1 枚ずつ増える ─ 既知を狙い撃ち 最初は汎用の基準だけで検証 運用してバグ発見いくうちに専用の基準が勝手に増えてくる
評価の難易度 簡単 普通 エラー ハルシネーション 難しい 品質の良し悪しなどの主観 例外・タイムアウト・ツール失敗 機械判定はできないが、正解がある 決定的に判定できる
主観的で正解が多様で曖昧 過去の評価データの蓄積で精度をあげていく 2
全体の流れ 人間 AI AI AI ① シナリオ作成 ② シナリオ承認 ③
パターン量産 ④ 実行 シナリオと成功条件を AI が下書き 人間がレビューして シナリオ集へ登録 変化形を AI が毎回生成 夜間の探索 + PR ごとの回帰 人間 AI ⑧ 回帰テストへ昇格 シナリオ集へ戻り 以後は再発を自動監視 AI ⑦ 修正 AI ⑥ Issue起票 ⑤バグ検知 開発チームが対応 ↩ ⑧ で昇格したシナリオは ④ の回帰実行に自動で組み込まれ、ループが回り続ける 6
注意点 誤検知の量産は、レポートを読まれなくする 対策:精度の高い検出を目指していく。機械チェック優先の二段構え + Issue 化の前に人間のトリアージ 「通った = 本番で安全」ではない 位置づけ:保証ではなく、顧客が先にバグを踏む回数を減らす施策
まとめ 足りないのは、テストの量ではなく種類 AI が顧客を演じる「デバッカー」になり、未知のバグを探す 見つけた失敗は回帰テストへ昇格し、テスト資産を育て続ける