Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
評価が大事
Search
tsumiki
November 08, 2025
Programming
22
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
評価が大事
AIエージェント開発における評価の重要性について話したLT
tsumiki
November 08, 2025
More Decks by tsumiki
See All by tsumiki
おもしろい組織図の世界
tsumiki
0
43
リーダブルコードLT
tsumiki
0
23
メディアリニューアルした話
tsumiki
0
20
Svelte触ってみた
tsumiki
0
16
スピーダ事業 Product Teamの1週間を考察してみた。
tsumiki
0
19
New Joinerの時に感じていたことを振り返る
tsumiki
0
18
F# AsyncとTask
tsumiki
0
20
F#でちょっとずつ返す
tsumiki
0
20
Other Decks in Programming
See All in Programming
これって Effect でできたのでは? / TSKaigi Mashup Kansai #2
susisu
0
250
片田舎のおっさん、 Swift Buildのダイアモンド問題解決の不具合修正PRを出すが、解決方法がキャッシュをしないようにすることであり、ビルド時間が伸びると言われてマージされないので高速化もする/swiftbuild
yimajo
0
170
AWS DevOps AgentのAzure接続機能を検証して見えた活用法/Use Cases Verified for the AWS DevOps Agent's Azure Connectivity Feature
masakiokuda
1
250
Foundation Models frameworkで画像分析
ryodeveloper
1
630
komatsuna「分散システムにおけるバグ分析手法」
komatsunaqa
0
270
そこに3びきプロダクトがいるじゃろう——生成AI時代における“価値が届かない理由”の構造
kosuket
0
520
源内ハンズオン概要編
hideg
0
190
使いながら育てる Claude Code — 開発フローの1コマンド化 × 繰り返し指摘の自動仕組み化
shiki_kakaku
0
1.9k
AIが無かった頃の素敵な出会いの話
codmoninc
1
470
Go言語とトイモデルで学ぶTransformerの気持ち / fukuokago23-transformer
monochromegane
0
190
ソフトウェアエンジニアにとっての生成AI - 特性を知って使い倒す / generative ai for software enginner
kishida
5
1.9k
TSX の <Hoge<Fuga>> という構文に驚いた話 / tsx-type-argument-syntax
kanaru0928
0
230
Featured
See All Featured
Principles of Awesome APIs and How to Build Them.
keavy
128
18k
Navigating Weather and Climate Data
rabernat
0
480
Why Our Code Smells
bkeepers
PRO
340
58k
The Cost Of JavaScript in 2023
addyosmani
55
10k
ラッコキーワード サービス紹介資料
rakko
1
4.4M
We Have a Design System, Now What?
morganepeng
55
8.3k
Lightning talk: Run Django tests with GitHub Actions
sabderemane
0
230
4 Signs Your Business is Dying
shpigford
187
23k
Dominate Local Search Results - an insider guide to GBP, reviews, and Local SEO
greggifford
PRO
0
300
Balancing Empowerment & Direction
lara
6
1.2k
The Organizational Zoo: Understanding Human Behavior Agility Through Metaphoric Constructive Conversations (based on the works of Arthur Shelley, Ph.D)
kimpetersen
PRO
0
420
Build your cross-platform service in a week with App Engine
jlugia
234
19k
Transcript
評価が大事
1. Speeda Agent チームでやっていたこと 2. 学び① 評価が大事 3. 学び② 正解データが大事
目次
Speeda Agent チームでやっていたこと
学び① 評価が大事 GitHub Copilotは、間違いなくLLMを使った最初の産業規模のアプリケーションで す。先手を打つことの呪いは、(今では)誰もが知っていることを笑えるほどに無視 してしまい、後から考えると、自分が下した選択の一部が愚かに見えてしまうことで す。 しかし、私たちが絶対的に正しかったことの 1つは、どのように始めたか
でした。 GitHub Copilotのコードベースの最も古い部分は、プロキシやプロンプト、 UI、アプ リケーションをIDE拡張機能として設定するボイラープレートではありません。 私た ちが最初に書いたコードは「評価」 であり、そのおかげで、他のコードとともに非常 に早く、成功裏に進むことができました。 なぜなら、私たちが行ったすべての変更について、その変更が正しい方向への一 歩、間違い、あるいは、あまり影響を与えなかった、よい試みだったのかを直接確 認できたからです。
Agent 開発初期の状況 • テスト書いてない • 確認コストが大きい • リグレッションに気付けない •
安心感がない(個人的に)
LLM を使ったアプリケーションのテスト • LLM の出力は確率 • 評価項目の例 ◦ 構造の正しさ、ソースとの整合性、意味的な一致
(E2Eテスト, ユニットテスト的なものを作っていきたい)
評価手法 • オフライン評価(デプロイ前) ◦ 人間による評価 ◦ 自動評価 ▪ ROUGE, BERTScore,
LLM-as-a-Judgeなど • オンライン評価(デプロイ後) ◦ ABテスト、Good/Bad など
評価を始めてどうだったか • ROUGE, BERTScore, LLM-as-a-Judge • まず始めるのが大事 • 確認コスト減った
• 安心感があった(個人的に) • とはいえ、課題はたくさんある
学び② 正解データが大事 • 正解データがないと評価できない(当たり前) • ゴールデンデータセットを用意せよ ◦ プロンプトとそれに対応する正解回答
道のり • 正解データを作る ↓ • 正解データに出力を近づける ↓ • 出力を安定させる
正解データを作ることを後手に回さない • 正解データは動く前提で、意識的に作りにいく • 作って貰える状況なら、早めに依頼する • 無理なら、Biz側も巻き込んで早めに一緒に作る?