Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
LLMによるContent Moderationの本番運用の裏側と品質担保への挑戦
Search
suikabar
June 18, 2026
Programming
820
3
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
LLMによるContent Moderationの本番運用の裏側と品質担保への挑戦
suikabar
June 18, 2026
Other Decks in Programming
See All in Programming
20260623_Loop Engineeringで自分の分身の問い合わせBotを作る
ryugen04
0
110
Semantic Version 単位で戦略を柔軟に変えて、パッケージアップデートを自動化する
daitasu
1
340
ランチタイムLT会3周年!ランチタイムLT会を3年間続けられたお話
y0hgi
1
130
これからAgentCoreを触る方へトレンドはGatewayです
har1101
6
460
SREの積み重ねがAI駆動開発のガードレールになった ― 7つの実践/SRE Guardrails The 7
tomoyakitaura
7
1k
Hatena Engineer Seminar #37「言語モデルの活用に関する研究」
slashnephy
0
470
コンテキストの使い捨てをやめる — ビジネスルール駆動開発と miko —
ioki
0
260
Hunting Vulnerabilities in Symfony with LLMs
vinceamstoutz
0
570
OS アップデート対応の取り組み方がもっと共有されてほしい
andpad
0
110
jQueryをバージョンアップする前に使いたいjQuery Migrate
matsuo_atsushi
0
630
例外の正しい扱い方 そのエラー try-catchして大丈夫?
jinwatanabe
0
320
エンジニアにデザインハーネスを 〜デザインプロセスを規定するためのハーネス〜 / Design harness from an engineer's perspective
rkaga
2
610
Featured
See All Featured
Responsive Adventures: Dirty Tricks From The Dark Corners of Front-End
smashingmag
254
22k
Rebuilding a faster, lazier Slack
samanthasiow
85
9.5k
Technical Leadership for Architectural Decision Making
baasie
3
430
Abbi's Birthday
coloredviolet
3
8.5k
Paper Plane (Part 1)
katiecoart
PRO
0
9.5k
Claude Code のすすめ
schroneko
67
230k
Music & Morning Musume
bryan
47
7.3k
GraphQLの誤解/rethinking-graphql
sonatard
75
12k
The Hidden Cost of Media on the Web [PixelPalooza 2025]
tammyeverts
2
340
Designing Experiences People Love
moore
143
24k
Paper Plane
katiecoart
PRO
1
52k
コードの90%をAIが書く世界で何が待っているのか / What awaits us in a world where 90% of the code is written by AI
rkaga
62
44k
Transcript
1 LLMによるContent Moderationの本番運用の裏側と 品質担保への挑戦 2026/6/18 白金鉱業 Meetup Vol.24@六本木 Mizuho Yanagi
(@suikabar_umai)
自己紹介 2 栁 泉穂(やなぎ みずほ) • 2022年 ブレインパッド新卒入社 ◦ 統計学の新卒研修を担当
◦ 同僚とDS向けの技術書を執筆 • 2025年 タイミーに入社 ◦ 現在はLLMプロダクト開発に従事
3
事例|TimeeにおけるContent Moderationの取り組み 4 プラットフォームの安全性担保のために投稿されたコンテンツを審査 post check User Operator feedback
事例|Content ModerationへのLLMの導入 5 人手では限界のある審査の質・速度の向上を目的に審査フローにLLMを導入 post check check feedback feedback User
LLM Operator
LLMプロダクトの品質を担保するまでの壁 6 「作って動く」と「本番環境で安心して使える」の間には大きなギャップがある 品質 開発コスト
LLMプロダクトの品質を担保するまでの壁 7 「作って動く」と「本番環境で安心して使える」の間には大きなギャップがある 品質 開発コスト Prototype
LLMプロダクトの品質を担保するまでの壁 8 「作って動く」と「本番環境で安心して使える」の間には大きなギャップがある 品質 開発コスト Prototype Production Content Moderation領域
LLMプロダクトの品質を担保するまでの壁 9 「作って動く」と「本番環境で安心して使える」の間には大きなギャップがある 品質 開発コスト Prototype Production 推論品質の評価 アーキテクチャ 運用・監視
継続的な改善
評価|評価主導型の改善サイクル 10 質の担保されたゴールデンデータセットを起点に評価・改善のサイクルを回す ゴールデンデータセット • 入力と期待する出力をセットにした事例集 • 少数の重要な事例からはじめ段階的に拡張 • 改善の方向性を示す羅針盤となる
ゴールデン データセット 評価 エラー 分析 改善
評価|ゴールデンデータセット評価と本番評価 11 ゴールデンデータセットでファジーなLLMロジックの振る舞いを正しく評価する 特徴 ラベルの品質 利用用途 ゴールデンデータセット (オフライン評価) 少数、網羅性重視 正確(アノテーションにより担保)
振る舞いの確認 / 回帰テスト 本番環境 (オンライン評価) 大規模、本番環境の分布そのもの 実態の把握 / エッジケースの検出 低い、もしくは取れない
改善|品質改善のためのアプローチ 12 ボトルネックとなる要因の切り分けとそこに寄与する改善アプローチを試行 要因例 アプローチ例 error cases • モデルへの指示が曖昧 •
指示の読み飛ばし 審査 ロジック 由来 • プロンプト調整 • ワークフロー最適化 • 判断基準の欠如 • 曖昧なグレーゾーン 審査 ポリシー 由来 • 審査ポリシーの更新 • OK/NG例の拡充
運用・アーキ|スケーラブルなアーキテクチャ設計 13 不安定なLLM APIへ依存する上で可用性を担保するための工夫が求められる コケることを前提とした設計 ✔ リトライを前提としたアーキテクチャ ✔ 適切なフォールバック戦略 Rate
Limitリスクへの対処 ✔ スパイクに耐えうる非同期処理 Findy Tools|LLMによる非同期文章レビュー基盤アーキテクチャ (https://findy-tools.io/companies/timee/73/84)
監視|LLMプロダクトの監視・可観測性 14 ファジーに振る舞うLLMプロダクト特有の監視・可観測性担保の仕組みが必要 • トークン消費量の監視 • 出力の評価(LLM-as-a-Judge) • ワークフロー全体の可観測性 (LLM
Observability) Speaker Deck|Datadog LLM Observabilityで実現するLLMOps実践事例 (https://speakerdeck.com/k6s4i53rx/practical-llm-observability-with-datadog)
おわりに:DS x LLMプロダクト開発 15 LLMプロダクト開発はDSとSWEの合流点 一人で全領域のカバーは困難、DS・SWEが相互に補完・染み出しつつプロダクトの質を高める 「品質の不確実性」 と向き合うDS 「運用の不確実性」 と向き合うSWE
データセット整備 評価・改善のループ アーキテクチャ プロダクトの安定運用 監視
ご清聴ありがとうございました!