Slide 3
Slide 3 text
課題
生成AI
アプリケーションの精度向上には、
自動評価のための LLM-as-a-Judge
が必要。
LLM-as-a-Judge
の精度を向上するには、良い・悪いの基準を human annotation
と
して与えるのが一般的
しかし、次の 3
つが課題となる:
1. Human annotation
を適切に行うこと(負荷・一貫性・品質)
2. Human annotation
から信頼性の高い LLM-as-a-Judge
を作成すること
3. LLM-as-a-Judge
の評価結果からアプリケーションのプロンプトを改善すること
必要なのは、人間の負担を抑えつつ、
評価エージェントと生成エージェントを改善する仕組み。
3 / 16