新しい LLM が登場した際、ベンチマークだけを信じて本番切り替えを行うと、レイテンシ悪化やユーザー体験の悪化といった予期せぬトラブルを招きます。
本番レイテンシに一切影響を与えずに候補モデルへトラフィックをミラーリングする「Shadow Testing 基盤」の設計と、どのモデルかがわからない横並びの A/B テストの実装を紹介します。
さらに、実際のユーザー対話データから見えてきた「最新モデルより軽量モデルが好まれた意外な理由」や、トピックに応じた動的モデルルーティング、Batch API を用いたコスト半減手法など、本番運用に直結する知見を共有します。