Nesta palestra, compartilho aprendizados práticos ao comparar múltiplos LLMs (como GPT, Gemini, Qwen e Gemma) em um sistema real de Busca Agêntica, analisando trade-offs entre qualidade, latência, custo e uso de tokens.
Mostro como diferentes modelos se comportaram em tarefas como interpretação de query, expansão de busca e reranking, e por que resultados de benchmark nem sempre refletem o desempenho em produção. Também abordo estratégias de avaliação (incluindo LLM Judge, testes A/B, e métricas), pontos de atenção, refinamento de prompts, além de desafios e aprendizados ao explorar fine-tuning supervisionado e com reforço.