Todos os cursos
Avançado·5 semanas·Turma ao vivo, 2 sessões/semana
Evals e Confiabilidade para Apps de LLM
Pare de entregar no feeling. Construa as estruturas de avaliação, os guardrails e a observabilidade que permitem trocar modelos e prompts com confiança.
O que você vai aprender
- Construir suítes de eval offline e online que pegam regressões de verdade
- Desenhar datasets que representam como o seu app realmente falha
- Usar LLM-como-juiz corretamente — e saber quando não usar
- Instrumentar a produção com tracing e alertas
- Entregar mudanças de prompt e modelo sem prender a respiração
Conteúdo do curso
Medindo qualidade
- O que é, de fato, um eval
- Construindo datasets representativos
- Métricas que significam algo
Julgamento automatizado
- LLM-como-juiz, feito direito
- Calibração e viés
- Gates de regressão no CI
Confiabilidade em produção
- Tracing e observabilidade
- Guardrails e fallbacks
- Plantão (on-call) para sistemas de IA
O curso que os times pedem depois do primeiro incidente
Todo mundo aprende essa lição cedo ou tarde: a demo funcionou, você entregou e, três semanas depois, um ajuste no prompt quebrou silenciosamente um fluxo que ninguém estava observando. Evals são como você para de viver assim.
Este é um curso avançado. Você já deve estar construindo com LLMs — aqui a gente torna esse trabalho mensurável, testável e seguro de mudar.
O que você leva ao final
Uma suíte de avaliação de verdade para a sua própria aplicação, um gate de CI que bloqueia regressões e tracing em produção que avisa quando o comportamento desvia. No fim, você troca de modelo numa sexta à tarde e dorme tranquilo.