Evals de agentes de IA viraram condição de produção em 2026. CTO mid-market B2B que coloca agente em cliente confiando em demo descobre em 6 a 12 meses que 30 a 45% das interações tinham resposta errada, alucinação ou regressão depois do último deploy. Este artigo mostra o framework de 5 camadas, custo real em mid-market BR e o playbook de 90 dias para sair do MVP que parece pronto e chegar em agente que aguenta tráfego real.
Por que demo de agente engana o CTO em 2026?
Porque demo testa cenário curado pelo fornecedor, não distribuição real de input do usuário. Segundo o Augment Code em Best AI Agent Evaluation Tools 2026, citando o LangChain State of AI Agents 2026, 57% das organizações já têm agentes em produção e 32% citam qualidade como a principal barreira para deploy. Agente que acerta 100% em 8 prompts de demo costuma cair para 55-70% em distribuição real.
O VentureBeat sobre Monitoring LLM Behavior mostra que drift, retries e refusal patterns degradam silenciosamente entre releases. Sem instrumentação, o time descobre por reclamação de cliente, churn ou auditoria de compliance, que sempre chegam 3 a 9 meses depois.
Em projetos de IA que estruturei em mid-market BR, o padrão se repete. Empresa contrata fornecedor de agente, faz POC de 6 semanas, vai para produção com 90% de acurácia medida em 50 prompts. 4 meses depois, NPS do produto cai 12 pontos e o time descobre que a acurácia real era 62% no tráfego do tier 3 de clientes que ninguém testou no POC.
O custo invisível desse atraso em mid-market BR: conectando o tempo médio de 6 a 12 meses entre deploy e descoberta de regressão com o ticket médio de R$300K a R$800K ACV em mid-market B2B, cada cliente perdido por agente quebrado custa R$1,8M a R$4,8M de LTV (assumindo 6 anos de retenção média). Em uma carteira de 80 clientes ativos, basta 3 cancelamentos por qualidade de IA para o programa inteiro virar passivo de R$5,4M a R$14M.
Quais são as 3 categorias de evals que viraram padrão?
Em 2026, evals se consolidaram em 3 categorias complementares, segundo o Future AGI em Best LLM Evaluation Frameworks 2026:
- Determinístico. Testa output contra resposta exata, regex, formato JSON válido, presença de campo obrigatório. Barato (custa quase zero), rápido (milissegundos), pega regressão estrutural. Cobertura ideal: 30-40% do golden dataset.
- Rubrica (LLM-as-judge ou human). LLM (Claude, GPT-4, Gemini) avalia output contra rubrica em português (“resposta cita a política correta?”, “tom adequado a cliente B2B?”). Custa US$0,003-0,015 por avaliação. Pega qualidade subjetiva. Cobertura ideal: 50-60% do golden dataset.
- Composto. Combina determinístico + rubrica + métricas operacionais (latência, custo, retries). Usado para gate de release. Cobertura ideal: 100% do golden dataset em runs noturnos.
Segundo o Label Your Data em LLM as a Judge 2026, o LLM-as-judge entrega 500x a 5000x economia comparado a human evaluation com consistência equivalente entre juízes humanos. A regra anti-bias mais citada: use modelo de família diferente para julgar (OpenAI julgando Anthropic, ou vice-versa) para evitar self-preference bias.
Framework de 5 camadas para evals contínuos
O framework que aplico em mid-market BR roda em 5 camadas. Cada uma resolve um tipo distinto de falha. Pular qualquer uma deixa um vazamento aberto.
| Camada | Função | Frequência | O que pega |
|---|---|---|---|
| 1. Golden dataset versionado | 50-500 prompts curados com expected output e metadata | Atualizado mensalmente | Cenário conhecido + edge cases mapeados |
| 2. Offline evals em CI | Roda golden dataset a cada PR antes do deploy | A cada commit + nightly | Regressão entre versões + bug introduzido |
| 3. Production evals assíncronos | LLM-as-judge sobre amostra de tráfego real | Contínuo, sample 5-15% | Queda de qualidade em produção |
| 4. Drift + human review | Estatística sobre distribuição + revisão de outliers | Semanal | Drift de input + edge case novo |
| 5. Feedback loop | Falha em produção vira novo prompt do golden | Mensal | Bug que escapou vira teste regressivo |
Segundo a Maxim AI em Building a Golden Dataset, o golden dataset deve cobrir 70-80% dos casos comuns + 20-30% de edge cases (entrada quebrada, prompt injection tentado, multilíngue, ambiguidade). O Google Cloud em A Methodical Approach to Agent Evaluation reforça que offline pega o que já foi modelado e production pega o que não foi antecipado.
Golden dataset: coleção versionada de prompts, contextos e respostas esperadas que vira fonte de verdade para medir qualidade ao longo do ciclo de vida do agente.
Qual stack de evals cabe em mid-market BR?
O mercado se consolidou em 3 plataformas dominantes para 2026, segundo comparativo independente LangSmith vs Arize vs Braintrust: LangSmith (LangChain ecosystem), Arize AI (enterprise monitoring) e Braintrust (quality management). O Braintrust fechou em 2026 Series B de US$80M liderada pela ICONIQ a US$800M de valuation, sinal de que o mercado está consolidando em torno de quem ataca qualidade como produto.
| Plataforma | Forte em | Pricing entry | Encaixe mid-market BR |
|---|---|---|---|
| LangSmith | Times no ecossistema LangChain, agent engineering | Plus US$39/mês + US$0,50/1K traces | Alto para times Python/LangChain |
| Braintrust | Quality management, unlimited users | US$249/mês unlimited users | Alto para times com 5+ engenheiros |
| Arize AX | ML + LLM em uma plataforma, regulado | Por span/volume (enterprise) | Médio para mid-market regulado (fin, saúde) |
| Langfuse (open source) | Self-host, observabilidade base | Self-host gratuito ou cloud US$59/mês | Alto para times com restrição de orçamento |
| Promptfoo (open source) | CI eval determinístico + rubrica | Gratuito | Alto como complemento para gate de CI |
Segundo o Confident AI em Top LangSmith Alternatives 2026, o desenho mais comum em mid-market é Langfuse ou LangSmith como observabilidade base + Promptfoo no CI + LLM-as-judge custom rodando no próprio infra (custo controlado). Braintrust e Arize entram quando a operação passa de 500K requests/mês ou regulação exige certificações SOC2/HIPAA/GDPR.
Quanto custa rodar evals em produção?
Em mid-market BR com 1 a 3 agentes em produção e 80K a 250K requests/mês, custo ano 1 fica entre R$180K e R$580K. Composição típica:
- Plataforma (LangSmith/Braintrust/Arize/Langfuse): R$24K a R$120K/ano.
- Inferência LLM judge (5-15% sampling): R$30K a R$140K/ano.
- Engenheiro de ML/IA dedicado parcial (30-50% FTE): R$90K a R$270K/ano (CLT R$25-45K/mês).
- Curadoria golden dataset (40-60h trimestrais): R$36K a R$50K/ano.
ROI fecha quando o programa evita 1 a 3 cancelamentos por qualidade. Como cada cliente mid-market BR vale R$1,8M a R$4,8M de LTV, o break-even costuma chegar entre 6 e 14 meses, dependendo do tamanho da carteira e da criticidade do agente para o produto.
Playbook 90 dias para CTO
- Dias 1-30 (golden dataset + CI). Roda audit em todo agente em produção, lista os top 100 casos comuns + 20 edge cases. Implementa Promptfoo no CI para golden dataset rodar em cada PR. Define 3 métricas mínimas (acurácia, latência, custo por request) com baseline atual.
- Dias 31-60 (production evals + LLM judge). Implementa Langfuse ou LangSmith como camada de tracing em produção. Configura LLM-as-judge com Claude ou GPT-4 rodando em 10% do tráfego como sampling. Documenta rubrica em português. Cria alerta para queda de score acima de 5pp em 7 dias.
- Dias 61-90 (drift + feedback loop). Implementa drift detection sobre distribuição de input. Roda human review semanal em outliers (1 hora por engenheiro). Cria processo: falha em produção vira novo prompt no golden dataset em até 7 dias. Apresenta resultados ao CEO e Diretor de Produto.
O insight original que vejo em mid-market BR: conectando o dado de 32% de orgs com qualidade como barreira (LangChain) com o custo médio de R$1,8-4,8M de LTV por cliente mid-market B2B, o programa de evals só fecha matemática como motor de crescimento, não como custo de TI. CTO que apresenta evals como “vamos garantir qualidade” perde budget. CTO que apresenta como “vamos proteger R$15M+ de LTV em risco” passa direto.
5 erros que matam o programa de evals
- Usar o mesmo modelo para gerar e julgar. Claude julgando Claude tem self-preference bias documentado. Use família diferente.
- Não versionar golden dataset. Sem versão, perde rastreabilidade de regressão e comparação entre releases.
- Eval só em pré-produção. Drift acontece em produção. Sem production evals, o programa pega 40% das falhas reais.
- Confiar 100% em LLM-as-judge. LLM judge tem viés. Combine sempre com human review em 1-3% de outliers semanais.
- Comprar plataforma cara antes de provar disciplina. Começa com Promptfoo + Langfuse open source. Migra para Braintrust ou Arize quando a operação passa de 500K requests/mês.
5 ações para essa semana
- Lista todos os agentes em produção e marca quais têm golden dataset versionado. Provavelmente 80% não têm.
- Implementa Promptfoo no CI com 30 prompts iniciais. É gratuito e roda em 1 tarde.
- Configura Langfuse ou LangSmith como tracing para o agente mais crítico.
- Calcula LTV em risco da carteira atual (clientes ativos x ACV x retention médio) e usa como argumento de budget de evals.
- Reúne Diretor de Produto, Head de Engenharia e Head de Atendimento para alinhar quem é dono da curadoria do golden dataset.
Para conectar este artigo com decisões adjacentes que o CTO precisa tomar em 2026, vale conferir segurança de agentes de IA com playbook de 5 camadas e a camada de revenue data warehouse que alimenta o dado para os evals rodarem em contexto certo.
Em 2026, a diferença entre CTO mid-market B2B que escala IA com confiança e o que vive apagando incêndio cabe em 1 disciplina: evals contínuos. Sem isso, demo bonita vira passivo silencioso de R$5M+ em 12 meses.
Comentários (0)