Guia de produção de agentes de IA: evite US$ 3,4 mil
21 de janeiro de 2025
No mês passado, queimei US$ 3.400 em custos de API com um agente de atendimento ao cliente descontrolado. Hoje, esse mesmo sistema lida com mais de 1.000 consultas diárias por menos de US$ 50. Aqui está o que aprendi da maneira mais difícil.
A verificação da realidade
Todo mundo está construindo agentes de IA. Poucos falam sobre o que acontece quando encontram usuários reais. Depois de distribuir agentes em três sistemas de produção, coletei algumas cicatrizes de batalha que valem a pena compartilhar.
A promessa é sedutora: sistemas autónomos que pensam, agem e se adaptam. A realidade? A maioria dos agentes são caros enquanto circulam com delírios de grandeza.
O erro de $ 3.400
Nosso primeiro agente usou LangChain com GPT-4. Arquitetura simples:
- Analisar a consulta do usuário
- Busque documentos relevantes
- Gerar resposta
- Validar a precisão
- Refine se necessário
Parecia à prova de balas. Até que um usuário perguntou sobre “todas as variações possíveis do produto”.
O agente entrou em um loop recursivo, gerando variações, validando-as, encontrando problemas e gerando mais. 47 minutos. 2,3 milhões de tokens. US$ 3.400.
Lição aprendida: Os agentes precisam de disjuntores, não apenas de grades de proteção.
O que realmente funciona
Após três meses de iteração, aqui está nossa arquitetura de produção:
1. Gerenciamento de orçamento de token
pythonclass AgentExecutor: def __init__(self, max_tokens=50000, max_iterations=5): self.token_budget = max_tokens self.iteration_limit = max_iterations
Cada agente recebe um limite de tokens rígidos. Período. Sem exceções.
2. Estratégia de modelo em camadas
- Classificador: Claude Haiku (US$ 0,25/1 milhão de tokens) - Consultas de rotas
- Consultas simples: GPT-3.5 Turbo – Lida com 70% das solicitações
- Tarefas complexas: GPT-4 - Somente quando necessário
- Validação: Gemini Flash – Verificação dupla econômica
Isso reduziu os custos em 85% sem degradar a qualidade.
3. Persistência estatal que funciona
Esqueça máquinas de estado complexas. Usamos pontos de verificação JSON simples:
json{ "stage": "data_retrieval", "tokens_used": 12500, "iterations": 2, "context": {...}, "can_resume": true }
Se algo falhar, retomamos do ponto de verificação, não do zero.
As métricas que importam
Métricas de vaidade não vão salvar você. Em vez disso, rastreie estes:
- Custo por resolução bem-sucedida: o nosso caiu de US$ 8,50 para US$ 0,12
- Taxa de tempo limite: deve ser inferior a 2%
- Taxa de transferência humana: estamos em 18% (era 65%)
- Tempo de resposta P95: 4,2 segundos (os usuários toleram até 5)
Três percepções não óbvias
1. O determinismo vence a inteligência
Agentes inteligentes são imprevisíveis. Agentes idiotas com bons trilhos são lucrativos. Substituímos nosso agente de “raciocínio” por uma combinação de árvore de decisão + LLM. Melhores resultados, 90% menos custo.
2. Streaming economiza mais que dinheiro
Os usuários abandonam após 3 segundos de silêncio. As respostas por streaming reduziram o abandono em 60%. O impacto psicológico importa mais do que a elegância técnica.
3. Os modos de falha são recursos
Nosso agente agora diz “Preciso de ajuda humana” mais rápido. A satisfação do usuário aumentou. Contra-intuitivo, mas verdadeiro: os usuários preferem um escalonamento rápido em vez de tentativas demoradas e fracassadas.
A estrutura que escala
Aqui está nossa pilha atual:
- Orquestração: Temporal (não LangChain)
- BD de vetor: Qdrant (auto-hospedado)
- Monitoramento: OpenTelemetry + Grafana
- Disjuntor: middleware Python personalizado
- Testes: Conjunto de dados dourado proprietário (1.000 consultas reais)
O que vem a seguir?
A corrida do ouro dos agentes é real, mas a maioria das equipes está otimizando para demonstrações, não para produção. Os vencedores serão aqueles que entenderem que agentes são ferramentas, não mágicas.
Minha previsão: 2025 será o ano dos agentes “chatos” – especializados, previsíveis e lucrativos. O sonho da AGI pode esperar; as empresas precisam de soluções que funcionem hoje.
Principais conclusões
�?Comece com um caso de uso restrito �?Adicione restrições, não capacidades �?Meça tudo �?Sempre, sempre tenha um kill switch
Atualmente em construção: Um modelo de previsão de custos do agente. Siga para atualizações sobre engenharia de IA do mundo real.