HMDeveloper
Todos os artigos
agentes-ia
agentes-iaragatendimento

As cinco decisões que definem o custo de um agente de atendimento com RAG

Quando um dono de pequena empresa pergunta quanto custa um agente de IA, a resposta está em cinco decisões técnicas que começam bem antes da primeira linha de código.

Quando um dono de pequena empresa pergunta "quanto custa um agente de atendimento com IA?", a resposta honesta não é um número. É uma lista de cinco decisões que ninguém conta na demo.

Cada uma dessas decisões multiplica ou divide o custo final. E o pior: várias delas são ignoradas até o sistema quebrar em produção.

1. Canal e volume

Um agente que responde por chat no site tem um perfil de custo. Um agente que responde por WhatsApp, com áudio, em horário comercial, tem outro.

O volume importa mais que o canal. Se você recebe 30 perguntas por dia, um modelo local pequeno resolve com qualidade aceitável e custo quase zero. Se recebe 3.000, o modelo local pode não dar conta da latência, e cada pergunta que escala para um modelo cloud custa tokens.

A primeira decisão é medir: quantas conversas por dia, em que canais, em que horários. Sem esse número, qualquer orçamento é invenção.

2. O que entra na base e quem mantém

O RAG é tão bom quanto o conteúdo que ele consulta. Se a base tem manual desatualizado, FAQ genérica e PDF escaneado torto, o agente responde com confiança e erra com convicção.

Alguém precisa decidir o que entra, manter atualizado e testar. Isso é trabalho humano contínuo — não é treinamento de modelo, é curadoria de conteúdo. Em sistemas que eu construí, a ingestão de documentos é automática, mas a validação de qualidade ainda passa por uma pessoa. Se você não tem ninguém para esse papel, o custo real é o custo das respostas erradas que o agente vai dar.

3. Modelo por tarefa e roteamento local → cloud

Nem toda pergunta precisa do modelo mais caro. "Qual o horário de funcionamento?" pode ser respondida por um modelo local pequeno. "O produto X cobre o caso Y com a regulamentação Z?" talvez precise de um modelo cloud maior.

O padrão que aplico é roteamento: o modelo local tenta primeiro. Se a confiança da resposta fica abaixo de um limiar, ou se a pergunta exige raciocínio que o modelo local comprovadamente não entrega, escala para cloud.

Isso transforma o custo de "toda pergunta paga o preço cheio" para "só as perguntas difíceis pagam o preço cheio". Em volume alto, a diferença é a conta caber no orçamento ou não.

4. Quando o agente diz "não sei" e escala para humano

O RAG sempre devolve um primeiro resultado — a similaridade de cosseno não julga relevância, só ordena vetores. Como escrevi em outro artigo, o sistema bom sabe quando o trecho recuperado não serve.

Traduzindo para custo: um agente que nunca diz "não sei" gera resposta errada com fonte. Um agente que diz "não sei" demais frustra o cliente. Entre os dois extremos, existe uma decisão de produto: qual o limiar de similaridade abaixo do qual o agente escala para um humano?

Essa decisão define quantos atendentes humanos você ainda precisa manter. E atendente humano é a linha mais cara da planilha.

5. Observabilidade e custo por conversa

Sem log, você não sabe quanto custa cada conversa. Sem saber quanto custa, você não sabe se o sistema se paga.

Métricas mínimas: tokens consumidos por conversa, proporção de conversas resolvidas sem escalar para humano, latência p95, e custo em reais por conversa. Semana 1 é baixinho. Semana 12, se ninguém olhou, pode ter triplicado porque alguém subiu um PDF de 400 páginas que o agente lê inteiro em toda pergunta.

Onde isso quebra

Agente de atendimento não é projeto com fim. É produto com manutenção. Se você tratar como projeto — entregou, testou, fechou — ele funciona até a base desatualizar, o volume dobrar ou o gateway de pagamento do modelo cloud mudar a precificação. E isso acontece.

Se você quer explorar isso para o seu negócio, me conte o contexto.

Trabalho com times que estão adotando agentes de IA no dia a dia de engenharia. Se isso é o seu caso, vamos conversar.

Ver consultoria
As cinco decisões que definem o custo de um agente de atendimento com RAG | Hugo Minari Diniz