O contexto é a parte da despesa que mais cresce sem que ninguém a decida. Ninguém aprova “vamos pagar o triplo”: acrescenta-se um documento ao prompt, depois outro, e a fatura sobe. Cada token de contexto é cobrado em cada solicitação, e é isso que transforma uma janela longa num problema de custo.

Porque fica caro

Um modelo não se lembra de nada entre solicitações. Tudo o que quer que ele saiba —instruções, exemplos, histórico, documentos— viaja outra vez em cada pedido e é faturado outra vez. Se o seu prompt leva 20.000 tokens de contexto e faz 50.000 solicitações por mês, paga mil milhões de tokens de entrada só pelo contexto, sejam quais forem as respostas.

As três fugas típicas

FugaO que a causaComo se corrige
Histórico completoReenvia-se toda a conversa em cada turnoResumir turnos antigos e enviar só os recentes
Documentos inteirosAnexa-se o PDF completo “por precaução”Recuperar apenas os fragmentos relevantes
Prompt de sistema inchadoInstruções que se acumulam e nunca se podamReescrevê-lo e medir se a qualidade cai

Recuperar em vez de anexar

A correção estrutural é não meter o corpus no prompt. Indexam-se os documentos, recuperam-se os três ou quatro fragmentos que respondem à pergunta e enviam-se só esses. A qualidade costuma subir —menos ruído— e o contexto desce uma ordem de grandeza. Desenvolvemo-lo em RAG, fine-tuning e contexto.

O que convém manter longo

Nem todo o corte é bom. As instruções estáveis e os exemplos que fixam o formato são caros de retirar e baratos de manter se usar prompt caching: o bloco fixo fica em cache e paga-se a uma fração. A regra prática é contexto fixo e em cache em cima, contexto variável e mínimo em baixo.

Ponha-lhe um número

Antes de redesenhar seja o que for, meça. Meta os seus tokens de entrada atuais e o seu volume na calculadora de custo de tokens e compare o mesmo trabalho com metade do contexto: verá a diferença mensal de imediato. E siga o custo por tarefa antes e depois para confirmar que a qualidade não caiu.

Perguntas frequentes

Porque é que o contexto longo aumenta tanto o custo? Porque o contexto é enviado e faturado em cada solicitação. Um prompt grande não se paga uma vez: paga-se tantas vezes quantos pedidos fizer.

Quanto contexto é demasiado? Não há um número absoluto. O sinal é a proporção: se os tokens de entrada superam muito os de saída e boa parte são documentos ou histórico, tem margem.

Reduzir contexto piora as respostas? Muitas vezes melhora-as, porque o modelo deixa de competir com informação irrelevante. O que não se pode fazer é cortar sem medir o custo por tarefa e a qualidade antes e depois.


Na e-ficient medimos o custo por tarefa de empresas que já têm IA em produção e dizemos-lhe quanto pouparia com cada alavanca ao seu volume real. A primeira auditoria é gratuita se contratar um plano com compromisso de três meses e devolve um diagnóstico em 72 horas.