Escolher o modelo por tarefa é, de longe, a maior alavanca de custo. A maioria das tarefas —classificar, extrair, resumir— resolve-as um modelo pequeno a uma fração do preço do grande. O erro mais caro é usar o modelo mais potente para tudo: reserve o grande para o que realmente o precisa e encaminhe o resto para o pequeno.

É a primeira das 7 alavancas para reduzir a fatura da OpenAI e a que mais mexe o ponteiro.

Que modelo por tipo de tarefa

TarefaModeloCusto relativo
Classificar, etiquetar, encaminharPequenoMuito baixo
Extrair dados de um textoPequenoMuito baixo
Resumir, reescreverPequeno / médioBaixo
Redação com matiz, tomMédioMédio
Raciocínio complexo, código difícilGrandeAlto

O erro de usar o grande para tudo

O modelo mais potente é também o mais caro por token, às vezes numa ordem de grandeza. Se o usa para classificar tickets ou extrair campos de uma fatura, paga preço de raciocínio avançado por uma tarefa que um modelo pequeno acerta. Em volume, essa diferença é a maior parte de uma fatura inchada.

Como decidir

Parta da tarefa, não do modelo. Pergunte que capacidade mínima a resolve bem: se um modelo pequeno dá a qualidade que precisa, a decisão acaba aí. Suba de nível só quando a qualidade do pequeno fica curta de forma mensurável, não por defeito.

Como encaminhar

O padrão habitual é uma porta barata à frente: um classificador pequeno (ou umas regras) olha para cada pedido e manda-o ao modelo certo. O simples vai ao pequeno; só o que realmente o precisa escala ao grande. Assim paga o modelo caro apenas na fração de pedidos que o justificam.

Ponha número

Antes de fixar o encaminhamento, meça quanto muda o custo por modelo. Ponha os seus tokens e o seu volume na calculadora de custo de tokens e compare o mesmo trabalho num modelo grande e num pequeno: verá a diferença mensal de golpe. Tudo isto faz parte do custo por tarefa que a e-ficient mede.

Perguntas frequentes

Que modelo de IA devo usar para cada tarefa? Um pequeno para classificar, extrair e resumir; um médio para redação com matiz; reserve o grande para raciocínio complexo ou código difícil. Comece pelo pequeno e suba só se a qualidade ficar curta.

Quanto se poupa escolhendo bem o modelo? É a alavanca de maior impacto: encaminhar as tarefas simples a um modelo pequeno pode baixar o custo desses pedidos entre 50 e 90 %.

Combina-se com as outras alavancas? Sim. Sobre o modelo já bem escolhido somam-se o prompt caching e o batch API.


Na e-ficient medimos o custo por tarefa de empresas que já têm IA em produção e dizemos-lhe quanto pouparia com cada alavanca ao seu volume real. A primeira auditoria é gratuita se contratar um plano com compromisso de três meses e devolve um diagnóstico em 72 horas.