Um token é a unidade mínima em que um modelo de IA lê, escreve e fatura o texto. Não é uma palavra nem uma letra: é um fragmento. Em português e em inglês, um token equivale em média a uns 4 caracteres, ou aproximadamente 0,75 palavras. Tudo o que paga numa API de IA mede-se em tokens, de entrada e de saída.

Num relance

O que éA unidade em que o modelo parte o texto
Tamanho médio~4 caracteres · ~0,75 palavras
Referência rápida1.000 tokens ≈ 750 palavras ≈ 1,5 páginas
Como se faturaPor tokens de entrada e de saída, com preços diferentes

Como o texto é partido

O modelo não vê palavras, vê tokens. As palavras comuns costumam ser um só token; as raras, os nomes próprios, os números longos ou as palavras noutros idiomas partem-se em vários. Por isso o mesmo texto traduzido pode custar mais ou menos consoante o idioma: não muda o conteúdo, muda em quantos pedaços é cortado.

Entrada e saída cobram-se de forma diferente

Cada pedido paga duas coisas: os tokens que envia (entrada: o seu prompt, as instruções, o contexto) e os que o modelo devolve (saída: a sua resposta). A saída custa bastante mais por token do que a entrada, por isso uma resposta longa pesa mais na fatura do que parece.

Porque isto determina a sua fatura

O seu custo não depende de quantos pedidos faz, mas de quantos tokens move. Um prompt com um documento inteiro colado lá dentro pode custar mais do que cem perguntas curtas. A fórmula é sempre a mesma: tokens × preço por token × volume de pedidos. Daí sai o custo por tarefa, que é a métrica que realmente importa.

Conte os seus

Meta os seus tokens de entrada e de saída e o seu volume mensal na calculadora de custo de tokens e compare entre modelos: verá num minuto de onde vem o seu gasto. Se o número o surpreender, comece pelas 7 alavancas para reduzir a fatura.

Perguntas frequentes

Quantas palavras são 1.000 tokens? Cerca de 750 palavras, ou umas 1,5 páginas de texto corrido. É uma média: os números, os nomes próprios e os idiomas menos frequentes gastam mais tokens por palavra.

Entrada e saída cobram-se igual? Não. A saída custa várias vezes mais por token do que a entrada, por isso limitar o comprimento das respostas é uma das alavancas de poupança mais rápidas.

O prompt do sistema conta? Sim. Tudo o que envia conta como entrada em cada solicitação, incluindo as instruções fixas, salvo se usar prompt caching para não as pagar de cada vez.


Na e-ficient medimos o custo por tarefa de empresas que já têm IA em produção e dizemos-lhe quanto pouparia com cada alavanca ao seu volume real. A primeira auditoria é gratuita se contratar um plano com compromisso de três meses e devolve um diagnóstico em 72 horas.