Blog
O que aprendemos ao medir o gasto em IA de empresas que já a têm em produção.
-
Preços dos tokens: as mudanças de 2026 que sobem a sua fatura sem que toque em nada
Promoções com data, escalões de contexto longo, agravamentos por residência de dados e uma subida já anunciada para janeiro de 2027. O que mudou na OpenAI, na Anthropic e na Google, e o que fazer com isso.
Ler → -
Modelo próprio vs API: quando compensa o self-hosting
Quando compensa alojar o seu próprio modelo em vez de pagar por API: o limiar real de volume, os custos que ninguém soma e como decidir com números.
Ler → -
Porque é que o contexto longo dispara o custo da IA
Cada token de contexto é cobrado em cada solicitação. Porque é que as janelas longas multiplicam a fatura e como reduzi-las sem perder qualidade.
Ler → -
Como monitorizar o gasto em IA: que métricas seguir
O que medir para controlar o custo da IA: custo por tarefa, por utilizador e por endpoint. Sem essas três métricas não sabe onde está a pagar a mais.
Ler → -
O que é um token de IA e como é cobrado
Um token é a unidade em que os modelos de IA leem e faturam o texto: cerca de 4 caracteres ou 0,75 palavras. Como se contam e porque determinam a sua fatura.
Ler → -
Que modelo usar em cada tarefa: a maior alavanca de custo
Como escolher o modelo de IA segundo a tarefa: a maioria resolve-se com um modelo pequeno a uma fração do preço. Tabela tarefa → modelo → custo e como encaminhar.
Ler → -
Batch API: metade do custo se a tarefa pode esperar
O que é o batch API e quanto poupa: cerca de 50 % face às solicitações em tempo real, em troca de não ser imediato. Que tarefas encaixam e quais não.
Ler → -
Prompt caching: paga uma vez pelo contexto que se repete
O que é o prompt caching e quanto poupa: 50-90 % nos tokens de contexto que reutiliza entre solicitações. Quando compensa e como ativá-lo sem tocar na qualidade.
Ler → -
Como reduzir a fatura da OpenAI: 7 alavancas de poupança
Sete formas de baixar o custo da API de IA sem perder qualidade, ordenadas pelo quanto poupam. A maioria aplica-se em horas, não em semanas.
Ler → -
GPT-4o, Claude e Gemini: preços de API comparados (2026)
Quanto custa cada modelo por milhão de tokens e, o que de facto importa, quanto cada um acaba por custar no seu caso consoante o volume. A tabela e o porquê.
Ler → -
RAG, fine-tuning ou contexto longo: qual sai mais barato para o seu caso
A comparação costuma fazer-se pela qualidade. Mas a decisão quebra-se quase sempre pelo custo, e aí as três opções comportam-se de forma muito diferente.
Ler → -
Custo por token e custo por tarefa: porque a sua fatura de IA sobe mesmo quando os preços descem
A OpenAI cortou os preços da API até 80% e muitas empresas viram a fatura subir no mês seguinte. A explicação está na unidade que está a medir.
Ler →