Blog Logo

Comparador de preços de APIs de IA: calcule sua fatura real

Semanas atrás recebi uma fatura de API quase o dobro do que eu tinha orçado. O motivo não era um bug: eu tinha comparado modelos olhando só o preço de entrada por milhão de tokens, quando minha carga real gera muito mais saída do que entrada — e a saída custa de 3 a 8 vezes mais. A tabela de preços do provedor não mente, mas também não conta a sua história.

O CostPerPrompt é um site gratuito que ataca exatamente isso: lista os preços por token de 232 modelos (OpenAI, Anthropic, Google, DeepSeek, Mistral, Meta, xAI, Qwen, GLM, Kimi e mais), atualizados automaticamente todos os dias, e ainda traz calculadoras que transformam esses preços numa fatura mensal estimada com o SEU padrão de uso: tokens de entrada e saída por requisição, taxa de acerto de cache e desconto de batch. Não é mais uma tabela bonita: é a tabela mais a conta que você deveria fazer de verdade antes de escolher um provedor.

Página inicial do CostPerPrompt com a lista de modelos e preços por milhão de tokens

Por que o preço da tabela engana

Todos os grandes provedores cobram do mesmo jeito: preço diferente para tokens de entrada (o que você manda) e de saída (o que o modelo gera), e a saída costuma custar de 3 a 8 vezes mais. Olhando as páginas oficiais hoje:

  • OpenAI: GPT-5.1 a $1,25 / $10 por milhão (entrada / saída). GPT-5-nano cai para $0,05 / $0,40.
  • Anthropic: Claude Sonnet 5 a $2 / $10 (preço de lançamento até 31 de agosto de 2026; depois sobe para $3 / $15). Haiku 4.5 a $1 / $5 e Opus 5 a $5 / $25.
  • DeepSeek: deepseek-v4-flash a $0,14 / $0,28, e com acerto de cache a entrada cai para $0,0028 por milhão. Atenção: eles anunciaram preços por faixa horária, com o dobro do valor nos horários de pico.
  • Mistral: Mistral Large a $2 / $6, com 50% de desconto em processamento em batch.

Segundo fator: o cache de prompts. Se a sua aplicação reenvia contexto repetido (um system prompt longo, o histórico de um chatbot, o esquema das suas tools), a parte cacheada é cobrada bem mais barata: na Anthropic a leitura de cache custa 10% do preço normal de entrada, nos GPT-5 da OpenAI o input cacheado também cai para 10%, e na DeepSeek o acerto de cache sai por cerca de 2% do preço sem cache. Terceiro fator: as APIs de batch da OpenAI, Anthropic e Mistral dão 50% de desconto em troca de processamento assíncrono.

Com essas três variáveis, dois modelos que na tabela parecem “de preço parecido” podem diferir em 3x na sua fatura real. E o contrário também: um modelo que parece caro pode sair barato se a sua carga se beneficia muito do cache.

O que o CostPerPrompt mede e como usar

A página principal é a listagem: 232 modelos com preço de entrada, saída e contexto cacheado por milhão de tokens, ordenáveis, com o contexto máximo de cada um. Os dados são atualizados automaticamente a partir das listagens públicas dos provedores (quando olhei, a última atualização era do mesmo dia).

A parte realmente útil está nas calculadoras:

  • API Cost Calculator: você informa requisições por dia, tokens de entrada e saída por requisição, taxa de cache e se usa batch, e ele compara o custo mensal entre todos os modelos de uma vez.
  • Chatbot Cost: simula conversas reais, com o histórico crescendo e sendo reenviado a cada turno e os TTLs de cache de cada provedor.
  • Agent Cost: loops de vários passos, esquemas de ferramentas e retentativas. Pelos números deles, um agente custa de 10 a 30 vezes mais do que a conta ingênua de “um prompt, uma resposta” sugere. Se você já rodou um agente em produção, isso não surpreende: cada iteração reenvia todo o contexto mais os resultados das tools.
  • Além disso: calculadoras de RAG (indexação, retrieval e geração cobrados separadamente), de voz (STT + LLM + TTS), preços de aluguel de GPUs, de APIs de imagem, e um contador de tokens que roda inteiro no seu navegador.

O fluxo que eu recomendo: puxe dos seus logs uma amostra real (requisições/dia, média de tokens de entrada e saída), estime qual porcentagem da sua entrada é contexto repetido cacheável, e jogue esses números na calculadora. Dez minutos e você tem uma comparação que realmente parece com a sua fatura.

Um exemplo com números verificados

Imagine uma carga típica de backend com IA: 50 mil requisições por mês, 1.500 tokens de entrada e 400 de saída por requisição. Isso dá 75 milhões de tokens de entrada e 20 milhões de saída por mês. Com os preços oficiais acima, a aritmética fica assim:

ModeloEntrada (75M)Saída (20M)Total/mês
Claude Sonnet 5 ($2/$10)$150$200$350
GPT-5.1 ($1,25/$10)$93,75$200$293,75
Mistral Large ($2/$6)$150$120$270
DeepSeek v4-flash ($0,14/$0,28)$10,50$5,60$16,10

Duas leituras. A primeira: a saída manda. No Sonnet e no GPT-5.1, 20 milhões de tokens de saída custam mais que 75 milhões de entrada; por isso comparar só o preço de entrada é o erro clássico. A segunda: a diferença entre provedores é brutal, de $350 a $16 pela mesma carga. Se o DeepSeek v4-flash dá conta do seu caso com a mesma qualidade é outra história (aí entram benchmarks e seus próprios testes), mas como candidato a avaliar, a calculadora coloca ele na sua frente em vez de deixar você ignorar.

Agora o efeito do cache. Se 60% da sua entrada é system prompt e contexto repetido, no Sonnet 5 esses 45M cacheados são cobrados a $0,20 por milhão em vez de $2: a entrada cai de $150 para $69 e o total baixa para $269. E se a sua carga ainda aceita batch (resumos noturnos, classificação assíncrona), os 50% de desconto cortam a fatura pela metade de novo. Nada disso aparece olhando só a tabela de preços.

Truques para pagar menos em APIs de IA

  1. Meça antes de mexer em qualquer coisa. Sem suas taxas reais de entrada/saída você está otimizando no escuro. Os logs de uso do seu provedor já te dão isso. Se preferir um monitor físico, o PocketMeter é um gadget com ESP32 que mostra o gasto com Claude, Codex e similares numa tela.
  2. Cascata de modelos. Mande tudo para o modelo barato (Haiku 4.5 a $1/$5, GPT-5-nano a $0,05/$0,40) e escale para o grande só o que falhar numa validação simples. Em muitas cargas, 80% das requisições não precisam do flagship.
  3. Projete com o cache em mente. System prompt estável no início do contexto, sem timestamps nem IDs que mudem a cada chamada. Um prefixo que varia quebra o cache inteiro.
  4. Batch para o que não é interativo. 50% de desconto na OpenAI, Anthropic e Mistral em troca de esperar.
  5. Avalie alternativas com dados, não com vibes. DeepSeek, Qwen, GLM ou modelos open-weight via provedores terceiros aparecem no CostPerPrompt com preços que às vezes são 5-10% do flagship americano. Teste sua carga real contra eles antes de jurar lealdade a um provedor.

O que você precisa verificar sozinho

O CostPerPrompt é um ponto de partida, não a fonte definitiva — e eles mesmos dizem isso no rodapé: confirme o preço final na página oficial do provedor antes de orçar. Se usa Claude, também vale revisar Claude Opus 5 para programar: preço, tokens e setup antes de orçar. Coisas concretas para revisar:

  • Preços de lançamento: o Sonnet 5 sobe de $2/$10 para $3/$15 em 31 de agosto de 2026. Se a sua comparação assume o preço atual, seu orçamento de setembro desvia 50%.
  • Tarifas por faixa horária: a DeepSeek anunciou preço em dobro nos horários de pico (9h-12h e 14h-18h, horário de Pequim). Se o seu tráfego se concentra aí, a média muda.
  • O cache tem TTL e mínimos: na Anthropic o preço de leitura cacheada das tabelas assume TTL de 5 minutos, e existe um contexto mínimo para uma chamada ser cacheável. Um chatbot com conversas espaçadas pode ter taxa de acerto bem menor do que você imagina.
  • Preço não é qualidade: a calculadora não mede qualidade de resposta, latência nem limites de rate. Para isso você precisa das suas próprias avaliações.
  • O site se financia com links de afiliado para alguns provedores. Os dados de preço vêm de listagens públicas e batem com o que verifiquei hoje, mas é um incentivo a se ter em mente.

O processo completo leva cerca de quinze minutos: puxe suas métricas de uso, jogue no CostPerPrompt, confira os dois ou três vencedores nas páginas oficiais de preço e rode um teste de qualidade com a sua carga real. Se com isso você descobrir que está pagando preço de flagship por um trabalho para modelo pequeno, a ferramenta já te economizou mais do que muita otimização de código. Também falei sobre Kimi K3 e seus custos frente a outras opções, outro candidato que merece passar pela calculadora.

Perguntas frequentes

Qual a diferença entre preço de entrada e saída numa API de IA?

Os provedores cobram o input (o que você envia) e o output (o que o modelo gera) separadamente. O output costuma custar de 3 a 8 vezes mais, por isso uma carga com muita saída pode encarecer a fatura mesmo que a entrada seja barata.

Como calcular o custo real de uma API de IA?

Multiplique os tokens de entrada e saída pelo preço por milhão, some ambos, aplique o desconto de cache sobre o contexto repetido e, se aplicável, o desconto de 50 % por batch. Ferramentas como CostPerPrompt automatizam essa conta com a sua carga real.

Vale a pena usar batch em APIs de IA?

Sim, para tarefas que não precisam de resposta imediata, como resumos noturnos ou classificação assíncrona. OpenAI, Anthropic e Mistral costumam aplicar 50 % de desconto em troca de processamento diferido.


O que você achou?

Deixe sua opinião, pergunta ou sugestão. Os comentários são sincronizados com GitHub Discussions .

Voltar ao blog