Cobrança da Claude API: como funciona o custo quando sua aplicação vai para produção?

cobrança da Claude API em produção mostrando preço por milhão de tokens
Resposta rápida

A cobrança da Claude API funciona por uso, não por assinatura: você compra créditos pré-pagos antes de chamar a API e cada requisição desconta tokens de entrada e de saída, com preço por milhão que muda conforme o modelo. Sonnet 5 sai a US$ 2 de entrada e US$ 10 de saída por milhão de tokens, Haiku 4.5 a US$ 1 e US$ 5, Opus 5 a US$ 5 e US$ 25. A Batch API tira 50%, leitura de cache custa 10% do preço de entrada e, sem saldo, as chamadas simplesmente param. Teto de gasto e alerta ficam no Claude Console

Fala aí, beleza? Tem uma diferença que pega muita gente de surpresa na hora de colocar produto no ar: assinatura é conta fechada, API é conta aberta

Na assinatura tu sabe o valor antes de usar. Na API é o contrário: paga-se por token consumido, então quem escreve a fatura no fim do mês é o volume de requisições do seu produto

E isso muda o jogo quando a integração sai do seu localhost e vai pro ar com usuário real batendo nela sem pedir licença

A ideia aqui é te dar o mapa da cobrança da Claude API ANTES do lançamento: como o dinheiro entra (créditos), quanto custa cada modelo, o que infla a conta em produção e onde tu coloca teto e alerta pra não tomar susto 🙂

Créditos pré-pagos: o modelo de pagamento por trás da API

O uso da Claude API e do Workbench é faturado por créditos de uso pré-pagos, e a palavra importante ali é pré: tu compra os créditos antes de usar, não depois

Se você conhece cartão de celular pré-pago, é exatamente a mesma lógica: carrega saldo, consome, recarrega

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Esses créditos não servem só pra API. Eles cobrem API, Workbench e Claude Code, ou seja, é o mesmo bolso alimentando os três

Que acontece se o saldo zera? As chamadas à API param e o Workbench para junto. Não tem meio termo aqui, não tem fatura no fim do mês pra pagar depois: sem crédito, sem resposta

Por isso existe a recarga automática (auto-reload). Tu define duas coisas: o saldo mínimo da conta e o valor que deve ser comprado quando esse mínimo for atingido

Tome cuidado com um detalhe que pouca gente lê: os créditos de uso da API expiram um ano após a data de compra, e essa expiração não pode ser estendida

Ou seja, carregar um valor gigante de uma vez só "pra não pensar nisso nunca mais" pode sair caro se o consumo real for menor do que tu imaginou

Preço por modelo: quanto custa cada milhão de tokens

A cobrança é feita por token, e tem duas contas rodando ao mesmo tempo: token de entrada (tudo que tu manda, o system prompt, o histórico, o contexto anexado) e token de saída (tudo que o modelo devolve)

As taxas são diferentes entre entrada e saída, e diferentes por modelo. O preço é sempre expresso por milhão de tokens (MTok)

Modelo Entrada (por milhão de tokens) Saída (por milhão de tokens)
Claude Haiku 4.5 US$ 1 US$ 5
Claude Sonnet 5 US$ 2 US$ 10
Claude Opus 5 US$ 5 US$ 25

Repara no padrão: saída custa cinco vezes a entrada nos três modelos da tabela. Isso vai importar muito daqui a pouco

Uma notícia boa pra quem estava fazendo planilha com medo: o preço introdutório do Sonnet 5 virou permanente. O reajuste previsto para 1 de setembro de 2026, que levaria o modelo a US$ 3 e US$ 15 por milhão de tokens, foi cancelado, e US$ 2 / US$ 10 é o preço padrão (confirmado em 10/08/2026)

Outra que ajuda o bolso: nos modelos Claude 4.6 e posteriores, a janela de contexto de 1 milhão de tokens está incluída no preço padrão, sem sobretaxa de contexto longo

A linha atual disponível pra dev tem ainda o Fable 5, além do Mythos 5, que está em disponibilidade limitada pra clientes aprovados

E já que a taxa muda conforme o modelo que tu chama, entender quando fixar a versão do modelo na integração deixa de ser detalhe técnico e vira decisão de arquitetura

O que faz a conta subir quando a aplicação entra em produção

Em desenvolvimento tu faz vinte chamadas por dia e acha tudo barato. Em produção o padrão muda, e é aí que a conta ganha vida própria

Os pontos que mais mexem no valor:

  • A escolha do modelo por tarefa: mandar tudo pro Opus 5 é confortável e é o caminho mais caro. Comparando com o Haiku 4.5, a entrada é cinco vezes maior e a saída também
  • A proporção entre entrada e saída: um resumo (entrada enorme, saída curta) e um gerador de texto (entrada curta, saída enorme) custam coisas MUITO diferentes, mesmo com o mesmo número total de tokens
  • Prompts longos repetidos: aquele system prompt caprichado de 8 mil tokens que vai em toda requisição é entrada paga toda vez, multiplicada por cada usuário
  • Tarefas assíncronas: relatório, classificação em lote, enriquecimento de base. Nada disso precisa de resposta em tempo real, e mesmo assim muita gente paga preço de tempo real

Agora a parte boa, que é onde tu recupera dinheiro

A Batch API processa requisições de forma assíncrona com 50% de desconto sobre tokens de entrada e de saída. Na prática, o Opus 5 sai a US$ 2,50 / US$ 12,50 por MTok e o Sonnet 5 a US$ 1 / US$ 5 por MTok

O prompt caching ataca justamente o problema do prompt longo repetido: a leitura de cache custa 10% do preço padrão de token de entrada. A escrita do cache custa 1,25x o preço de entrada (duração de 5 minutos) ou 2x (duração de 1 hora)

Ou seja, tu paga um pouco mais caro pra escrever uma vez e paga uma fração pra ler várias. Se o mesmo contexto se repete, a conta fecha fácil

E tem um multiplicador pro outro lado: pedir inferência restrita aos Estados Unidos pelo parâmetro inference_geo aplica 1,1x em todas as categorias de preço de token, nos modelos Claude 4.6 e posteriores. Se isso é exigência de compliance do seu cliente, beleza, mas entra na planilha

Como acompanhar e limitar o gasto antes que ele surpreenda

Prever é bom, medir é melhor. Tudo aqui mora no Claude Console

  1. Abra as páginas Usage e Cost no Claude Console. É lá que fica o relatório detalhado de uso e de custo da organização, e é o primeiro lugar pra olhar quando a conta pareceu estranha
  1. Separe os recursos em workspaces. Workspaces organizam API keys, acesso do time e controle de custo dentro da organização, então dá pra ter um por caso de uso (produto, interno, testes) em vez de uma sopa de keys sem dono. O erro comum deste passo é lançar produção e ambiente de teste na mesma key: quando o custo sobe, não tem como saber de onde veio
  1. Defina o teto de gasto mensal na aba Spend limits do workspace. O erro comum deste passo é tentar colocar um valor alto demais: o limite do workspace precisa ser menor que o da organização, senão não passa
  1. Ative o alerta em Add notification, na mesma aba, pra receber aviso por e-mail. Teto sem alerta é surpresa garantida: tu descobre o problema quando a aplicação já parou
  1. Puxe os números pela Usage and Cost API se você quer isso dentro do seu próprio painel. Ela dá acesso programático ao histórico de uso e custo com buckets de tempo de 1m, 1h ou 1d, separando tokens de entrada não cacheados, entrada cacheada, criação de cache e saída, e permite filtrar e agrupar por API key, workspace, modelo e service tier
  1. Crie uma Admin API key pra isso. O erro comum deste passo é tentar autenticar com a API key normal da aplicação: a Usage and Cost API exige uma Admin API key da organização, com escopos próprios

Um aviso pra não te fazer perder tarde: a Spend Limits API está disponível apenas para organizações Claude Enterprise, não pra organizações do Claude Platform (Claude Console). Se você é conta comum, o caminho do teto é a interface do workspace mesmo

A aplicação parou de responder: é saldo ou é limite de taxa?

Esses dois sintomas parecem iguais pro usuário final e são problemas completamente distintos. Se liga na diferença, porque a solução de um não resolve o outro

Sintoma: parou tudo, inclusive o Workbench

Causa provável: créditos zerados

Quando o saldo acaba, não é só a sua aplicação que trava: não dá pra chamar a API nem usar o Workbench. Esse detalhe é o teste mais rápido de diagnóstico, porque limite de taxa da sua aplicação não derruba o Workbench por saldo

Solução: recarregar e, principalmente, configurar a recarga automática definindo saldo mínimo e valor de recarga, pra não depender de alguém lembrar disso num domingo

Sintoma: tem saldo sobrando e mesmo assim a aplicação engasga em horário de pico

Causa provável: limite de taxa

Os limites da Messages API são medidos em requisições por minuto (RPM), tokens de entrada por minuto (ITPM) e tokens de saída por minuto (OTPM), por classe de modelo, e valem no nível da organização, não por key

Por minuto, entendeu a pegadinha? Rajada de tráfego bate no teto mesmo com crédito de sobra

Onde conferir: no Claude Console, em Settings > Limits, tu vê os limites atuais da sua organização

Como subir: existem três níveis de uso, Start, Build e Scale, mais um nível Custom gerenciado pelo time de contas. Cada nível tem limites de taxa maiores e um teto de gasto mensal próprio

E aqui vai a parte que quase ninguém sabe: os níveis são atribuídos automaticamente, sem depósito nem compra pra subir de degrau. Dá pra solicitar aumento no Claude Console quando a organização já está usando pelo menos 50% dos limites atuais

Como prevenir: na maioria dos modelos Claude, apenas tokens de entrada NÃO cacheados contam pro limite de ITPM. Ou seja, o prompt caching não é só desconto na fatura, ele também alivia o teto de tokens de entrada por minuto

Dois coelhos numa cajadada só, e esse é o tipo de ajuste que vale fazer antes do lançamento, não durante o incêndio

Conclusão

A lógica central é essa e não tem jeito de fugir dela: na API você não compra um plano, você compra consumo

O valor da fatura é função direta de quantos tokens entram, quantos saem e qual modelo processou cada um deles

O caminho prático antes de colocar sua integração no ar:

  • estime tokens por requisição, separando entrada de saída (lembra que saída é cinco vezes mais cara nos três modelos da tabela)
  • escolha o modelo por tarefa em vez de padronizar tudo no mais caro
  • mande pra Batch API tudo que não precisa de resposta imediata e ative prompt caching no que se repete
  • configure teto de gasto no workspace e o alerta por e-mail ANTES do lançamento, não depois do susto

Faça essa conta hoje mesmo, no papel, com o volume que tu espera no primeiro mês. É meia hora de trabalho que evita aquela conversa desconfortável com o financeiro depois…

Até o próximo post! 😀

Perguntas frequentes

Como funcionam os limites de taxa da Claude API?

A Messages API mede três limites por classe de modelo: requisições por minuto (RPM), tokens de entrada por minuto (ITPM) e tokens de saída por minuto (OTPM). Esses limites são definidos no nível da organização e ficam visíveis no Claude Console, em Settings > Limits.

Tokens lidos do cache contam para o limite de tokens por minuto?

Não, na maioria dos modelos Claude apenas os tokens de entrada não cacheados contam para o limite de ITPM. Isso significa que usar prompt caching ajuda tanto no custo quanto no gerenciamento de rate limit ao mesmo tempo.

O que são os níveis Start, Build e Scale da Claude API?

São os três níveis de uso da API (mais um nível Custom gerenciado pelo time de contas), cada um com limites de taxa maiores e um teto de gasto mensal próprio. A atribuição é automática, sem depósito ou compra: para subir de nível, o aumento pode ser solicitado no Claude Console quando a organização já está usando pelo menos 50% dos limites atuais.

Como acompanhar o custo da API por API key ou por modelo em código?

A Usage and Cost API dá acesso programático ao histórico de uso e custo da organização, com buckets de tempo de 1 minuto, 1 hora ou 1 dia. Ela separa entrada não cacheada, entrada cacheada, criação de cache e saída, e permite filtrar e agrupar por API key, workspace, modelo e service tier, só que exige uma Admin API key, diferente da key padrão da aplicação.

Dá para colocar um teto de gasto mensal na Claude API?

Sim, dentro de cada workspace no Claude Console tem a aba Spend limits, com opção de adicionar um alerta por e-mail (Add notification). O limite de gasto do workspace precisa ser menor que o limite definido para a organização inteira.

A Spend Limits API funciona pra qualquer conta da Claude API?

Não, a Spend Limits API está disponível apenas para organizações Claude Enterprise. Quem usa o Claude Platform pelo Console configura o teto de gasto direto na aba Spend limits de cada workspace, sem acesso programático via essa API.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares