GPT-6 Astra na API: quanto custa por 1M de tokens e como calcular o gasto do seu projeto

O preço do GPT-6 Astra na API da OpenAI é US$ 10,00 por 1M de tokens de entrada e US$ 50,00 por 1M de tokens de saída, com input em cache a US$ 1,00 e escrita em cache a US$ 12,50 por 1M. Pra estimar o gasto, multiplique o volume mensal de input por 10, o de output por 50, some e converta pelo câmbio do dia (US$ 1 = R$ 5,079 em 03/09/2026). E fica de olho nos multiplicadores: prompt acima de 272K tokens de input custa 2x input e 1,5x output, Batch e Flex saem por metade e o modo Fast dobra tudo
Fala aí, beleza? A OpenAI acabou de soltar o GPT-6 Astra, o modelo que ela mesma chama de mais capaz do catálogo, e ele chegou com preço de modelo mais capaz mesmo
O lançamento foi em 03/09/2026, com acesso em rollout faseado: começa pelas empresas do programa de acesso antecipado, e a API mais os planos Plus, Pro, Business e Enterprise foram anunciados pros próximos dias
Então se você é a pessoa que precisa aprovar orçamento ANTES de plugar o modelo em produção, esse post é pra ti
Aqui tem duas coisas: a tabela oficial de preço por 1M de tokens e a conta pra estimar o gasto mensal do teu projeto com o volume real que ele consome
Tabela de preços do GPT-6 Astra por 1M de tokens
Esses são os valores publicados na tabela de preços da API da OpenAI, consultada em 03/09/2026
A cobrança é em dólar, não existe tabela oficial em BRL: pra você ter noção de grandeza na hora de converter, o dólar à vista de 03/09/2026 estava em R$ 5,079
| Tipo de cobrança | Preço por 1M de tokens |
|---|---|
| Input (entrada) | US$ 10,00 |
| Output (saída) | US$ 50,00 |
| Cached input (leitura de cache) | US$ 1,00 |
| Cache write (escrita em cache) | US$ 12,50 |
| Input no modo Fast | US$ 20 |
| Output no modo Fast | US$ 100 |
Repara numa coisa antes de seguir: o output custa 5x o input
Isso muda TUDO na hora de estimar, porque a maioria das pessoas calcula em cima do prompt que escreve e esquece que quem pesa é o que o modelo responde
O identificador do modelo na API é gpt-6-astra, e a página dele na documentação indica janela de contexto de 1M de tokens
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 114 aulas
- 4 projetos
- 9h 18min
Como calcular o gasto por 1M de tokens do seu projeto
A conta é aritmética pura, sem mistério
O que trava a maioria não é a fórmula, é não ter o número de entrada certo
- Levante o volume mensal de input e output separados. Pega o log de uso do teu projeto, ou estima: número de requisições no mês x tokens médios por requisição, uma conta pra entrada e outra pra saída. O erro comum deste passo é jogar um número só de "tokens totais": como output custa 5x input, misturar os dois destrói a estimativa, pode dar 3x de diferença dependendo do perfil da aplicação
- Aplique as taxas base. Divide cada volume por 1 milhão e multiplica: input por 10 e output por 50, que são as taxas de tabela em dólar. O erro comum deste passo é assumir que output custa o mesmo que input, ou usar o preço "combinado" que você viu por aí como se fosse taxa oficial: as taxas oficiais são duas, separadas. É a mesma lógica que vale pra qualquer modelo fechado, igualzinho ao que a gente fez pra estimar o preço da API do DeepSeek
- Separe a parte cacheada da parte que escreve cache. Se teu app repete o mesmo system prompt ou o mesmo contexto de projeto em toda chamada, boa parte do input vira cache hit e cai pra US$ 1,00 por 1M, ou seja, um décimo do input normal. Só que escrever no cache tem preço: US$ 12,50 por 1M, que é 1,25x a taxa de input não cacheado. O erro comum deste passo é modelar o cache como se fosse de graça e esquecer a escrita, principalmente em aplicação com contexto que muda toda hora, onde você paga a escrita e quase nunca colhe o hit
- Some tudo e converte pra real. Repara que o cache hit não é volume novo: ele sai de dentro do teu input, então o que era input cheio passa a ser cobrado na taxa de cache, e só o restante fica na taxa de US$ 10,00 por 1M. Somou as quatro linhas, converte pelo câmbio do dia. O erro comum deste passo é fixar o câmbio na planilha e esquecer dele: o preço é em dólar, teu custo em real sobe sozinho
Dá pra deixar isso num script e parar de fazer na mão:
# precos do GPT-6 Astra, em dolar por 1M de tokens
INPUT = 10.00
OUTPUT = 50.00
CACHED_INPUT = 1.00
CACHE_WRITE = 12.50
DOLAR = 5.079 # cambio de 03/09/2026
def custo_mensal(input_tokens, output_tokens, cache_hit_tokens=0, cache_write_tokens=0):
total = (
(input_tokens / 1_000_000) * INPUT
+ (output_tokens / 1_000_000) * OUTPUT
+ (cache_hit_tokens / 1_000_000) * CACHED_INPUT
+ (cache_write_tokens / 1_000_000) * CACHE_WRITE
)
return round(total, 2), round(total * DOLAR, 2)
# troque pelos volumes REAIS do seu projeto, tirados do log de uso do mes
# lembre: cache_hit sai de dentro do input, nao soma por fora
meu_input = 0
meu_output = 0
meu_cache_hit = 0
meu_cache_write = 0
print(custo_mensal(meu_input, meu_output, meu_cache_hit, meu_cache_write))
Troca os volumes pelos teus e pronto, tu tem a estimativa em dólar e em real
O que pesa mais na conta: input, output ou cache?
Pra ficar concreto sem inventar cenário: o que decide a tua fatura não é o volume bruto de tokens, é a proporção entre as três taxas
O output custa 5x o input, então um projeto que gera respostas longas gasta mais na saída mesmo tendo MENOS tokens de saída que de entrada
É por isso que "reduzir o prompt" muitas vezes economiza menos do que controlar o tamanho da resposta
Do outro lado tem o cache: a leitura cacheada é um décimo do input normal, então app que repete contexto puxa a média pra baixo bem rápido
E tem um número de referência interessante pra sanidade da tua estimativa: a Artificial Analysis calcula um preço combinado de US$ 7,70 por 1M de tokens pro GPT-6 Astra (high), usando a proporção 7:2:1 de cache hit, input e output
A conta dela é essa: 0,7 x 1 + 0,2 x 10 + 0,1 x 50 = 7,70
Ou seja, num app bem cacheado e com respostas curtas, o custo médio por token fica bem abaixo da taxa cheia de output
Se você desenvolve pra cliente e precisa repassar isso numa mensalidade, vale montar a planilha do mesmo jeito que se monta o custo real de automação no n8n: infra fixa de um lado, consumo variável do outro
Multiplicadores que podem dobrar (ou cortar pela metade) a sua conta
Aqui é a parte que derruba orçamento aprovado, então se liga
A tabela base não é o valor final: existem regras que multiplicam o que você viu ali em cima
Prompt acima de 272K tokens de entrada. Passou disso, a requisição INTEIRA é cobrada a 2x as taxas de input e de cache e 1,5x a taxa de output. Na prática, aquela chamada tem o custo de entrada e de cache dobrado, e ainda soma metade a mais no que o modelo responde
E aqui mora a pegadinha: o modelo tem janela de contexto de 1M de tokens, então jogar o projeto inteiro no prompt é tecnicamente possível e atravessa os 272K sem esforço nenhum. Tome cuidado! O que parece "aproveitar o contexto gigante" é um dobrador de conta disfarçado
Batch e Flex. Os dois modos são cobrados a 50% das taxas Standard, ou seja, input e output caem pela metade em relação à tabela. Se teu processamento não precisa de resposta na hora (classificação em lote, enriquecimento de base, job noturno), é metade da fatura pelo mesmo trabalho
Fast. Custa 2x as taxas aplicáveis, o que coloca o GPT-6 Astra em US$ 20 por 1M de input e US$ 100 por 1M de output
Então o mesmo modelo, com o mesmo volume, pode variar de metade a dobro dependendo só de qual modo tu escolhe
É a primeira coisa que eu olharia antes de mexer em prompt
GPT-6 Astra x GPT-5.6 Sol x Claude Fable 5.1: comparação de preço
Só preço de tabela, sem entrar em ranking, que essas listas re-ranqueiam toda semana
| Modelo | Input / 1M | Output / 1M |
|---|---|---|
| GPT-6 Astra | US$ 10,00 | US$ 50,00 |
| GPT-5.6 Sol (promocional) | US$ 4 | US$ 20 |
| GPT-5.6 Sol (padrão) | US$ 5 | US$ 30 |
| Claude Fable 5.1 | US$ 10 | US$ 50 |
| Mediana do mercado (Artificial Analysis) | US$ 2,00 | US$ 10,00 |
O preço promocional do GPT-5.6 Sol vale pelo menos até 21 de novembro de 2026, e o Astra custa 2,5x esse valor promocional
Se a promo acabar e o Sol voltar pro padrão, a diferença encolhe, mas continua sendo o dobro no input
O Claude Fable 5.1 empata na tabela base, mesmo US$ 10 / US$ 50, e a diferença aparece no cache: leitura a US$ 0,25 por 1M contra US$ 1,00 do Astra, com escrita a US$ 12,50 (cache de 5 minutos) ou US$ 20 (cache de 1 hora)
Ou seja, em aplicação que vive de reuso de contexto, a leitura de cache do Fable sai 4x mais barata que a do Astra
Já o cache write dos dois é o mesmo US$ 12,50 na janela curta
Vale o preço? O que os números dizem
Veredito honesto, sem torcida pra lado nenhum
A Artificial Analysis classifica os preços do GPT-6 Astra como caros frente ao mercado, e a conta é direta: a mediana de input é US$ 2,00 e a de output é US$ 10,00 por 1M, então o Astra está em 5x a mediana nas duas pontas
Porém tem o outro lado da moeda, e ele é MUITO relevante pra orçamento
A mesma Artificial Analysis registra score 60 no Intelligence Index e, pra rodar o índice inteiro, o Astra (high) gastou 16M de tokens de output contra uma mediana de 62M dos modelos avaliados
Sacou? Caro por token, econômico em tokens gastos
É como comparar dois carros pelo preço do litro sem olhar o consumo: se ele resolve a tarefa com menos idas e vindas, o custo por tarefa entregue não é 5x o dos outros
Então o orçamento fecha pra quem tem tarefa difícil onde retrabalho custa caro: raciocínio complexo, código, pesquisa, geração de documento longo
E não fecha pra quem tem volume alto de tarefa simples e repetitiva, classificação, extração, resumo curto: aí você está pagando prêmio de capacidade que o teu caso de uso não usa, e um modelo mais barato entrega igual
Disponibilidade: quem consegue usar o GPT-6 Astra agora
Estado das coisas em 03/09/2026: o rollout é faseado e começou pelas empresas do programa de acesso antecipado da OpenAI
O acesso via API e pelos planos Plus, Pro, Business e Enterprise foi anunciado pros próximos dias, sem data fechada
A OpenAI também anunciou disponibilidade via AWS, também nos próximos dias
O posicionamento oficial é de modelo mais capaz da casa, construído pra raciocínio complexo, código, uso de computador, pesquisa e criação de documentos
E tem um detalhe que não é só marketing: o GPT-6 Astra é o primeiro modelo da OpenAI classificado no patamar "Crítico" de capacidade cibernética no Preparedness Framework
Por causa disso, as capacidades cibernéticas mais avançadas estão inicialmente restritas, com acesso ampliado apenas para defensores confiáveis
Vale colocar isso na planilha de risco junto com o preço: liberar orçamento pra um modelo que ainda não abriu pra todo mundo é aprovar em cima de um cronograma que não é teu 🙂
Contexto em vídeo: modelos com janela de 1M de tokens
Janela de 1M de tokens deixou de ser exclusividade, e entender o que muda quando o modelo lê o projeto inteiro ajuda a enxergar de onde vem o volume de input da tua conta
Pra começar do zero nesse assunto de contexto gigante, esse vídeo do canal mostra o GLM 5.2 lendo um projeto inteiro com janela de 1M de tokens:
Conclusão
Recapitulando a parte que interessa pro teu financeiro
O preço do GPT-6 Astra é US$ 10,00 por 1M de tokens de input e US$ 50,00 por 1M de output, com leitura de cache a US$ 1,00 e escrita de cache a US$ 12,50 por 1M
A fórmula é (input / 1M x 10) + (output / 1M x 50) + cache, e depois converte pelo câmbio do dia
Em cima disso vêm os multiplicadores: 2x input e 1,5x output acima de 272K tokens na requisição, 50% no Batch e no Flex, 2x no Fast
O próximo passo é simples: pega o volume REAL do teu projeto, roda a conta com esses números e só depois leva pra aprovação
E reavalia quando a API abrir pra todo mundo, porque preço promocional de concorrente e tabela de cache mudam rápido nesse mercado…
até o próximo post! 😀
Perguntas frequentes
Quanto custa o GPT-6 Astra por 1M de tokens na API da OpenAI?
O GPT-6 Astra custa US$ 10,00 por 1M de tokens de input e US$ 50,00 por 1M de tokens de output na tabela padrão da OpenAI. A cobrança é em dólar, não existe tabela oficial em real: como referência de câmbio, o dólar à vista de 03/09/2026 estava em R$ 5,079. O identificador do modelo na API é gpt-6-astra.
O GPT-6 Astra é mais caro que o Claude Fable 5.1?
Não, os dois têm o mesmo preço de tabela: US$ 10 por 1M de input e US$ 50 por 1M de output. A diferença fica no cache: o Fable 5.1 cobra US$ 0,25 por 1M na leitura, enquanto o cached input do GPT-6 Astra sai por US$ 1,00 por 1M. Na escrita de cache os dois ficam próximos, US$ 12,50 por 1M no GPT-6 Astra e US$ 12,50 (5 min) ou US$ 20 (1 h) no Fable 5.1.
Como funciona o preço do GPT-6 Astra no modo Fast?
O modo Fast cobra 2x a taxa Standard, o que dá US$ 20 por 1M de tokens de input e US$ 100 por 1M de tokens de output. É o dobro do preço padrão de US$ 10,00 e US$ 50,00 por 1M. Vale usar só quando a latência da resposta pesa mais que o custo por token.
Vale a pena usar o GPT-6 Astra no modo Batch ou Flex para economizar?
Sim, Batch e Flex cobram 50% das taxas Standard, ou seja, metade do preço de tabela de US$ 10,00 por 1M de input e US$ 50,00 por 1M de output. Funciona bem pra processamento que não precisa de resposta em tempo real, como classificação em lote ou job noturno.
O que acontece com o preço quando o prompt passa de 272 mil tokens de input?
Prompts acima de 272K tokens de entrada são cobrados a 2x as taxas de input e de cache e 1,5x a taxa de output, aplicado na requisição inteira, não só no excedente. Isso significa que uma chamada longa pode custar bem mais do que a conta simples de US$ 10,00 e US$ 50,00 por 1M sugere. Vale considerar isso ao estimar o gasto de projetos com contexto grande.
O GPT-6 Astra compensa o preço frente à média do mercado?
A Artificial Analysis classifica o GPT-6 Astra (high) como caro: a mediana de mercado é US$ 2,00 por 1M de input e US$ 10,00 por 1M de output, bem abaixo dos US$ 10,00 e US$ 50,00 cobrados pela OpenAI. O preço combinado calculado por eles, usando proporção 7:2:1 de cache hit, input e output, fica em US$ 7,70 por 1M de tokens. No Intelligence Index da Artificial Analysis o modelo marcou 60 pontos, gastando 16M de tokens de output contra uma mediana de 62M dos modelos avaliados.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como testar o GPT-6 Astra no seu projeto antes de migrar (passo a passo)
Testar o GPT-6 Astra antes de migrar: monte de 10 a 20 tarefas reais do seu produto, compare com seu modelo atual e veja nota, tokens e custo lado a lado.
Como migrar seu projeto para o GPT-6 Astra sem quebrar o que já funciona: checklist antes de trocar o modelo
Migrar para o GPT-6 Astra sem quebrar o que já funciona: checklist com baseline, rota por vez, parâmetros revisados e rollback pronto antes de trocar o modelo.
Por que o GPT-6 Astra corta a resposta no meio? O limite de 128 mil tokens de saída e como fatiar tarefas longas
O GPT-6 Astra lê até 1 milhão de tokens, mas o limite de tokens de saída é 128 mil por resposta. Veja por que ele corta e como fatiar tarefas longas.
