GPT-6 Astra na API: quanto custa por 1M de tokens e como calcular o gasto do seu projeto

tabela de preço do GPT-6 Astra na API por 1M de tokens
Resposta rápida

O preço do GPT-6 Astra na API da OpenAI é US$ 10,00 por 1M de tokens de entrada e US$ 50,00 por 1M de tokens de saída, com input em cache a US$ 1,00 e escrita em cache a US$ 12,50 por 1M. Pra estimar o gasto, multiplique o volume mensal de input por 10, o de output por 50, some e converta pelo câmbio do dia (US$ 1 = R$ 5,079 em 03/09/2026). E fica de olho nos multiplicadores: prompt acima de 272K tokens de input custa 2x input e 1,5x output, Batch e Flex saem por metade e o modo Fast dobra tudo

Fala aí, beleza? A OpenAI acabou de soltar o GPT-6 Astra, o modelo que ela mesma chama de mais capaz do catálogo, e ele chegou com preço de modelo mais capaz mesmo

O lançamento foi em 03/09/2026, com acesso em rollout faseado: começa pelas empresas do programa de acesso antecipado, e a API mais os planos Plus, Pro, Business e Enterprise foram anunciados pros próximos dias

Então se você é a pessoa que precisa aprovar orçamento ANTES de plugar o modelo em produção, esse post é pra ti

Aqui tem duas coisas: a tabela oficial de preço por 1M de tokens e a conta pra estimar o gasto mensal do teu projeto com o volume real que ele consome

Tabela de preços do GPT-6 Astra por 1M de tokens

Esses são os valores publicados na tabela de preços da API da OpenAI, consultada em 03/09/2026

A cobrança é em dólar, não existe tabela oficial em BRL: pra você ter noção de grandeza na hora de converter, o dólar à vista de 03/09/2026 estava em R$ 5,079

Tipo de cobrança Preço por 1M de tokens
Input (entrada) US$ 10,00
Output (saída) US$ 50,00
Cached input (leitura de cache) US$ 1,00
Cache write (escrita em cache) US$ 12,50
Input no modo Fast US$ 20
Output no modo Fast US$ 100

Repara numa coisa antes de seguir: o output custa 5x o input

Isso muda TUDO na hora de estimar, porque a maioria das pessoas calcula em cima do prompt que escreve e esquece que quem pesa é o que o modelo responde

O identificador do modelo na API é gpt-6-astra, e a página dele na documentação indica janela de contexto de 1M de tokens

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

Como calcular o gasto por 1M de tokens do seu projeto

A conta é aritmética pura, sem mistério

O que trava a maioria não é a fórmula, é não ter o número de entrada certo

  1. Levante o volume mensal de input e output separados. Pega o log de uso do teu projeto, ou estima: número de requisições no mês x tokens médios por requisição, uma conta pra entrada e outra pra saída. O erro comum deste passo é jogar um número só de "tokens totais": como output custa 5x input, misturar os dois destrói a estimativa, pode dar 3x de diferença dependendo do perfil da aplicação
  1. Aplique as taxas base. Divide cada volume por 1 milhão e multiplica: input por 10 e output por 50, que são as taxas de tabela em dólar. O erro comum deste passo é assumir que output custa o mesmo que input, ou usar o preço "combinado" que você viu por aí como se fosse taxa oficial: as taxas oficiais são duas, separadas. É a mesma lógica que vale pra qualquer modelo fechado, igualzinho ao que a gente fez pra estimar o preço da API do DeepSeek
  1. Separe a parte cacheada da parte que escreve cache. Se teu app repete o mesmo system prompt ou o mesmo contexto de projeto em toda chamada, boa parte do input vira cache hit e cai pra US$ 1,00 por 1M, ou seja, um décimo do input normal. Só que escrever no cache tem preço: US$ 12,50 por 1M, que é 1,25x a taxa de input não cacheado. O erro comum deste passo é modelar o cache como se fosse de graça e esquecer a escrita, principalmente em aplicação com contexto que muda toda hora, onde você paga a escrita e quase nunca colhe o hit
  1. Some tudo e converte pra real. Repara que o cache hit não é volume novo: ele sai de dentro do teu input, então o que era input cheio passa a ser cobrado na taxa de cache, e só o restante fica na taxa de US$ 10,00 por 1M. Somou as quatro linhas, converte pelo câmbio do dia. O erro comum deste passo é fixar o câmbio na planilha e esquecer dele: o preço é em dólar, teu custo em real sobe sozinho

Dá pra deixar isso num script e parar de fazer na mão:

# precos do GPT-6 Astra, em dolar por 1M de tokens
INPUT = 10.00
OUTPUT = 50.00
CACHED_INPUT = 1.00
CACHE_WRITE = 12.50
DOLAR = 5.079  # cambio de 03/09/2026

def custo_mensal(input_tokens, output_tokens, cache_hit_tokens=0, cache_write_tokens=0):
    total = (
        (input_tokens / 1_000_000) * INPUT
        + (output_tokens / 1_000_000) * OUTPUT
        + (cache_hit_tokens / 1_000_000) * CACHED_INPUT
        + (cache_write_tokens / 1_000_000) * CACHE_WRITE
    )
    return round(total, 2), round(total * DOLAR, 2)

# troque pelos volumes REAIS do seu projeto, tirados do log de uso do mes
# lembre: cache_hit sai de dentro do input, nao soma por fora
meu_input = 0
meu_output = 0
meu_cache_hit = 0
meu_cache_write = 0

print(custo_mensal(meu_input, meu_output, meu_cache_hit, meu_cache_write))

Troca os volumes pelos teus e pronto, tu tem a estimativa em dólar e em real

O que pesa mais na conta: input, output ou cache?

Pra ficar concreto sem inventar cenário: o que decide a tua fatura não é o volume bruto de tokens, é a proporção entre as três taxas

O output custa 5x o input, então um projeto que gera respostas longas gasta mais na saída mesmo tendo MENOS tokens de saída que de entrada

É por isso que "reduzir o prompt" muitas vezes economiza menos do que controlar o tamanho da resposta

Do outro lado tem o cache: a leitura cacheada é um décimo do input normal, então app que repete contexto puxa a média pra baixo bem rápido

E tem um número de referência interessante pra sanidade da tua estimativa: a Artificial Analysis calcula um preço combinado de US$ 7,70 por 1M de tokens pro GPT-6 Astra (high), usando a proporção 7:2:1 de cache hit, input e output

A conta dela é essa: 0,7 x 1 + 0,2 x 10 + 0,1 x 50 = 7,70

Ou seja, num app bem cacheado e com respostas curtas, o custo médio por token fica bem abaixo da taxa cheia de output

Se você desenvolve pra cliente e precisa repassar isso numa mensalidade, vale montar a planilha do mesmo jeito que se monta o custo real de automação no n8n: infra fixa de um lado, consumo variável do outro

Multiplicadores que podem dobrar (ou cortar pela metade) a sua conta

Aqui é a parte que derruba orçamento aprovado, então se liga

A tabela base não é o valor final: existem regras que multiplicam o que você viu ali em cima

Prompt acima de 272K tokens de entrada. Passou disso, a requisição INTEIRA é cobrada a 2x as taxas de input e de cache e 1,5x a taxa de output. Na prática, aquela chamada tem o custo de entrada e de cache dobrado, e ainda soma metade a mais no que o modelo responde

E aqui mora a pegadinha: o modelo tem janela de contexto de 1M de tokens, então jogar o projeto inteiro no prompt é tecnicamente possível e atravessa os 272K sem esforço nenhum. Tome cuidado! O que parece "aproveitar o contexto gigante" é um dobrador de conta disfarçado

Batch e Flex. Os dois modos são cobrados a 50% das taxas Standard, ou seja, input e output caem pela metade em relação à tabela. Se teu processamento não precisa de resposta na hora (classificação em lote, enriquecimento de base, job noturno), é metade da fatura pelo mesmo trabalho

Fast. Custa 2x as taxas aplicáveis, o que coloca o GPT-6 Astra em US$ 20 por 1M de input e US$ 100 por 1M de output

Então o mesmo modelo, com o mesmo volume, pode variar de metade a dobro dependendo só de qual modo tu escolhe

É a primeira coisa que eu olharia antes de mexer em prompt

GPT-6 Astra x GPT-5.6 Sol x Claude Fable 5.1: comparação de preço

Só preço de tabela, sem entrar em ranking, que essas listas re-ranqueiam toda semana

Modelo Input / 1M Output / 1M
GPT-6 Astra US$ 10,00 US$ 50,00
GPT-5.6 Sol (promocional) US$ 4 US$ 20
GPT-5.6 Sol (padrão) US$ 5 US$ 30
Claude Fable 5.1 US$ 10 US$ 50
Mediana do mercado (Artificial Analysis) US$ 2,00 US$ 10,00

O preço promocional do GPT-5.6 Sol vale pelo menos até 21 de novembro de 2026, e o Astra custa 2,5x esse valor promocional

Se a promo acabar e o Sol voltar pro padrão, a diferença encolhe, mas continua sendo o dobro no input

O Claude Fable 5.1 empata na tabela base, mesmo US$ 10 / US$ 50, e a diferença aparece no cache: leitura a US$ 0,25 por 1M contra US$ 1,00 do Astra, com escrita a US$ 12,50 (cache de 5 minutos) ou US$ 20 (cache de 1 hora)

Ou seja, em aplicação que vive de reuso de contexto, a leitura de cache do Fable sai 4x mais barata que a do Astra

Já o cache write dos dois é o mesmo US$ 12,50 na janela curta

Vale o preço? O que os números dizem

Veredito honesto, sem torcida pra lado nenhum

A Artificial Analysis classifica os preços do GPT-6 Astra como caros frente ao mercado, e a conta é direta: a mediana de input é US$ 2,00 e a de output é US$ 10,00 por 1M, então o Astra está em 5x a mediana nas duas pontas

Porém tem o outro lado da moeda, e ele é MUITO relevante pra orçamento

A mesma Artificial Analysis registra score 60 no Intelligence Index e, pra rodar o índice inteiro, o Astra (high) gastou 16M de tokens de output contra uma mediana de 62M dos modelos avaliados

Sacou? Caro por token, econômico em tokens gastos

É como comparar dois carros pelo preço do litro sem olhar o consumo: se ele resolve a tarefa com menos idas e vindas, o custo por tarefa entregue não é 5x o dos outros

Então o orçamento fecha pra quem tem tarefa difícil onde retrabalho custa caro: raciocínio complexo, código, pesquisa, geração de documento longo

E não fecha pra quem tem volume alto de tarefa simples e repetitiva, classificação, extração, resumo curto: aí você está pagando prêmio de capacidade que o teu caso de uso não usa, e um modelo mais barato entrega igual

Disponibilidade: quem consegue usar o GPT-6 Astra agora

Estado das coisas em 03/09/2026: o rollout é faseado e começou pelas empresas do programa de acesso antecipado da OpenAI

O acesso via API e pelos planos Plus, Pro, Business e Enterprise foi anunciado pros próximos dias, sem data fechada

A OpenAI também anunciou disponibilidade via AWS, também nos próximos dias

O posicionamento oficial é de modelo mais capaz da casa, construído pra raciocínio complexo, código, uso de computador, pesquisa e criação de documentos

E tem um detalhe que não é só marketing: o GPT-6 Astra é o primeiro modelo da OpenAI classificado no patamar "Crítico" de capacidade cibernética no Preparedness Framework

Por causa disso, as capacidades cibernéticas mais avançadas estão inicialmente restritas, com acesso ampliado apenas para defensores confiáveis

Vale colocar isso na planilha de risco junto com o preço: liberar orçamento pra um modelo que ainda não abriu pra todo mundo é aprovar em cima de um cronograma que não é teu 🙂

Contexto em vídeo: modelos com janela de 1M de tokens

Janela de 1M de tokens deixou de ser exclusividade, e entender o que muda quando o modelo lê o projeto inteiro ajuda a enxergar de onde vem o volume de input da tua conta

Pra começar do zero nesse assunto de contexto gigante, esse vídeo do canal mostra o GLM 5.2 lendo um projeto inteiro com janela de 1M de tokens:

Conclusão

Recapitulando a parte que interessa pro teu financeiro

O preço do GPT-6 Astra é US$ 10,00 por 1M de tokens de input e US$ 50,00 por 1M de output, com leitura de cache a US$ 1,00 e escrita de cache a US$ 12,50 por 1M

A fórmula é (input / 1M x 10) + (output / 1M x 50) + cache, e depois converte pelo câmbio do dia

Em cima disso vêm os multiplicadores: 2x input e 1,5x output acima de 272K tokens na requisição, 50% no Batch e no Flex, 2x no Fast

O próximo passo é simples: pega o volume REAL do teu projeto, roda a conta com esses números e só depois leva pra aprovação

E reavalia quando a API abrir pra todo mundo, porque preço promocional de concorrente e tabela de cache mudam rápido nesse mercado…

até o próximo post! 😀

Perguntas frequentes

Quanto custa o GPT-6 Astra por 1M de tokens na API da OpenAI?

O GPT-6 Astra custa US$ 10,00 por 1M de tokens de input e US$ 50,00 por 1M de tokens de output na tabela padrão da OpenAI. A cobrança é em dólar, não existe tabela oficial em real: como referência de câmbio, o dólar à vista de 03/09/2026 estava em R$ 5,079. O identificador do modelo na API é gpt-6-astra.

O GPT-6 Astra é mais caro que o Claude Fable 5.1?

Não, os dois têm o mesmo preço de tabela: US$ 10 por 1M de input e US$ 50 por 1M de output. A diferença fica no cache: o Fable 5.1 cobra US$ 0,25 por 1M na leitura, enquanto o cached input do GPT-6 Astra sai por US$ 1,00 por 1M. Na escrita de cache os dois ficam próximos, US$ 12,50 por 1M no GPT-6 Astra e US$ 12,50 (5 min) ou US$ 20 (1 h) no Fable 5.1.

Como funciona o preço do GPT-6 Astra no modo Fast?

O modo Fast cobra 2x a taxa Standard, o que dá US$ 20 por 1M de tokens de input e US$ 100 por 1M de tokens de output. É o dobro do preço padrão de US$ 10,00 e US$ 50,00 por 1M. Vale usar só quando a latência da resposta pesa mais que o custo por token.

Vale a pena usar o GPT-6 Astra no modo Batch ou Flex para economizar?

Sim, Batch e Flex cobram 50% das taxas Standard, ou seja, metade do preço de tabela de US$ 10,00 por 1M de input e US$ 50,00 por 1M de output. Funciona bem pra processamento que não precisa de resposta em tempo real, como classificação em lote ou job noturno.

O que acontece com o preço quando o prompt passa de 272 mil tokens de input?

Prompts acima de 272K tokens de entrada são cobrados a 2x as taxas de input e de cache e 1,5x a taxa de output, aplicado na requisição inteira, não só no excedente. Isso significa que uma chamada longa pode custar bem mais do que a conta simples de US$ 10,00 e US$ 50,00 por 1M sugere. Vale considerar isso ao estimar o gasto de projetos com contexto grande.

O GPT-6 Astra compensa o preço frente à média do mercado?

A Artificial Analysis classifica o GPT-6 Astra (high) como caro: a mediana de mercado é US$ 2,00 por 1M de input e US$ 10,00 por 1M de output, bem abaixo dos US$ 10,00 e US$ 50,00 cobrados pela OpenAI. O preço combinado calculado por eles, usando proporção 7:2:1 de cache hit, input e output, fica em US$ 7,70 por 1M de tokens. No Intelligence Index da Artificial Analysis o modelo marcou 60 pontos, gastando 16M de tokens de output contra uma mediana de 62M dos modelos avaliados.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares