GPT-6 Astra vale a pena pelo custo por tarefa resolvida? O que os benchmarks não mostram

gráfico comparando GPT-6 Astra custo por tarefa nos níveis low e max de raciocínio
Resposta rápida

O GPT-6 Astra chegou em 3 de setembro de 2026 com rollout escalonado e nota alta: 61 pontos no Artificial Analysis Intelligence Index, contra mediana de 36. Só que a conta conta outra história. Quando o assunto é GPT-6 Astra custo por tarefa, o esforço de raciocínio muda tudo: o custo vai de US$ 0,46 por tarefa no low para US$ 1,67 no max (3,6x), enquanto a pontuação sobe só de 57 para 61. Ou seja: pagar pelo esforço máximo por padrão é queimar dinheiro em quase toda tarefa repetitiva

Fala aí, beleza? A OpenAI soltou o GPT-6 Astra e todo mundo correu pra olhar a pontuação antes de olhar a fatura

E é aí que mora o problema: benchmark mede o quão boa é a resposta, não quanto foi queimado pra chegar nela

O lançamento foi anunciado em 3 de setembro de 2026, com liberação em fases. A pergunta que este post persegue não é "quantos pontos o modelo fez?", e sim uma bem mais chata de responder: quanto custa cada tarefa que ele realmente resolve? 🙂

O que a OpenAI lançou no GPT-6 Astra e quem já tem acesso

O anúncio saiu em 3 de setembro de 2026, com rollout escalonado começando por um grupo limitado de organizações

Em 4 de setembro de 2026 o cenário ainda é esse: acesso parcial. Nem toda conta elegível tem o modelo liberado, e a chegada ao ChatGPT Plus, Pro, Business, Enterprise e à API foi comunicada como algo pros "próximos dias"

Então, se o modelo ainda não apareceu na sua conta, não é bug seu, é a fila

O que já dá pra fazer desde agora é a lição de casa: entender a estrutura de preço e decidir em quais tarefas esse modelo entra. Vale principalmente se você já pensa em delegar tarefas com computer use, porque agente rodando sozinho é justamente onde o token some sem ninguém ver

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Por que a pontuação de benchmark engana na hora de escolher modelo

Benchmark é um número de qualidade

Só que ele responde uma pergunta só: a resposta ficou boa? E ignora completamente a outra metade da história, que é o quanto de token foi gasto pra produzir aquela resposta

E aqui entra a parte que quase ninguém coloca no slide: modelo de raciocínio pensa gastando token de saída. O raciocínio não é de graça, ele é gerado, e sai na conta

Olha a assimetria de preço do GPT-6 Astra: US$ 10,00 por 1M de tokens de entrada e US$ 50,00 por 1M de tokens de saída

Saída custa cinco vezes mais que entrada. Então todo token que o modelo usa "pensando" é cobrado na faixa cara da tabela. Por isso vale saber também o limite de tokens de saída antes de mandar tarefa gigante de uma vez

E se dois modelos empatam na nota? Aí fica escancarado: mesma pontuação, contas completamente diferentes. É exatamente o que acontece quando você bota o Astra do lado do antecessor dele, e eu mostro isso já já

A métrica honesta é custo por tarefa resolvida

Não custo por milhão de tokens (que é abstrato), não pontuação (que é parcial). Quanto saiu do bolso por unidade de trabalho que passou no SEU critério de "tá bom"

Custo por tarefa por nível de esforço: os números do GPT-6 Astra

O Artificial Analysis roda o Intelligence Index com cada variante de esforço de raciocínio do modelo e publica o custo total de cada rodada

Se liga nisso, porque é aqui que a ficha cai:

Esforço de raciocínio Intelligence Index Custo total pra rodar o índice
non-reasoning 55 não publicado
low 57 US$ 574,92
medium 59 US$ 1.032,97
high 60 US$ 1.429,26
xhigh 61 US$ 2.004,12
max 61 US$ 3.013,30

Repara no pulo do xhigh pro max: a pontuação é a MESMA (61 e 61) e o custo total sobe de US$ 2.004,12 para US$ 3.013,30

Traduzindo pra custo por tarefa, a conta que o Artificial Analysis publicou é essa: de US$ 0,46 por tarefa no esforço low até US$ 1,67 por tarefa no max

Isso é 3,6x de variação de preço

E quanto a qualidade andou nesse mesmo trecho? De 57 para 61 pontos

A curva de custo sobe muito mais rápido que a curva de qualidade. Essa é a frase que resume o post inteiro, e é o motivo de "usar sempre no máximo" ser uma decisão cara e quase sempre preguiçosa

GPT-6 Astra x GPT-5.6 Sol x Claude Fable 5.1: nota e conta lado a lado

Agora o comparativo que interessa, com os três no mesmo índice:

Modelo Intelligence Index Entrada (1M) Saída (1M) Custo total pra rodar o índice
GPT-6 Astra (max) 61 US$ 10,00 US$ 50,00 US$ 3.013,30
GPT-5.6 Sol (max) 61 US$ 4,00 US$ 20,00 US$ 2.017,29
Claude Fable 5.1 (max with fallback) 66 US$ 10,00 US$ 50,00 US$ 8.523,16

Olha o empate do meio da tabela: Astra e Sol fizeram os mesmos 61 pontos, e o Sol custa menos da metade por token, tanto na entrada quanto na saída

Se você olhasse só a coluna da pontuação, os dois seriam intercambiáveis. Não são

E o Fable 5.1? É a maior pontuação medida, 66 pontos, e também a rodada mais cara da tabela por uma boa margem. Topo de inteligência custa caro em qualquer marca, não é implicância com a OpenAI

Agora o contraponto justo pro Astra, porque tem um: ele gasta menos token pra fazer o mesmo trabalho

Pra completar o Intelligence Index, o GPT-6 Astra (max) gerou 42 milhões de tokens, contra uma mediana de 62 milhões. E no harness Codex ele usa um terço dos tokens do GPT-5.6 Sol (max)

Ou seja: o preço por token é alto, mas ele fala menos pra chegar no mesmo lugar. É por isso que comparar tabela de preço isolada também engana. O que fecha a conta é preço por token MULTIPLICADO por token gasto na sua tarefa

Tem ainda o preço combinado calculado pelo Artificial Analysis, o blended: US$ 7,70 por 1M de tokens, numa proporção 7:2:1 entre cache hit, entrada e saída

Esse número serve pra estimativa rápida, não pra fechar orçamento. Se o seu uso tem pouco cache hit, sua proporção real é outra e sua conta vai ser maior

A leitura oficial do Artificial Analysis sobre o Astra no esforço máximo é bem direta: está entre os modelos líderes em inteligência, mas é particularmente caro quando comparado a modelos de preço similar

E isso não briga com o parágrafo da economia de token, viu? São duas medidas diferentes: "caro" é a POSIÇÃO dele na tabela de preço, perto de modelos que custam o mesmo por token. Economia de token é a quantidade que ele queima pra entregar

A economia amortece a fatura, ela não apaga o preço de tabela. Traduzindo o veredito do post em uma linha: o Astra é um modelo caro que se defende gastando menos token, e é o seu workload que decide se essa economia cobre a diferença

Como montar sua própria conta de custo por tarefa resolvida

Benchmark público é referência, não é o seu workload

A boa notícia é que montar sua versão dessa conta é simples, e não precisa de PC da Nasa nem de planilha de consultoria. É aritmética mesmo:

  1. Defina o que conta como tarefa resolvida no seu contexto

Isso é o passo mais importante e o mais pulado. "Resolvida" pode ser: teste passou, PR abriu sem retrabalho, resposta aprovada por um humano na primeira. Escreva o critério antes de rodar, senão você vai ajustar o critério pra defender o modelo que já gostava

O erro comum deste passo: usar "a resposta pareceu boa" como critério. Isso não é medível, é impressão

  1. Colete tokens de entrada e de saída por tarefa

Não dá pra estimar de cabeça, principalmente com raciocínio ligado, porque a saída varia MUITO de tarefa pra tarefa

O erro comum deste passo: contar só o prompt e esquecer que o histórico da conversa volta como entrada a cada chamada

  1. Aplique o preço da tabela oficial nos dois lados

Entrada e saída têm preços diferentes, então são duas multiplicações separadas, não uma só

O erro comum deste passo: usar o blended de US$ 7,70 por 1M como se fosse o preço de tudo. Ele pressupõe uma proporção específica (7:2:1) que provavelmente não é a sua

  1. Divida o custo total pelo número de tarefas que passaram no critério do passo 1

Repara: pelo número de tarefas APROVADAS, não pelo número de tentativas. Tentativa que falhou também custou, e é justamente isso que a métrica precisa capturar

  1. Rode o mesmo lote nos níveis de esforço mais baratos antes de assumir o máximo

Dado que a pontuação vai de 57 no low a 61 no max enquanto o custo por tarefa multiplica por 3,6, existe uma chance real de o esforço menor já resolver o seu caso

O erro comum deste passo: começar no max "pra garantir" e nunca mais descer, porque aí já funcionou e ninguém mexe

Pra comparar com referências públicas, tem dois lugares que já publicam isso mastigado

A página do Artificial Analysis Intelligence Index v4.1.1 tem a visualização intelligence-vs-cost-per-task, que é literalmente inteligência contra custo por tarefa no mesmo gráfico

E tem o Coding Agent Index, que é uma nota composta de DeepSWE, Terminal-Bench v2.1 e SWE-Atlas-QnA, e publica um custo médio de API por tarefa ao lado da pontuação, considerando entrada padrão, entrada em cache com desconto, cobrança separada de escrita em cache e saída

Se você trabalha com agente de código, esse segundo é o mais próximo da sua realidade

Vídeo: entendendo customizações e ajustes na prática

Pra começar do zero na parte de configurar ferramenta de IA no seu fluxo, este vídeo do canal mostra as customizações e como deixar o ambiente do seu jeito:

Veredito: quando o GPT-6 Astra compensa e quando não

Veredito honesto, só com o que dá pra sustentar em número público:

Compensa quando a tarefa exige o topo da inteligência e o volume é baixo. Aquela decisão difícil, o bug que já comeu duas tardes, a análise que não pode sair errada. Aqui US$ 1,67 por tarefa é barato perto do seu tempo

Não compensa como padrão pra tarefa repetitiva. Se o seu trabalho é lote, o esforço menor entrega 57 contra 61 pontos por uma fração do custo, e multiplicar 3,6x em cima de milhares de execuções é decisão de orçamento, não de qualidade

O empate com o GPT-5.6 Sol em 61 pontos, com preço por token menos da metade, também merece um teste seu antes de migrar por reflexo. Ainda que o Astra gaste menos token pra chegar lá (42 milhões contra mediana de 62 milhões, e um terço dos tokens do Sol no harness Codex)

E as limitações, porque elas existem: o acesso ainda é escalonado em 4 de setembro de 2026, e todos os números aqui são de benchmark público

Benchmark não é o seu workload. É ponto de partida, não veredito final sobre a sua conta

Conclusão

Custo por tarefa resolvida é a métrica que falta em praticamente todo anúncio de modelo

A pontuação vende, a conta chega depois, e o descompasso entre as duas é onde o dinheiro escorre. No caso do GPT-6 Astra isso está bem documentado: 3,6x de custo por tarefa entre o esforço low e o max, pra 4 pontos de diferença no índice

Próximo passo bem concreto pra hoje: escolhe três tarefas reais do seu dia

Roda elas primeiro nos níveis de esforço mais baratos, anota tokens de entrada e saída, aplica o preço e olha quantas passaram no seu critério

Só sobe o esforço quando a qualidade REALMENTE não bastar. Não porque o max parece mais seguro 😀

Um abraço e até o próximo post!

Matheus Battisti

Perguntas frequentes

Quanto custa usar o GPT-6 Astra pela API, por milhão de tokens?

O GPT-6 Astra cobra US$ 10,00 por 1M de tokens de entrada e US$ 50,00 por 1M de tokens de saída. O Artificial Analysis também calcula um preço combinado (blended) de US$ 7,70 por 1M de tokens, numa proporção 7:2:1 entre cache hit, entrada e saída. Esse blended serve pra estimativa rápida, não pra fechar orçamento se o seu uso tem pouco cache hit.

Compensa deixar o GPT-6 Astra sempre no esforço máximo (max)?

Na maioria das vezes não. O custo por tarefa do Intelligence Index vai de US$ 0,46 no esforço low até US$ 1,67 no max, uma variação de 3,6x, enquanto a pontuação sobe só de 57 para 61. Entre xhigh e max a pontuação nem muda (61 e 61), só o custo total, que salta de US$ 2.004,12 para US$ 3.013,30.

O GPT-6 Astra já está liberado pra todo mundo usar?

Não. O lançamento foi anunciado em 3 de setembro de 2026 com rollout escalonado, começando por um grupo limitado de organizações. Em 4 de setembro de 2026 o acesso ainda é parcial, e a chegada ao ChatGPT Plus, Pro, Business, Enterprise e à API foi comunicada como algo pros próximos dias.

O GPT-6 Astra sai mais caro que o GPT-5.6 Sol pra mesma pontuação?

Sim. Os dois empatam em 61 pontos no Intelligence Index, mas o GPT-5.6 Sol custa US$ 4,00 por 1M de entrada e US$ 20,00 por 1M de saída, menos da metade do Astra. Rodar o índice completo saiu US$ 2.017,29 no Sol contra US$ 3.013,30 no Astra (max).

O GPT-6 Astra é caro ou econômico, afinal?

As duas leituras convivem, porque medem coisas diferentes. Em preço de tabela o Artificial Analysis diz que ele está entre os modelos líderes em inteligência, mas é particularmente caro quando comparado a modelos de preço similar. Em consumo ele economiza: gerou 42 milhões de tokens pra completar o Intelligence Index contra uma mediana de 62 milhões, e no harness Codex usa um terço dos tokens do GPT-5.6 Sol (max). Ou seja, o token dele é caro e ele gasta menos token, então quem decide é a multiplicação dos dois na sua tarefa.

O Claude Fable 5.1 tem custo por tarefa melhor que o GPT-6 Astra?

Em pontuação sim, o Fable 5.1 (max with fallback) fez 66 pontos, a maior nota medida no Intelligence Index. Mas em custo não: rodar o índice inteiro com ele saiu US$ 8.523,16, bem mais caro que os US$ 3.013,30 do Astra (max), então o topo de inteligência custa caro em qualquer marca.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares