GPT-6 Astra vale a pena pelo custo por tarefa resolvida? O que os benchmarks não mostram

O GPT-6 Astra chegou em 3 de setembro de 2026 com rollout escalonado e nota alta: 61 pontos no Artificial Analysis Intelligence Index, contra mediana de 36. Só que a conta conta outra história. Quando o assunto é GPT-6 Astra custo por tarefa, o esforço de raciocínio muda tudo: o custo vai de US$ 0,46 por tarefa no low para US$ 1,67 no max (3,6x), enquanto a pontuação sobe só de 57 para 61. Ou seja: pagar pelo esforço máximo por padrão é queimar dinheiro em quase toda tarefa repetitiva
Fala aí, beleza? A OpenAI soltou o GPT-6 Astra e todo mundo correu pra olhar a pontuação antes de olhar a fatura
E é aí que mora o problema: benchmark mede o quão boa é a resposta, não quanto foi queimado pra chegar nela
O lançamento foi anunciado em 3 de setembro de 2026, com liberação em fases. A pergunta que este post persegue não é "quantos pontos o modelo fez?", e sim uma bem mais chata de responder: quanto custa cada tarefa que ele realmente resolve? 🙂
O que a OpenAI lançou no GPT-6 Astra e quem já tem acesso
O anúncio saiu em 3 de setembro de 2026, com rollout escalonado começando por um grupo limitado de organizações
Em 4 de setembro de 2026 o cenário ainda é esse: acesso parcial. Nem toda conta elegível tem o modelo liberado, e a chegada ao ChatGPT Plus, Pro, Business, Enterprise e à API foi comunicada como algo pros "próximos dias"
Então, se o modelo ainda não apareceu na sua conta, não é bug seu, é a fila
O que já dá pra fazer desde agora é a lição de casa: entender a estrutura de preço e decidir em quais tarefas esse modelo entra. Vale principalmente se você já pensa em delegar tarefas com computer use, porque agente rodando sozinho é justamente onde o token some sem ninguém ver
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Por que a pontuação de benchmark engana na hora de escolher modelo
Benchmark é um número de qualidade
Só que ele responde uma pergunta só: a resposta ficou boa? E ignora completamente a outra metade da história, que é o quanto de token foi gasto pra produzir aquela resposta
E aqui entra a parte que quase ninguém coloca no slide: modelo de raciocínio pensa gastando token de saída. O raciocínio não é de graça, ele é gerado, e sai na conta
Olha a assimetria de preço do GPT-6 Astra: US$ 10,00 por 1M de tokens de entrada e US$ 50,00 por 1M de tokens de saída
Saída custa cinco vezes mais que entrada. Então todo token que o modelo usa "pensando" é cobrado na faixa cara da tabela. Por isso vale saber também o limite de tokens de saída antes de mandar tarefa gigante de uma vez
E se dois modelos empatam na nota? Aí fica escancarado: mesma pontuação, contas completamente diferentes. É exatamente o que acontece quando você bota o Astra do lado do antecessor dele, e eu mostro isso já já
A métrica honesta é custo por tarefa resolvida
Não custo por milhão de tokens (que é abstrato), não pontuação (que é parcial). Quanto saiu do bolso por unidade de trabalho que passou no SEU critério de "tá bom"
Custo por tarefa por nível de esforço: os números do GPT-6 Astra
O Artificial Analysis roda o Intelligence Index com cada variante de esforço de raciocínio do modelo e publica o custo total de cada rodada
Se liga nisso, porque é aqui que a ficha cai:
| Esforço de raciocínio | Intelligence Index | Custo total pra rodar o índice |
|---|---|---|
| non-reasoning | 55 | não publicado |
| low | 57 | US$ 574,92 |
| medium | 59 | US$ 1.032,97 |
| high | 60 | US$ 1.429,26 |
| xhigh | 61 | US$ 2.004,12 |
| max | 61 | US$ 3.013,30 |
Repara no pulo do xhigh pro max: a pontuação é a MESMA (61 e 61) e o custo total sobe de US$ 2.004,12 para US$ 3.013,30
Traduzindo pra custo por tarefa, a conta que o Artificial Analysis publicou é essa: de US$ 0,46 por tarefa no esforço low até US$ 1,67 por tarefa no max
Isso é 3,6x de variação de preço
E quanto a qualidade andou nesse mesmo trecho? De 57 para 61 pontos
A curva de custo sobe muito mais rápido que a curva de qualidade. Essa é a frase que resume o post inteiro, e é o motivo de "usar sempre no máximo" ser uma decisão cara e quase sempre preguiçosa
GPT-6 Astra x GPT-5.6 Sol x Claude Fable 5.1: nota e conta lado a lado
Agora o comparativo que interessa, com os três no mesmo índice:
| Modelo | Intelligence Index | Entrada (1M) | Saída (1M) | Custo total pra rodar o índice |
|---|---|---|---|---|
| GPT-6 Astra (max) | 61 | US$ 10,00 | US$ 50,00 | US$ 3.013,30 |
| GPT-5.6 Sol (max) | 61 | US$ 4,00 | US$ 20,00 | US$ 2.017,29 |
| Claude Fable 5.1 (max with fallback) | 66 | US$ 10,00 | US$ 50,00 | US$ 8.523,16 |
Olha o empate do meio da tabela: Astra e Sol fizeram os mesmos 61 pontos, e o Sol custa menos da metade por token, tanto na entrada quanto na saída
Se você olhasse só a coluna da pontuação, os dois seriam intercambiáveis. Não são
E o Fable 5.1? É a maior pontuação medida, 66 pontos, e também a rodada mais cara da tabela por uma boa margem. Topo de inteligência custa caro em qualquer marca, não é implicância com a OpenAI
Agora o contraponto justo pro Astra, porque tem um: ele gasta menos token pra fazer o mesmo trabalho
Pra completar o Intelligence Index, o GPT-6 Astra (max) gerou 42 milhões de tokens, contra uma mediana de 62 milhões. E no harness Codex ele usa um terço dos tokens do GPT-5.6 Sol (max)
Ou seja: o preço por token é alto, mas ele fala menos pra chegar no mesmo lugar. É por isso que comparar tabela de preço isolada também engana. O que fecha a conta é preço por token MULTIPLICADO por token gasto na sua tarefa
Tem ainda o preço combinado calculado pelo Artificial Analysis, o blended: US$ 7,70 por 1M de tokens, numa proporção 7:2:1 entre cache hit, entrada e saída
Esse número serve pra estimativa rápida, não pra fechar orçamento. Se o seu uso tem pouco cache hit, sua proporção real é outra e sua conta vai ser maior
A leitura oficial do Artificial Analysis sobre o Astra no esforço máximo é bem direta: está entre os modelos líderes em inteligência, mas é particularmente caro quando comparado a modelos de preço similar
E isso não briga com o parágrafo da economia de token, viu? São duas medidas diferentes: "caro" é a POSIÇÃO dele na tabela de preço, perto de modelos que custam o mesmo por token. Economia de token é a quantidade que ele queima pra entregar
A economia amortece a fatura, ela não apaga o preço de tabela. Traduzindo o veredito do post em uma linha: o Astra é um modelo caro que se defende gastando menos token, e é o seu workload que decide se essa economia cobre a diferença
Como montar sua própria conta de custo por tarefa resolvida
Benchmark público é referência, não é o seu workload
A boa notícia é que montar sua versão dessa conta é simples, e não precisa de PC da Nasa nem de planilha de consultoria. É aritmética mesmo:
- Defina o que conta como tarefa resolvida no seu contexto
Isso é o passo mais importante e o mais pulado. "Resolvida" pode ser: teste passou, PR abriu sem retrabalho, resposta aprovada por um humano na primeira. Escreva o critério antes de rodar, senão você vai ajustar o critério pra defender o modelo que já gostava
O erro comum deste passo: usar "a resposta pareceu boa" como critério. Isso não é medível, é impressão
- Colete tokens de entrada e de saída por tarefa
Não dá pra estimar de cabeça, principalmente com raciocínio ligado, porque a saída varia MUITO de tarefa pra tarefa
O erro comum deste passo: contar só o prompt e esquecer que o histórico da conversa volta como entrada a cada chamada
- Aplique o preço da tabela oficial nos dois lados
Entrada e saída têm preços diferentes, então são duas multiplicações separadas, não uma só
O erro comum deste passo: usar o blended de US$ 7,70 por 1M como se fosse o preço de tudo. Ele pressupõe uma proporção específica (7:2:1) que provavelmente não é a sua
- Divida o custo total pelo número de tarefas que passaram no critério do passo 1
Repara: pelo número de tarefas APROVADAS, não pelo número de tentativas. Tentativa que falhou também custou, e é justamente isso que a métrica precisa capturar
- Rode o mesmo lote nos níveis de esforço mais baratos antes de assumir o máximo
Dado que a pontuação vai de 57 no low a 61 no max enquanto o custo por tarefa multiplica por 3,6, existe uma chance real de o esforço menor já resolver o seu caso
O erro comum deste passo: começar no max "pra garantir" e nunca mais descer, porque aí já funcionou e ninguém mexe
Pra comparar com referências públicas, tem dois lugares que já publicam isso mastigado
A página do Artificial Analysis Intelligence Index v4.1.1 tem a visualização intelligence-vs-cost-per-task, que é literalmente inteligência contra custo por tarefa no mesmo gráfico
E tem o Coding Agent Index, que é uma nota composta de DeepSWE, Terminal-Bench v2.1 e SWE-Atlas-QnA, e publica um custo médio de API por tarefa ao lado da pontuação, considerando entrada padrão, entrada em cache com desconto, cobrança separada de escrita em cache e saída
Se você trabalha com agente de código, esse segundo é o mais próximo da sua realidade
Vídeo: entendendo customizações e ajustes na prática
Pra começar do zero na parte de configurar ferramenta de IA no seu fluxo, este vídeo do canal mostra as customizações e como deixar o ambiente do seu jeito:
Veredito: quando o GPT-6 Astra compensa e quando não
Veredito honesto, só com o que dá pra sustentar em número público:
Compensa quando a tarefa exige o topo da inteligência e o volume é baixo. Aquela decisão difícil, o bug que já comeu duas tardes, a análise que não pode sair errada. Aqui US$ 1,67 por tarefa é barato perto do seu tempo
Não compensa como padrão pra tarefa repetitiva. Se o seu trabalho é lote, o esforço menor entrega 57 contra 61 pontos por uma fração do custo, e multiplicar 3,6x em cima de milhares de execuções é decisão de orçamento, não de qualidade
O empate com o GPT-5.6 Sol em 61 pontos, com preço por token menos da metade, também merece um teste seu antes de migrar por reflexo. Ainda que o Astra gaste menos token pra chegar lá (42 milhões contra mediana de 62 milhões, e um terço dos tokens do Sol no harness Codex)
E as limitações, porque elas existem: o acesso ainda é escalonado em 4 de setembro de 2026, e todos os números aqui são de benchmark público
Benchmark não é o seu workload. É ponto de partida, não veredito final sobre a sua conta
Conclusão
Custo por tarefa resolvida é a métrica que falta em praticamente todo anúncio de modelo
A pontuação vende, a conta chega depois, e o descompasso entre as duas é onde o dinheiro escorre. No caso do GPT-6 Astra isso está bem documentado: 3,6x de custo por tarefa entre o esforço low e o max, pra 4 pontos de diferença no índice
Próximo passo bem concreto pra hoje: escolhe três tarefas reais do seu dia
Roda elas primeiro nos níveis de esforço mais baratos, anota tokens de entrada e saída, aplica o preço e olha quantas passaram no seu critério
Só sobe o esforço quando a qualidade REALMENTE não bastar. Não porque o max parece mais seguro 😀
Um abraço e até o próximo post!
Matheus Battisti
Perguntas frequentes
Quanto custa usar o GPT-6 Astra pela API, por milhão de tokens?
O GPT-6 Astra cobra US$ 10,00 por 1M de tokens de entrada e US$ 50,00 por 1M de tokens de saída. O Artificial Analysis também calcula um preço combinado (blended) de US$ 7,70 por 1M de tokens, numa proporção 7:2:1 entre cache hit, entrada e saída. Esse blended serve pra estimativa rápida, não pra fechar orçamento se o seu uso tem pouco cache hit.
Compensa deixar o GPT-6 Astra sempre no esforço máximo (max)?
Na maioria das vezes não. O custo por tarefa do Intelligence Index vai de US$ 0,46 no esforço low até US$ 1,67 no max, uma variação de 3,6x, enquanto a pontuação sobe só de 57 para 61. Entre xhigh e max a pontuação nem muda (61 e 61), só o custo total, que salta de US$ 2.004,12 para US$ 3.013,30.
O GPT-6 Astra já está liberado pra todo mundo usar?
Não. O lançamento foi anunciado em 3 de setembro de 2026 com rollout escalonado, começando por um grupo limitado de organizações. Em 4 de setembro de 2026 o acesso ainda é parcial, e a chegada ao ChatGPT Plus, Pro, Business, Enterprise e à API foi comunicada como algo pros próximos dias.
O GPT-6 Astra sai mais caro que o GPT-5.6 Sol pra mesma pontuação?
Sim. Os dois empatam em 61 pontos no Intelligence Index, mas o GPT-5.6 Sol custa US$ 4,00 por 1M de entrada e US$ 20,00 por 1M de saída, menos da metade do Astra. Rodar o índice completo saiu US$ 2.017,29 no Sol contra US$ 3.013,30 no Astra (max).
O GPT-6 Astra é caro ou econômico, afinal?
As duas leituras convivem, porque medem coisas diferentes. Em preço de tabela o Artificial Analysis diz que ele está entre os modelos líderes em inteligência, mas é particularmente caro quando comparado a modelos de preço similar. Em consumo ele economiza: gerou 42 milhões de tokens pra completar o Intelligence Index contra uma mediana de 62 milhões, e no harness Codex usa um terço dos tokens do GPT-5.6 Sol (max). Ou seja, o token dele é caro e ele gasta menos token, então quem decide é a multiplicação dos dois na sua tarefa.
O Claude Fable 5.1 tem custo por tarefa melhor que o GPT-6 Astra?
Em pontuação sim, o Fable 5.1 (max with fallback) fez 66 pontos, a maior nota medida no Intelligence Index. Mas em custo não: rodar o índice inteiro com ele saiu US$ 8.523,16, bem mais caro que os US$ 3.013,30 do Astra (max), então o topo de inteligência custa caro em qualquer marca.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como testar o GPT-6 Astra no seu projeto antes de migrar (passo a passo)
Testar o GPT-6 Astra antes de migrar: monte de 10 a 20 tarefas reais do seu produto, compare com seu modelo atual e veja nota, tokens e custo lado a lado.
Como migrar seu projeto para o GPT-6 Astra sem quebrar o que já funciona: checklist antes de trocar o modelo
Migrar para o GPT-6 Astra sem quebrar o que já funciona: checklist com baseline, rota por vez, parâmetros revisados e rollback pronto antes de trocar o modelo.
Por que o GPT-6 Astra corta a resposta no meio? O limite de 128 mil tokens de saída e como fatiar tarefas longas
O GPT-6 Astra lê até 1 milhão de tokens, mas o limite de tokens de saída é 128 mil por resposta. Veja por que ele corta e como fatiar tarefas longas.
