Como registrar os resultados do teste do GPT-6 Astra para decidir com dados (modelo de planilha)

O teste do GPT-6 Astra só vira decisão se alguém registrar na hora. Monte uma planilha com uma linha por tarefa e as colunas: prompt usado na íntegra, ambiente (chat, Codex ou API), resultado em uma frase, número de correções até ficar aceitável, custo e nota de 0 a 5. O ambiente importa porque a regra de preço muda: na API são US$ 10 por milhão de tokens de entrada e US$ 50 de saída, com sobretaxa acima de 272 mil tokens de entrada; no Codex essa sobretaxa não se aplica. No fim, olhe a taxa de tarefas resolvidas sem nenhuma correção
Fala aí, beleza? Time que passa a manhã inteira testando modelo novo e à tarde não consegue explicar por que escolheu: isso não é decisão, é impressão
A OpenAI lançou o GPT-6 Astra em 3 de setembro de 2026 como seu modelo mais capaz, voltado pra trabalho de ponta a ponta: raciocínio complexo, código, uso de computador, pesquisa e criação de documentos
Só que o rollout foi confuso e desigual nos primeiros dias, com cliente pagante sem acesso ao modelo que o plano dizia incluir
O próprio Sam Altman classificou o rollout como "messy" em 4 de setembro de 2026
A liberação pros assinantes Plus só foi marcada como concluída em 6 de setembro de 2026
Aí acontece o óbvio: cada pessoa do seu time testou em um lugar diferente, num dia diferente, com um acesso diferente
E no fim da semana ninguém consegue comparar nada, a escolha sai pela última resposta bonita que alguém viu na tela
O que eu vou te mostrar aqui é bobo de tão simples: uma planilha de meia dúzia de colunas que transforma impressão solta em decisão que você consegue defender depois 🙂
O que definir antes de abrir a planilha
Antes do primeiro prompt, três coisas precisam estar fechadas, senão a planilha nasce torta
1. Onde seu time tem acesso
Isso muda tudo, porque o Astra não mora no mesmo lugar em todo plano
No ChatGPT Plus (US$ 20 por mês) o GPT-6 Astra é acessado por dentro do ChatGPT Work e do Codex, com limite de uso do plano
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 114 aulas
- 4 projetos
- 9h 18min
Ou seja: ele não aparece no seletor de modelo do chat comum, onde o topo segue sendo o GPT-5.6 Sol
Já no chat comum o modelo aparece com o nome GPT-6 Pro, listado pela OpenAI apenas nos planos Pro, Business e Enterprise
E o Pro aqui aparece em dois níveis de preço, com teto de mensagens diferente em cada um: no Pro de US$ 100 são 50 mensagens do GPT-6 Pro por semana, e no Pro de US$ 200 são 200 por semana
Se você ainda está batendo cabeça pra saber quem já pode usar hoje, resolve isso antes: testar sem saber qual produto você está usando é jogar dado fora
Na API a história é mais direta, basta definir model = gpt-6-astra numa requisição da Responses API
2. As tarefas que vão entrar no teste
Escolhe de 5 a 10 tarefas REAIS do trabalho de vocês, não desafio de internet
E escreve, antes de rodar, o que conta como aprovado em cada uma
Pergunta chata que evita briga depois: "aprovado" é rodar sem erro, é passar no teste, ou é o time aceitar o código sem reescrever? Define e anota
3. Os números de custo que alimentam a coluna de preço
O preço padrão do Astra na API é de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída
Entrada em cache sai por US$ 1 por milhão, e escrita de cache por US$ 12,50 por milhão
E tem a pegadinha que mais estoura orçamento em teste: prompts acima de 272.000 tokens de entrada mudam a tarifa da requisição INTEIRA, não só do excedente
Acima desse ponto são 2x nas taxas de entrada e de cache e 1,5x na saída, o que dá US$ 20 de entrada e US$ 75 de saída por milhão
Como a janela de contexto é de 1.050.000 tokens (divulgada como 1M), estourar os 272 mil é bem mais fácil do que parece, principalmente se alguém jogar o repositório inteiro no prompt
Detalhe pra anotar no rodapé da planilha: o corte de conhecimento do modelo é abril de 2026, e ele aceita texto e imagem na entrada, devolvendo texto
Como montar a planilha de teste do GPT-6 Astra passo a passo
O cabeçalho pode ser esse aqui, colado direto numa planilha nova ou salvo como CSV
tarefa,ambiente,prompt_usado,resultado,correcoes,desistiu,tokens_entrada,custo_estimado_usd,nota_0_5
landing page institucional,Codex,"<prompt completo aqui>","página abriu e o layout ficou usável",0,nao,18000,0.28,5
clone de plataforma 2d,chat,"<prompt completo aqui>","jogo abre mas o personagem nao pula",3,sim,42000,1.10,0
Agora o passo a passo de como preencher isso sem se enganar
- Crie a aba de tarefas com uma linha por TAREFA, não por prompt. A unidade de decisão é a tarefa concluída, não a quantidade de mensagens trocadas. O erro comum deste passo: abrir uma linha nova a cada tentativa de correção, o que infla a planilha e esconde justamente o dado mais valioso, que é quantas idas e voltas aquela tarefa custou
- Cole o prompt usado na íntegra, sem resumir. Nada de escrever "pedi uma landing page", porque daqui a duas semanas ninguém reproduz isso. O erro comum deste passo: resumir o prompt. Se o prompt é gigante, joga num arquivo
.mdna pasta do teste e coloca o caminho na célula - Registre o resultado em uma frase objetiva, mais o link ou arquivo gerado. "Rodou, mas o scroll travou na segunda seção" vale mais que "mais ou menos". O erro comum deste passo: registrar só o que deu certo. Falha não anotada vira falha esquecida, e falha esquecida vira decisão errada
- Conte as correções. Cada prompt extra necessário até chegar num resultado aceitável conta como 1, e quando você desistir, marca a coluna
desistiue para de contar. O erro comum deste passo: deixar em branco quando desistiu, o que faz a tarefa parecer barata quando ela foi um buraco sem fundo - Anote ONDE rodou. Esse campo não é burocracia, é dinheiro: a regra de custo muda por produto. No Codex, a sobretaxa de contexto longo não se aplica e entradas em cache não são cobradas, e essa regra vale só pro Codex, enquanto a API continua aplicando a sobretaxa acima dos 272 mil tokens. O erro comum deste passo: comparar o custo de um teste feito no Codex com outro feito na API como se fosse a mesma conta
- Dê nota final de 0 a 5, na mesma escala para todos os modelos comparados. Escala combinada e escrita em algum canto da planilha, do tipo: 0 não entregou (ou você desistiu), 3 entregou com retrabalho, 5 entregou pronto sem correção. O erro comum deste passo: cada pessoa usando a régua da cabeça dela, aí a média não significa nada
- Feche com duas métricas só: média por categoria e taxa de tarefas concluídas SEM nenhuma correção. Essa segunda é a que separa modelo bom de modelo simpático. O erro comum deste passo: olhar só a média geral, que é gentil demais com um modelo que acerta muito no fácil e quebra no que importa
Se você quiser ir além, coloca uma coluna de tempo de resposta também
Em teste de lançamento isso costuma variar bastante entre ambientes, e vale entender por que o Astra demora para responder antes de culpar o modelo pela lentidão da sua aplicação
Por que a coluna de correções é a mais importante (o que vi testando na prática)
Eu já fiz esse tipo de maratona de teste e é por isso que insisto tanto nessa coluna
Quando testei um modelo de lançamento recente (não era o Astra, mas a mecânica do teste é a mesma), fiquei uma manhã e um pedaço da tarde nisso, quase o dia todo, e fui anotando projeto por projeto o que funcionou e o que quebrou
O jogo de tanques saiu com três ou quatro prompts
O clone de jogo de plataforma travou num detalhe idiota: gastei uns três prompts só pra fazer o personagem pular, e não consegui
A landing page, por outro lado, saiu com UM prompt só, e nas duas ferramentas que eu testei
E esses três são só uma parte do que passou pela planilha naquele dia: no balanço final, aproximadamente metade dos projetos falhou
Se liga no que acontece sem registro: no fim do dia a memória guarda a landing page bonita que saiu de primeira e apaga as três tentativas fracassadas do pulo
Aí você fecha o notebook com a sensação de "achei que ficou massa", e essa sensação vira a decisão do time inteiro 😅
Outras coisas que só apareceram porque eu estava anotando: os erros concretos se repetiam (jogo que não iniciava, scroll travado, preview que não carregava, erro recorrente no console)
E pedir correção ao modelo em cima do bug costumava piorar o código em vez de resolver, o que é exatamente o tipo de coisa que a coluna de correções denuncia e a impressão geral esconde
Eu também separei tipos diferentes de saída (código, imagem, vídeo e apresentação) e guardei uma avaliação pra cada, em vez de misturar tudo num julgamento só
E comparei modos de execução dentro da extensão: o modo de arquitetura deu resultados melhores que o modo padrão, mesmo demorando mais pra responder
Repeti a mesma landing page na interface web e na extensão dentro do editor de propósito, e joguei na segunda ferramenta os pedidos que tinham falhado na primeira, pra saber se o problema era do ambiente ou do modelo
Sem a coluna de ambiente eu nunca teria conseguido responder isso
No vídeo abaixo eu mostro esse dia todo de teste, com as tentativas e as falhas aparecendo uma a uma ao longo das horas
Como adaptar a planilha ao que seu time precisa decidir
A mesma planilha resolve três perguntas diferentes, mudando só o que você compara
Cenário 1: GPT-6 Astra ou Claude Fable 5.1?
Esse é o caso em que o preço não decide nada, porque os dois têm o mesmo preço de tabela por token
| Modelo | Entrada por milhão | Saída por milhão | Intelligence Index v4.2 |
|---|---|---|---|
| Claude Fable 5.1 | US$ 10 | US$ 50 | 57 pontos |
| GPT-6 Astra (max) | US$ 10 | US$ 50 | 55 pontos |
| GPT-5.6 Sol | US$ 4 | US$ 20 | 4 pontos atrás do Astra |
Na página viva do Artificial Analysis Intelligence Index, na versão v4.2, o Fable 5.1 lidera e o Astra fica em segundo, com dois pontos de diferença
Vale saber como esse número nasceu: o Artificial Analysis publicou a v4.2 depois de críticas de que os benchmarks anteriores não capturavam o avanço do Astra, usando tarefas mais difíceis e maior parcela de dados de teste secretos
Dois pontos num índice não pagam a conta da sua decisão, beleza? É a sua planilha que paga
Cenário 2: vale o upgrade em cima do GPT-5.6 Sol?
O Sol custa US$ 4 de entrada e US$ 20 de saída por milhão, cerca de 2,5x mais barato que o Astra
Então a pergunta não é "qual é melhor", é: a coluna de correções justifica pagar 2,5x?
Roda as MESMAS tarefas nos dois, com a mesma escala de nota, e compara a taxa de tarefas concluídas sem correção
Se o Astra resolve de primeira o que o Sol resolve em três tentativas, o mais caro por token pode sair mais barato no fim do mês
Se empatar, você acabou de economizar um bom dinheiro por ter anotado
Cenário 3: onde rodar (Codex, chat ou API)?
Aqui quem decide são as colunas de ambiente e de custo
A sobretaxa de contexto longo é o divisor de águas: na API ela existe acima de 272 mil tokens de entrada, no Codex ela não se aplica e o cached input não é cobrado
Uma coluna extra que vale a pena acompanhar é o consumo de tokens por tarefa
Segundo o Artificial Analysis, o Astra usa menos tokens por tarefa do que qualquer outro modelo de fronteira medido, e isso mexe direto na sua conta, mesmo com o preço por token mais alto
E sobre benchmark: a OpenAI divulgou no anúncio 97,6% no FrontierMath Tier 4, 99,9% no ARC-AGI-3, 100% no ExploitBench e 72,6% no OSWorld 2.0 de uso de computador, com cerca de 47% menos tempo por tarefa que o GPT-5.6 Sol
São números fortes, sem dúvida
Mas benchmark não é igual à realidade do seu código, do seu legado e do seu jeito de escrever prompt
A sua tabela de 8 tarefas reais decide melhor que a tabela deles, é isso que eu repito sempre
Conclusão
A planilha não serve pra provar que o GPT-6 Astra é bom
Ela serve pra você conseguir EXPLICAR a decisão depois, quando alguém perguntar por que o time trocou de modelo, ou por que não trocou
Recapitulando o que ela precisa ter: uma linha por tarefa, o prompt completo, o resultado em uma frase, o número de correções, o ambiente onde rodou, o custo e a nota de 0 a 5 na mesma escala
E duas métricas no fim: média por categoria e taxa de tarefas resolvidas sem nenhuma correção
Próximo passo, hoje mesmo: pega as 5 tarefas que vocês mais repetem na semana, roda cada uma UMA vez e preenche as colunas de correções e de nota antes de esquecer
Meia hora de trabalho chato agora vale mais que uma semana inteira de teste sem registro…
Até o próximo post! =)
Perguntas frequentes
Qual a diferença entre o GPT-6 Astra e o GPT-6 Pro que aparece no chat?
É o mesmo modelo em portas diferentes. No ChatGPT Plus o Astra fica dentro do ChatGPT Work e do Codex, com limite de uso do plano, e não aparece no seletor do chat comum. Já no chat comum ele é listado com o nome GPT-6 Pro, só nos planos Pro (que tem dois níveis de preço, o de US$ 100 e o de US$ 200), Business e Enterprise.
Quanto custa rodar um teste do GPT-6 Astra pela API?
O preço padrão é US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída. Entrada em cache sai por US$ 1 por milhão e escrita de cache por US$ 12,50. Se algum prompt do teste passar de 272 mil tokens de entrada, a conta da requisição inteira muda pra US$ 20 de entrada e US$ 75 de saída por milhão.
Testar no Codex sai mais barato que testar na API?
Pode sair, sim, porque a regra é diferente. No Codex a sobretaxa de contexto longo acima de 272 mil tokens não se aplica e entrada em cache não é cobrada, e isso vale só pra ele. A API continua cobrando a sobretaxa normalmente, então comparar custo de teste feito num lugar com o outro sem anotar onde rodou é conta errada.
Quantas tarefas eu preciso testar pra planilha valer alguma coisa?
De 5 a 10 tarefas reais do trabalho do time, não desafio de internet. Numa maratona que fiz com outro modelo de lançamento recente, numa manhã e num pedaço da tarde, rodei coisas como landing page e um clone de plataforma, e perto de metade dos projetos deu problema em algum ponto, o que já é dado suficiente pra decidir.
Um prompt só é suficiente pra avaliar uma tarefa no teste?
Depende da tarefa. Naquela maratona com outro modelo de lançamento recente, a landing page ficou pronta com um prompt só, nas duas ferramentas que usei. Já o jogo de tanques levou três ou quatro prompts, e o clone de plataforma nem saiu do lugar: gastei cerca de três prompts tentando fazer o personagem pular e não consegui, então essa entrou como tarefa que desistiu.
Preciso me preocupar com a data de corte de conhecimento do GPT-6 Astra durante o teste?
Vale anotar no rodapé da planilha, porque explica respostas erradas sobre eventos recentes. O corte de conhecimento do modelo é abril de 2026, e a entrada aceita texto e imagem, sempre devolvendo texto.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como testar o GPT-6 Astra no seu projeto antes de migrar (passo a passo)
Testar o GPT-6 Astra antes de migrar: monte de 10 a 20 tarefas reais do seu produto, compare com seu modelo atual e veja nota, tokens e custo lado a lado.
Como migrar seu projeto para o GPT-6 Astra sem quebrar o que já funciona: checklist antes de trocar o modelo
Migrar para o GPT-6 Astra sem quebrar o que já funciona: checklist com baseline, rota por vez, parâmetros revisados e rollback pronto antes de trocar o modelo.
Por que o GPT-6 Astra corta a resposta no meio? O limite de 128 mil tokens de saída e como fatiar tarefas longas
O GPT-6 Astra lê até 1 milhão de tokens, mas o limite de tokens de saída é 128 mil por resposta. Veja por que ele corta e como fatiar tarefas longas.
