Janela de contexto do GPT-6 Astra: o que cabe em 1.050.000 tokens?

A janela de contexto GPT-6 Astra é de 1.050.000 tokens, e o limite máximo de saída é separado: 128.000 tokens. Na prática, dá pra jogar repositório inteiro, documentação longa e histórico de projeto de uma vez na entrada, mas a entrega continua fatiada. Na API da OpenAI o texto custa US$ 10,00 por 1M de input, US$ 1,00 em cache, US$ 12,50 na escrita de cache e US$ 50,00 no output, e prompts acima de 272 mil tokens de input pagam multiplicador na requisição inteira. Tem Compaction nativa pra fluxos longos
Um modelo com 1.050.000 tokens de contexto acabou de sair do forno
A OpenAI anunciou o GPT-6 Astra em 3 de setembro de 2026, e o número que mais salta aos olhos é justamente esse: 1.050.000 tokens de janela de contexto
Se tu vive esbarrando em limite de contexto no meio de um refactor, mandando arquivo por arquivo pro modelo e depois tendo que explicar de novo o que já tinha explicado, esse post é pra ti
A ideia aqui é simples: entender o que essa janela realmente permite, e por que o limite de saída é uma conversa TOTALMENTE separada da entrada 😀
O que a OpenAI anunciou no GPT-6 Astra
O lançamento foi em 3 de setembro de 2026, com liberação em fases
Ou seja, ninguém acordou com o modelo na mão: a liberação começou pelos participantes do programa Daybreak e vai abrindo aos poucos
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 114 aulas
- 4 projetos
- 9h 18min
Na documentação da API, a própria OpenAI descreve o GPT-6 Astra como o modelo mais capaz dela, feito para trabalho ponta a ponta difícil: raciocínio complexo, código, uso de computador, pesquisa e criação de documentos
E no ChatGPT? Aí a coisa muda de nome
No Chat ele aparece como GPT-6 Pro, disponível nos planos Pro, Business e Enterprise
No ChatGPT Plus ele NÃO está incluído, então se teu plano é o Plus, esquece o botãozinho mágico por enquanto
Uma observação honesta antes de seguir: o número de 1.050.000 tokens é o da ficha do modelo na API
A central de ajuda não publica limite de janela em tokens por plano do ChatGPT, então não dá pra prometer que a experiência no Chat é idêntica à da API
O que dá para colocar de uma vez em 1.050.000 tokens
Aqui mora o pulo do gato
Janela grande não é sobre "escrever mais", é sobre o modelo enxergar o problema INTEIRO antes de opinar
Os cenários que mudam de verdade:
- Repositório inteiro em vez de arquivo por arquivo: em vez de escolher a dedo os 8 arquivos que tu acha que importam, tu manda a base e deixa o modelo achar a relação que tu não viu
- Documentação longa completa: manual, spec, RFC interna, tudo junto, sem picotar em pedaços que perdem referência cruzada
- Histórico acumulado de um projeto: decisões antigas, issues, changelog, aquele documento de arquitetura que ninguém lê mais
- Transcrições e contratos extensos: material que é chato justamente porque a informação que importa está espalhada em pontos distantes do texto
E aqui vale um aviso pra não cair em promessa tosca: não existe conversão oficial publicada pela OpenAI de token pra linha de código ou pra página
Quem diz "cabem X mil linhas" está chutando, e chute com número é a pior categoria de chute
Se tu quiser ver outra janela desse porte de perto, já falei por aqui sobre o contexto de 1M no GLM-5.3-Flash, que é outro modelo, com outra ficha técnica
E não é a primeira janela desse porte no mercado, viu? A escala de 1 milhão de tokens no Claude Fable 5 já tinha aberto essa porta pra quem trabalha com base de código grande
O que o GPT-6 Astra faz é entrar nessa mesma faixa com a ficha oficial de 1.050.000 tokens
Por que o limite de saída é separado do de entrada
Essa é a confusão número 1 e vale parar aqui
Contexto de entrada e limite de saída são dois números diferentes, com funções diferentes
No GPT-6 Astra, a entrada aceita 1.050.000 tokens
A saída máxima é de 128.000 tokens
Então o modelo LÊ o repositório inteiro, mas ele não vai te devolver o repositório inteiro reescrito numa tacada só
A analogia de aproximação: é como um revisor que leu os 40 capítulos do teu livro e consegue comentar qualquer trecho com o resto na cabeça, porém a devolutiva dele vem em blocos, não num único despejo
A consequência prática pro teu fluxo:
- Planejamento, análise e diagnóstico se beneficiam MUITO da janela cheia
- Entrega de código costuma precisar vir fatiada em chamadas, arquivo por arquivo ou módulo por módulo
- Vale pedir a resposta já organizada em partes, em vez de descobrir o corte no meio da geração
E tem as restrições de parâmetro da API, que pegam quem tem script pronto de outro modelo
O GPT-6 Astra não suporta o nível de reasoning effort none, não aceita valores customizados de temperature nem de top_p, e não devolve logprobs
Tome cuidado! Se teu código manda temperature fixo em todo request por padrão, esse é o ponto que vai te dar dor de cabeça na migração
Quanto custa encher a janela de contexto
Agora a parte que dói no bolso
Os preços na API da OpenAI, por 1 milhão de tokens de texto:
| Item | Preço por 1M de tokens |
|---|---|
| Input | US$ 10,00 |
| Input em cache | US$ 1,00 |
| Escrita de cache | US$ 12,50 |
| Output | US$ 50,00 |
Repara na diferença entre input normal e input em cache
Em fluxo repetido, onde o mesmo contexto volta várias vezes, o cache é o que separa uma conta saudável de um susto no fim do mês
E tem um degrau importante: prompts acima de 272 mil tokens de entrada são cobrados com multiplicador
Acima de 272K tokens de input, a cobrança vai pra 2x nas taxas de input e de cache e 1,5x no output, e isso vale para a requisição completa, não só pro excedente
Ou seja, passar de 272 mil tokens não é um degrauzinho suave, é um degrau que reprecifica a chamada inteira
Tem ainda o Fast mode, pensado justamente pra prompts de contexto longo acima de 272 mil tokens
Ele é até 2,5x mais rápido que o tier Standard, e custa 2x as taxas aplicáveis
Então a pergunta que fica na tua mão: essa resposta precisa ser rápida a ponto de valer o dobro?
Compaction: como não estourar a janela em fluxos longos
Junto da janela de 1M, o GPT-6 Astra tem suporte nativo a Compaction, e a compaction server-side foi lançada na Responses API
A ideia é resolver o problema clássico de agente que roda por muito tempo: o transcript cresce, cresce, e uma hora não cabe mais
Tem duas formas de usar
Compaction automática na criação da resposta:
Tu define context_management com compact_threshold numa requisição de create da Responses API
Quando a contagem de tokens renderizada cruza o limite, o servidor executa a compaction sozinho, sem precisar de chamada separada a /responses/compact
{
"model": "gpt-6-astra",
"input": "...",
"context_management": {
"compact_threshold": 400000
}
}
Compaction explícita pelo endpoint dedicado:
Se tu quer controle na mão, dá pra chamar /responses/compact e gerar o contexto compactado na hora que TU decidir
Detalhe que salva vida: a janela enviada para /responses/compact ainda precisa caber na janela de contexto do modelo
Não adianta deixar estourar e só então lembrar da compaction, beleza?
Depois disso, nas chamadas seguintes tu envia a janela compactada (incluindo o item de compaction) no lugar do transcript completo
E o que é esse item de compaction? Ele é opaco
Ele leva adiante estado e raciocínio anteriores usando menos tokens, e não foi feito para ser interpretado por humanos
Então não tenta ler pra "conferir", ele não é um resumo bonitinho pra tu revisar
Pra quem tem exigência de ZDR, tem uma condição de configuração: a compaction server-side é ZDR-friendly quando tu define store=false nas requisições de create da Responses API
Esse é o tipo de detalhe que passa batido no protótipo e vira problema na hora do compliance
Vale usar a janela de 1M no seu projeto?
Leitura honesta: janela gigante resolve LEITURA, não resolve entrega
O GPT-6 Astra enxerga 1.050.000 tokens de uma vez, mas devolve no máximo 128.000, então o gargalo da entrega continua existindo, só mudou de lugar
E o custo escala junto com a ambição
O degrau dos 272 mil tokens pesa de verdade, porque ele reprecifica a requisição inteira em 2x input e cache e 1,5x output, e o Fast mode dobra por cima do que for aplicável
O próximo passo concreto, na ordem:
- Mede o tamanho real do teu contexto antes de mandar tudo: muita gente acha que precisa de 1M e na real vive tranquilo com uma fração disso
- Usa cache em fluxo repetido: input em cache custa US$ 1,00 contra US$ 10,00 do input normal, essa diferença é o jogo todo
- Liga compaction em fluxo de agente longo:
compact_thresholdna create resolve automático, e o/responses/compactfica pra quando tu quiser mandar na mão - Acompanha a liberação em fases: começou pelo programa Daybreak, então pode ser que o teu acesso ainda não tenha chegado
Janela de 1.050.000 tokens é massa demais, sem dúvida
Só não confunda "cabe tudo" com "resolve tudo", porque são coisas diferentes 🙂
até o próximo post!
Perguntas frequentes
O GPT-6 Astra está disponível no ChatGPT Plus?
Não. No ChatGPT ele aparece com o nome GPT-6 Pro e está disponível apenas nos planos Pro, Business e Enterprise. Quem tem o plano Plus não tem acesso a ele por enquanto.
GPT-6 Astra e GPT-6 Pro são o mesmo modelo?
Sim, é o mesmo modelo com nomes diferentes por produto. Na API e na documentação da OpenAI ele é chamado de GPT-6 Astra, enquanto no ChatGPT a liberação usa o nome GPT-6 Pro.
Quanto custa um prompt acima de 272 mil tokens no GPT-6 Astra?
Prompts com mais de 272 mil tokens de entrada são cobrados com multiplicador de 2x nas taxas de input e de cache, e 1,5x no output. Esse multiplicador vale para a requisição completa, não só para o trecho que excedeu o limite.
O que é o Fast mode do GPT-6 Astra?
É um modo pensado para prompts de contexto longo acima de 272 mil tokens, com resposta até 2,5x mais rápida que o tier Standard. Em troca, ele custa 2x as taxas aplicáveis, então vale calcular se a velocidade extra compensa o custo.
O GPT-6 Astra aceita ajustar temperature ou reasoning effort none na API?
Não. O modelo não suporta o nível de reasoning effort none, não aceita valores customizados de temperature nem de top_p, e também não devolve logprobs. Quem migra script de outro modelo com esses parâmetros fixos precisa ajustar antes de rodar.
Como habilitar a compaction server-side do GPT-6 Astra na Responses API?
Basta definir context_management com compact_threshold já na requisição de create da Responses API. Quando a contagem de tokens renderizada cruza esse limite, o próprio servidor executa a compaction, sem precisar de uma chamada separada ao endpoint /responses/compact.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como testar o GPT-6 Astra no seu projeto antes de migrar (passo a passo)
Testar o GPT-6 Astra antes de migrar: monte de 10 a 20 tarefas reais do seu produto, compare com seu modelo atual e veja nota, tokens e custo lado a lado.
Como migrar seu projeto para o GPT-6 Astra sem quebrar o que já funciona: checklist antes de trocar o modelo
Migrar para o GPT-6 Astra sem quebrar o que já funciona: checklist com baseline, rota por vez, parâmetros revisados e rollback pronto antes de trocar o modelo.
Por que o GPT-6 Astra corta a resposta no meio? O limite de 128 mil tokens de saída e como fatiar tarefas longas
O GPT-6 Astra lê até 1 milhão de tokens, mas o limite de tokens de saída é 128 mil por resposta. Veja por que ele corta e como fatiar tarefas longas.
