Janela de contexto do GPT-6 Astra: o que cabe em 1.050.000 tokens?

janela de contexto GPT-6 Astra com 1.050.000 tokens de entrada
Resposta rápida

A janela de contexto GPT-6 Astra é de 1.050.000 tokens, e o limite máximo de saída é separado: 128.000 tokens. Na prática, dá pra jogar repositório inteiro, documentação longa e histórico de projeto de uma vez na entrada, mas a entrega continua fatiada. Na API da OpenAI o texto custa US$ 10,00 por 1M de input, US$ 1,00 em cache, US$ 12,50 na escrita de cache e US$ 50,00 no output, e prompts acima de 272 mil tokens de input pagam multiplicador na requisição inteira. Tem Compaction nativa pra fluxos longos

Um modelo com 1.050.000 tokens de contexto acabou de sair do forno

A OpenAI anunciou o GPT-6 Astra em 3 de setembro de 2026, e o número que mais salta aos olhos é justamente esse: 1.050.000 tokens de janela de contexto

Se tu vive esbarrando em limite de contexto no meio de um refactor, mandando arquivo por arquivo pro modelo e depois tendo que explicar de novo o que já tinha explicado, esse post é pra ti

A ideia aqui é simples: entender o que essa janela realmente permite, e por que o limite de saída é uma conversa TOTALMENTE separada da entrada 😀

O que a OpenAI anunciou no GPT-6 Astra

O lançamento foi em 3 de setembro de 2026, com liberação em fases

Ou seja, ninguém acordou com o modelo na mão: a liberação começou pelos participantes do programa Daybreak e vai abrindo aos poucos

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

Na documentação da API, a própria OpenAI descreve o GPT-6 Astra como o modelo mais capaz dela, feito para trabalho ponta a ponta difícil: raciocínio complexo, código, uso de computador, pesquisa e criação de documentos

E no ChatGPT? Aí a coisa muda de nome

No Chat ele aparece como GPT-6 Pro, disponível nos planos Pro, Business e Enterprise

No ChatGPT Plus ele NÃO está incluído, então se teu plano é o Plus, esquece o botãozinho mágico por enquanto

Uma observação honesta antes de seguir: o número de 1.050.000 tokens é o da ficha do modelo na API

A central de ajuda não publica limite de janela em tokens por plano do ChatGPT, então não dá pra prometer que a experiência no Chat é idêntica à da API

O que dá para colocar de uma vez em 1.050.000 tokens

Aqui mora o pulo do gato

Janela grande não é sobre "escrever mais", é sobre o modelo enxergar o problema INTEIRO antes de opinar

Os cenários que mudam de verdade:

  • Repositório inteiro em vez de arquivo por arquivo: em vez de escolher a dedo os 8 arquivos que tu acha que importam, tu manda a base e deixa o modelo achar a relação que tu não viu
  • Documentação longa completa: manual, spec, RFC interna, tudo junto, sem picotar em pedaços que perdem referência cruzada
  • Histórico acumulado de um projeto: decisões antigas, issues, changelog, aquele documento de arquitetura que ninguém lê mais
  • Transcrições e contratos extensos: material que é chato justamente porque a informação que importa está espalhada em pontos distantes do texto

E aqui vale um aviso pra não cair em promessa tosca: não existe conversão oficial publicada pela OpenAI de token pra linha de código ou pra página

Quem diz "cabem X mil linhas" está chutando, e chute com número é a pior categoria de chute

Se tu quiser ver outra janela desse porte de perto, já falei por aqui sobre o contexto de 1M no GLM-5.3-Flash, que é outro modelo, com outra ficha técnica

E não é a primeira janela desse porte no mercado, viu? A escala de 1 milhão de tokens no Claude Fable 5 já tinha aberto essa porta pra quem trabalha com base de código grande

O que o GPT-6 Astra faz é entrar nessa mesma faixa com a ficha oficial de 1.050.000 tokens

Por que o limite de saída é separado do de entrada

Essa é a confusão número 1 e vale parar aqui

Contexto de entrada e limite de saída são dois números diferentes, com funções diferentes

No GPT-6 Astra, a entrada aceita 1.050.000 tokens

A saída máxima é de 128.000 tokens

Então o modelo LÊ o repositório inteiro, mas ele não vai te devolver o repositório inteiro reescrito numa tacada só

A analogia de aproximação: é como um revisor que leu os 40 capítulos do teu livro e consegue comentar qualquer trecho com o resto na cabeça, porém a devolutiva dele vem em blocos, não num único despejo

A consequência prática pro teu fluxo:

  • Planejamento, análise e diagnóstico se beneficiam MUITO da janela cheia
  • Entrega de código costuma precisar vir fatiada em chamadas, arquivo por arquivo ou módulo por módulo
  • Vale pedir a resposta já organizada em partes, em vez de descobrir o corte no meio da geração

E tem as restrições de parâmetro da API, que pegam quem tem script pronto de outro modelo

O GPT-6 Astra não suporta o nível de reasoning effort none, não aceita valores customizados de temperature nem de top_p, e não devolve logprobs

Tome cuidado! Se teu código manda temperature fixo em todo request por padrão, esse é o ponto que vai te dar dor de cabeça na migração

Quanto custa encher a janela de contexto

Agora a parte que dói no bolso

Os preços na API da OpenAI, por 1 milhão de tokens de texto:

Item Preço por 1M de tokens
Input US$ 10,00
Input em cache US$ 1,00
Escrita de cache US$ 12,50
Output US$ 50,00

Repara na diferença entre input normal e input em cache

Em fluxo repetido, onde o mesmo contexto volta várias vezes, o cache é o que separa uma conta saudável de um susto no fim do mês

E tem um degrau importante: prompts acima de 272 mil tokens de entrada são cobrados com multiplicador

Acima de 272K tokens de input, a cobrança vai pra 2x nas taxas de input e de cache e 1,5x no output, e isso vale para a requisição completa, não só pro excedente

Ou seja, passar de 272 mil tokens não é um degrauzinho suave, é um degrau que reprecifica a chamada inteira

Tem ainda o Fast mode, pensado justamente pra prompts de contexto longo acima de 272 mil tokens

Ele é até 2,5x mais rápido que o tier Standard, e custa 2x as taxas aplicáveis

Então a pergunta que fica na tua mão: essa resposta precisa ser rápida a ponto de valer o dobro?

Compaction: como não estourar a janela em fluxos longos

Junto da janela de 1M, o GPT-6 Astra tem suporte nativo a Compaction, e a compaction server-side foi lançada na Responses API

A ideia é resolver o problema clássico de agente que roda por muito tempo: o transcript cresce, cresce, e uma hora não cabe mais

Tem duas formas de usar

Compaction automática na criação da resposta:

Tu define context_management com compact_threshold numa requisição de create da Responses API

Quando a contagem de tokens renderizada cruza o limite, o servidor executa a compaction sozinho, sem precisar de chamada separada a /responses/compact

{
  "model": "gpt-6-astra",
  "input": "...",
  "context_management": {
    "compact_threshold": 400000
  }
}

Compaction explícita pelo endpoint dedicado:

Se tu quer controle na mão, dá pra chamar /responses/compact e gerar o contexto compactado na hora que TU decidir

Detalhe que salva vida: a janela enviada para /responses/compact ainda precisa caber na janela de contexto do modelo

Não adianta deixar estourar e só então lembrar da compaction, beleza?

Depois disso, nas chamadas seguintes tu envia a janela compactada (incluindo o item de compaction) no lugar do transcript completo

E o que é esse item de compaction? Ele é opaco

Ele leva adiante estado e raciocínio anteriores usando menos tokens, e não foi feito para ser interpretado por humanos

Então não tenta ler pra "conferir", ele não é um resumo bonitinho pra tu revisar

Pra quem tem exigência de ZDR, tem uma condição de configuração: a compaction server-side é ZDR-friendly quando tu define store=false nas requisições de create da Responses API

Esse é o tipo de detalhe que passa batido no protótipo e vira problema na hora do compliance

Vale usar a janela de 1M no seu projeto?

Leitura honesta: janela gigante resolve LEITURA, não resolve entrega

O GPT-6 Astra enxerga 1.050.000 tokens de uma vez, mas devolve no máximo 128.000, então o gargalo da entrega continua existindo, só mudou de lugar

E o custo escala junto com a ambição

O degrau dos 272 mil tokens pesa de verdade, porque ele reprecifica a requisição inteira em 2x input e cache e 1,5x output, e o Fast mode dobra por cima do que for aplicável

O próximo passo concreto, na ordem:

  1. Mede o tamanho real do teu contexto antes de mandar tudo: muita gente acha que precisa de 1M e na real vive tranquilo com uma fração disso
  2. Usa cache em fluxo repetido: input em cache custa US$ 1,00 contra US$ 10,00 do input normal, essa diferença é o jogo todo
  3. Liga compaction em fluxo de agente longo: compact_threshold na create resolve automático, e o /responses/compact fica pra quando tu quiser mandar na mão
  4. Acompanha a liberação em fases: começou pelo programa Daybreak, então pode ser que o teu acesso ainda não tenha chegado

Janela de 1.050.000 tokens é massa demais, sem dúvida

Só não confunda "cabe tudo" com "resolve tudo", porque são coisas diferentes 🙂

até o próximo post!

Perguntas frequentes

O GPT-6 Astra está disponível no ChatGPT Plus?

Não. No ChatGPT ele aparece com o nome GPT-6 Pro e está disponível apenas nos planos Pro, Business e Enterprise. Quem tem o plano Plus não tem acesso a ele por enquanto.

GPT-6 Astra e GPT-6 Pro são o mesmo modelo?

Sim, é o mesmo modelo com nomes diferentes por produto. Na API e na documentação da OpenAI ele é chamado de GPT-6 Astra, enquanto no ChatGPT a liberação usa o nome GPT-6 Pro.

Quanto custa um prompt acima de 272 mil tokens no GPT-6 Astra?

Prompts com mais de 272 mil tokens de entrada são cobrados com multiplicador de 2x nas taxas de input e de cache, e 1,5x no output. Esse multiplicador vale para a requisição completa, não só para o trecho que excedeu o limite.

O que é o Fast mode do GPT-6 Astra?

É um modo pensado para prompts de contexto longo acima de 272 mil tokens, com resposta até 2,5x mais rápida que o tier Standard. Em troca, ele custa 2x as taxas aplicáveis, então vale calcular se a velocidade extra compensa o custo.

O GPT-6 Astra aceita ajustar temperature ou reasoning effort none na API?

Não. O modelo não suporta o nível de reasoning effort none, não aceita valores customizados de temperature nem de top_p, e também não devolve logprobs. Quem migra script de outro modelo com esses parâmetros fixos precisa ajustar antes de rodar.

Como habilitar a compaction server-side do GPT-6 Astra na Responses API?

Basta definir context_management com compact_threshold já na requisição de create da Responses API. Quando a contagem de tokens renderizada cruza esse limite, o próprio servidor executa a compaction, sem precisar de uma chamada separada ao endpoint /responses/compact.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares