GPT-5.6-Cyber ou GPT-5.5-Cyber: o que muda e quando vale migrar?

Resposta rápida

O GPT-5.6-Cyber é o modelo de cibersegurança que a OpenAI anunciou em 10 de agosto de 2026, construído sobre o GPT-5.6 Sol e liberado só via aprovação no Daybreak Red. Na avaliação interna Advanced Cybersecurity Completion Rate ele completa 95,0% dos pedidos avançados, contra 57,3% do GPT-5.5-Cyber e 1,5% do GPT-5.6 Sol. No ExploitGym a OpenAI afirma superioridade sobre as duas gerações, mas não divulgou o número. A API custa US$ 12,50 por milhão de tokens de entrada e US$ 75 na saída, contra US$ 5 e US$ 30 do Sol

57,3% para 95,0% na mesma avaliação, entre duas gerações do mesmo modelo

Fala aí, beleza? Esse é o salto que a OpenAI reportou na Advanced Cybersecurity Completion Rate ao anunciar o GPT-5.6-Cyber, em 10 de agosto de 2026, na publicação Expanding Daybreak as the Cyber Defense Window Narrows, junto com a expansão do programa Daybreak

E aí vem a pergunta chata que todo mundo devia fazer: isso é o modelo ficando mais capaz, ou só mais disposto a responder? 🙂

Neste post eu coloco as duas gerações lado a lado, número a número, explico o que cada avaliação mede de verdade e fecho com um veredito de quando migrar compensa (e quando é só gasto a mais)

Bora?

GPT-5.6-Cyber x GPT-5.5-Cyber: comparação lado a lado

Item GPT-5.6-Cyber GPT-5.5-Cyber
Modelo-base construído sobre o GPT-5.6 Sol variante ajustada do GPT-5.5
Advanced Cybersecurity Completion Rate 95,0% 57,3%
ExploitGym superior ao GPT-5.6 Sol e ao GPT-5.5-Cyber, número não divulgado 39,5% (contra 25,95% do GPT-5.5 padrão)
CyberGym não divulgado 85,6% (contra 81,8% do GPT-5.5 padrão)
SEC-bench Pro não divulgado 69,8% (contra 63,1% do GPT-5.5 padrão)
Preço de API, entrada US$ 12,50 por milhão de tokens não divulgado
Preço de API, saída US$ 75 por milhão de tokens não divulgado
Entrada em cache US$ 1,25 por milhão de tokens não divulgado
Acesso aprovação e provisionamento no Daybreak Red não confirmado após o lançamento da geração nova

Repara numa coisa antes de comemorar: quase toda linha de "não divulgado" está do lado do modelo NOVO

O retrato completo de benchmark que existe hoje é o da geração anterior, e é com ele que a gente consegue dimensionar o resto

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

O que a Advanced Cybersecurity Completion Rate mede (e o que ela não mede)

Antes do como, o porquê: essa avaliação é INTERNA da OpenAI, e ela mede com que frequência o modelo responde a pedidos envolvendo desenvolvimento de cadeias de exploit, bypass de autenticação e escalada de privilégio

Ou seja, não é benchmark público de capacidade

É menos "o modelo sabe fazer" e mais "o modelo aceita fazer"

Se você conhece aquele perito que domina o assunto mas trava no compliance a cada pergunta, é bem essa a régua sendo medida aqui

E o contraste com o modelo de uso geral deixa isso escancarado: na mesma avaliação, o GPT-5.6 Sol completa 1,5% dos pedidos, e 2,0% quando usado com acesso Daybreak Blue

Um modelo generalista forte, o mesmo que aparece na comparação com o Claude Opus 5 programando, simplesmente não entra nesse tipo de tarefa

Então o pulo de 57,3% para 95,0% fala de disposição em responder, não necessariamente de habilidade bruta

Guarda essa distinção, ela é o coração do veredito lá embaixo

ExploitGym, CyberGym e SEC-bench Pro: onde o ganho aparece de fato

Agora sim, capacidade

O ExploitGym avalia se o agente transforma vulnerabilidades conhecidas em exploits funcionais, com execução arbitrária de código em ambiente controlado

Já o CyberGym mede se o agente consegue reproduzir vulnerabilidades conhecidas em ambientes de software

São coisas diferentes: uma é "eu reproduzo o problema", a outra é "eu viro o problema em arma"

E o que o ajuste de cibersegurança rendeu sobre o modelo padrão na geração passada foi isso:

  • ExploitGym: 39,5% do GPT-5.5-Cyber contra 25,95% do GPT-5.5 padrão
  • CyberGym: 85,6% contra 81,8%
  • SEC-bench Pro: 69,8% contra 63,1%

Ganho real, porém longe de ser um abismo, principalmente no CyberGym

E para o GPT-5.6-Cyber? A OpenAI afirma que ele supera tanto o GPT-5.6 Sol quanto o GPT-5.5-Cyber no ExploitGym, mas não divulgou o percentual

Tome cuidado com manchete aqui: sem número, "supera" pode ser meio ponto ou pode ser vinte, e chutar isso seria inventar

O que existe de evidência em código real vem por outro caminho: a OpenAI afirma que o modelo encontrou duas vulnerabilidades inéditas no V8, o motor JavaScript do Chrome, que poderiam ser encadeadas para corromper memória e escapar do heap sandbox, reportadas ao Google por divulgação coordenada

No registro público dá para ver o tipo de coisa que sai desse trabalho: a CVE-2026-15903 é uma leitura e escrita fora dos limites no V8, reportada pela OpenAI Codex Security em 06/07/2026 e corrigida na atualização 150.0.7871.128 do Chrome

Repara que o crédito da CVE é da OpenAI Codex Security, não de um modelo específico

Acesso e preço: por que o GPT-5.6-Cyber não aparece na sua conta

Aqui mora a parte que quase ninguém conta direito

O Daybreak passou a ter dois níveis de acesso:

  • Daybreak Blue: modelos de uso geral com salvaguardas ajustadas para trabalho defensivo
  • Daybreak Red: modelos especializados em cibersegurança, incluindo o GPT-5.6-Cyber

E o GPT-5.6-Cyber não é liberado para todo cliente de ChatGPT ou da API: exige aprovação e provisionamento separados pelo programa Daybreak

O Daybreak Red está disponível para clientes aprovados, com parceiros iniciais incluindo Accenture, IBM, CrowdStrike e Cloudflare

Olhando essa lista, dá pra sentir o perfil de quem entra primeiro, né?

Agora o bolso

Modelo Entrada (por milhão de tokens) Saída (por milhão de tokens) Entrada em cache
GPT-5.6-Cyber US$ 12,50 US$ 75 US$ 1,25
GPT-5.6 Sol (contexto curto) US$ 5 US$ 30 não listado nesta comparação

E tem a pegadinha do contexto gigante: prompts acima de 272 mil tokens de entrada são cobrados com multiplicador de 2x na entrada e 1,5x na saída da requisição INTEIRA

Quem joga um repositório inteiro no prompt já sabe onde isso dói

Quando cada modelo faz sentido no dia a dia de segurança

Três cenários bem concretos, se liga

1. Você esbarrava em recusa o tempo todo no 5.5-Cyber

Essa é literalmente a motivação declarada da geração nova: o GPT-5.6-Cyber completa mais pedidos respondendo a relatos de pesquisadores de segurança que esbarravam em recusas persistentes no modelo anterior

Se metade do seu dia era reescrever prompt pra convencer o modelo de que o trabalho é autorizado, o ganho aqui é direto

2. Você desenvolve cadeias de exploit e caça zero-day

O GPT-5.6-Cyber é treinado para tarefas especializadas como encontrar zero-days e desenvolver cadeias de exploit, e é justamente o tipo de tarefa medida no ExploitGym

Aqui o modelo especializado é o caminho, mesmo sem o número público da geração nova

3. Você faz trabalho defensivo mais leve

Se o seu uso é análise, revisão e apoio defensivo, o Daybreak Blue existe pra isso: modelos de uso geral com salvaguardas ajustadas para trabalho defensivo

Pagar o preço do especializado nesse cenário é gastar em capacidade que você não vai usar

Vale migrar para o GPT-5.6-Cyber?

Veredito honesto, sem enfeite

O que está medido e é grande: a taxa de conclusão saltou de 57,3% para 95,0%

O que NÃO está medido em público: quanto o modelo novo ganhou de capacidade no ExploitGym, já que só temos a afirmação de superioridade

Ou seja, a migração se justifica principalmente para quem perdia tempo com recusa em tarefa autorizada, e não para quem espera um pulo garantido de habilidade

Pesa contra: a entrada do especializado custa US$ 12,50 por milhão de tokens contra US$ 5 do GPT-5.6 Sol, e o gargalo real nem é dinheiro, é a aprovação no Daybreak Red

Não compensa correr atrás se a sua equipe faz trabalho defensivo de rotina, se você não tem processo pra justificar o vetting, ou se a expectativa é usar isso como "ChatGPT com menos filtro": não é esse o produto, e quem acompanha as mudanças de geração do ChatGPT já percebeu que modelo especializado e modelo de consumo seguem trilhos bem diferentes

Conclusão

Resumo da ópera: o GPT-5.6-Cyber recusa muito menos (95,0% contra 57,3% do GPT-5.5-Cyber na Advanced Cybersecurity Completion Rate), custa mais caro na API e só chega até você por aprovação no Daybreak Red

E o outro lado da comparação entre as gerações continua em aberto: no ExploitGym a OpenAI só afirma que o modelo novo supera o GPT-5.5-Cyber e o GPT-5.6 Sol, sem divulgar o percentual dele

Ou seja, a redução de recusa tem número, o ganho de capacidade não tem

O próximo passo concreto é chato, mas é o certo: antes de planejar orçamento, checar se a sua organização se qualifica para o Daybreak Red

Sem isso, discutir preço por token é conversa fiada 😀

E vale acompanhar a publicação da OpenAI pelos números do ExploitGym que ainda não saíram, porque é ali que a comparação vai ficar completa de verdade…

até o próximo post!

Perguntas frequentes

O GPT-5.6-Cyber já está disponível pra qualquer desenvolvedor usar na API?

Não. Ele exige aprovação e provisionamento separados pelo programa Daybreak, dentro do nível Daybreak Red. Parceiros iniciais aprovados incluem Accenture, IBM, CrowdStrike e Cloudflare.

Qual a diferença entre Daybreak Blue e Daybreak Red?

Daybreak Blue dá acesso a modelos de uso geral com salvaguardas ajustadas para trabalho defensivo. Daybreak Red é o nível com modelos especializados em cibersegurança, incluindo o GPT-5.6-Cyber.

Quanto custa usar o GPT-5.6-Cyber pela API?

US$ 12,50 por milhão de tokens de entrada, US$ 75 por milhão de tokens de saída e US$ 1,25 por milhão de tokens de entrada em cache. Em prompts acima de 272 mil tokens de entrada, esses valores sobem com multiplicador de 2x na entrada e 1,5x na saída da requisição inteira.

O salto na Advanced Cybersecurity Completion Rate significa que o GPT-5.6-Cyber é mais capaz tecnicamente?

Não necessariamente. Essa avaliação é interna da OpenAI e mede com que frequência o modelo responde a pedidos de cadeias de exploit, bypass de autenticação e escalada de privilégio, ou seja, disposição em responder, não benchmark público de capacidade. A própria OpenAI liga o salto de 57,3% para 95,0% à redução de recusas que pesquisadores relatavam no GPT-5.5-Cyber.

O que é a CVE-2026-15903 que o modelo ajudou a encontrar?

É uma falha de leitura e escrita fora dos limites no V8, o motor JavaScript do Chrome, reportada pela OpenAI Codex Security em 06/07/2026. Foi corrigida na atualização 150.0.7871.128 do Chrome, e o crédito público é da OpenAI Codex Security, não de um modelo específico.

O GPT-5.6-Cyber tem números divulgados no ExploitGym, CyberGym e SEC-bench Pro?

A OpenAI afirma que ele supera tanto o GPT-5.6 Sol quanto o GPT-5.5-Cyber no ExploitGym, mas não divulgou o percentual. Os números públicos que existem hoje nesses três benchmarks são da geração anterior, o GPT-5.5-Cyber.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares