GPT-5.6-Cyber ou GPT-5.5-Cyber: o que muda e quando vale migrar?
O GPT-5.6-Cyber é o modelo de cibersegurança que a OpenAI anunciou em 10 de agosto de 2026, construído sobre o GPT-5.6 Sol e liberado só via aprovação no Daybreak Red. Na avaliação interna Advanced Cybersecurity Completion Rate ele completa 95,0% dos pedidos avançados, contra 57,3% do GPT-5.5-Cyber e 1,5% do GPT-5.6 Sol. No ExploitGym a OpenAI afirma superioridade sobre as duas gerações, mas não divulgou o número. A API custa US$ 12,50 por milhão de tokens de entrada e US$ 75 na saída, contra US$ 5 e US$ 30 do Sol
57,3% para 95,0% na mesma avaliação, entre duas gerações do mesmo modelo
Fala aí, beleza? Esse é o salto que a OpenAI reportou na Advanced Cybersecurity Completion Rate ao anunciar o GPT-5.6-Cyber, em 10 de agosto de 2026, na publicação Expanding Daybreak as the Cyber Defense Window Narrows, junto com a expansão do programa Daybreak
E aí vem a pergunta chata que todo mundo devia fazer: isso é o modelo ficando mais capaz, ou só mais disposto a responder? 🙂
Neste post eu coloco as duas gerações lado a lado, número a número, explico o que cada avaliação mede de verdade e fecho com um veredito de quando migrar compensa (e quando é só gasto a mais)
Bora?
GPT-5.6-Cyber x GPT-5.5-Cyber: comparação lado a lado
| Item | GPT-5.6-Cyber | GPT-5.5-Cyber |
|---|---|---|
| Modelo-base | construído sobre o GPT-5.6 Sol | variante ajustada do GPT-5.5 |
| Advanced Cybersecurity Completion Rate | 95,0% | 57,3% |
| ExploitGym | superior ao GPT-5.6 Sol e ao GPT-5.5-Cyber, número não divulgado | 39,5% (contra 25,95% do GPT-5.5 padrão) |
| CyberGym | não divulgado | 85,6% (contra 81,8% do GPT-5.5 padrão) |
| SEC-bench Pro | não divulgado | 69,8% (contra 63,1% do GPT-5.5 padrão) |
| Preço de API, entrada | US$ 12,50 por milhão de tokens | não divulgado |
| Preço de API, saída | US$ 75 por milhão de tokens | não divulgado |
| Entrada em cache | US$ 1,25 por milhão de tokens | não divulgado |
| Acesso | aprovação e provisionamento no Daybreak Red | não confirmado após o lançamento da geração nova |
Repara numa coisa antes de comemorar: quase toda linha de "não divulgado" está do lado do modelo NOVO
O retrato completo de benchmark que existe hoje é o da geração anterior, e é com ele que a gente consegue dimensionar o resto
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
O que a Advanced Cybersecurity Completion Rate mede (e o que ela não mede)
Antes do como, o porquê: essa avaliação é INTERNA da OpenAI, e ela mede com que frequência o modelo responde a pedidos envolvendo desenvolvimento de cadeias de exploit, bypass de autenticação e escalada de privilégio
Ou seja, não é benchmark público de capacidade
É menos "o modelo sabe fazer" e mais "o modelo aceita fazer"
Se você conhece aquele perito que domina o assunto mas trava no compliance a cada pergunta, é bem essa a régua sendo medida aqui
E o contraste com o modelo de uso geral deixa isso escancarado: na mesma avaliação, o GPT-5.6 Sol completa 1,5% dos pedidos, e 2,0% quando usado com acesso Daybreak Blue
Um modelo generalista forte, o mesmo que aparece na comparação com o Claude Opus 5 programando, simplesmente não entra nesse tipo de tarefa
Então o pulo de 57,3% para 95,0% fala de disposição em responder, não necessariamente de habilidade bruta
Guarda essa distinção, ela é o coração do veredito lá embaixo
ExploitGym, CyberGym e SEC-bench Pro: onde o ganho aparece de fato
Agora sim, capacidade
O ExploitGym avalia se o agente transforma vulnerabilidades conhecidas em exploits funcionais, com execução arbitrária de código em ambiente controlado
Já o CyberGym mede se o agente consegue reproduzir vulnerabilidades conhecidas em ambientes de software
São coisas diferentes: uma é "eu reproduzo o problema", a outra é "eu viro o problema em arma"
E o que o ajuste de cibersegurança rendeu sobre o modelo padrão na geração passada foi isso:
- ExploitGym: 39,5% do GPT-5.5-Cyber contra 25,95% do GPT-5.5 padrão
- CyberGym: 85,6% contra 81,8%
- SEC-bench Pro: 69,8% contra 63,1%
Ganho real, porém longe de ser um abismo, principalmente no CyberGym
E para o GPT-5.6-Cyber? A OpenAI afirma que ele supera tanto o GPT-5.6 Sol quanto o GPT-5.5-Cyber no ExploitGym, mas não divulgou o percentual
Tome cuidado com manchete aqui: sem número, "supera" pode ser meio ponto ou pode ser vinte, e chutar isso seria inventar
O que existe de evidência em código real vem por outro caminho: a OpenAI afirma que o modelo encontrou duas vulnerabilidades inéditas no V8, o motor JavaScript do Chrome, que poderiam ser encadeadas para corromper memória e escapar do heap sandbox, reportadas ao Google por divulgação coordenada
No registro público dá para ver o tipo de coisa que sai desse trabalho: a CVE-2026-15903 é uma leitura e escrita fora dos limites no V8, reportada pela OpenAI Codex Security em 06/07/2026 e corrigida na atualização 150.0.7871.128 do Chrome
Repara que o crédito da CVE é da OpenAI Codex Security, não de um modelo específico
Acesso e preço: por que o GPT-5.6-Cyber não aparece na sua conta
Aqui mora a parte que quase ninguém conta direito
O Daybreak passou a ter dois níveis de acesso:
- Daybreak Blue: modelos de uso geral com salvaguardas ajustadas para trabalho defensivo
- Daybreak Red: modelos especializados em cibersegurança, incluindo o GPT-5.6-Cyber
E o GPT-5.6-Cyber não é liberado para todo cliente de ChatGPT ou da API: exige aprovação e provisionamento separados pelo programa Daybreak
O Daybreak Red está disponível para clientes aprovados, com parceiros iniciais incluindo Accenture, IBM, CrowdStrike e Cloudflare
Olhando essa lista, dá pra sentir o perfil de quem entra primeiro, né?
Agora o bolso
| Modelo | Entrada (por milhão de tokens) | Saída (por milhão de tokens) | Entrada em cache |
|---|---|---|---|
| GPT-5.6-Cyber | US$ 12,50 | US$ 75 | US$ 1,25 |
| GPT-5.6 Sol (contexto curto) | US$ 5 | US$ 30 | não listado nesta comparação |
E tem a pegadinha do contexto gigante: prompts acima de 272 mil tokens de entrada são cobrados com multiplicador de 2x na entrada e 1,5x na saída da requisição INTEIRA
Quem joga um repositório inteiro no prompt já sabe onde isso dói
Quando cada modelo faz sentido no dia a dia de segurança
Três cenários bem concretos, se liga
1. Você esbarrava em recusa o tempo todo no 5.5-Cyber
Essa é literalmente a motivação declarada da geração nova: o GPT-5.6-Cyber completa mais pedidos respondendo a relatos de pesquisadores de segurança que esbarravam em recusas persistentes no modelo anterior
Se metade do seu dia era reescrever prompt pra convencer o modelo de que o trabalho é autorizado, o ganho aqui é direto
2. Você desenvolve cadeias de exploit e caça zero-day
O GPT-5.6-Cyber é treinado para tarefas especializadas como encontrar zero-days e desenvolver cadeias de exploit, e é justamente o tipo de tarefa medida no ExploitGym
Aqui o modelo especializado é o caminho, mesmo sem o número público da geração nova
3. Você faz trabalho defensivo mais leve
Se o seu uso é análise, revisão e apoio defensivo, o Daybreak Blue existe pra isso: modelos de uso geral com salvaguardas ajustadas para trabalho defensivo
Pagar o preço do especializado nesse cenário é gastar em capacidade que você não vai usar
Vale migrar para o GPT-5.6-Cyber?
Veredito honesto, sem enfeite
O que está medido e é grande: a taxa de conclusão saltou de 57,3% para 95,0%
O que NÃO está medido em público: quanto o modelo novo ganhou de capacidade no ExploitGym, já que só temos a afirmação de superioridade
Ou seja, a migração se justifica principalmente para quem perdia tempo com recusa em tarefa autorizada, e não para quem espera um pulo garantido de habilidade
Pesa contra: a entrada do especializado custa US$ 12,50 por milhão de tokens contra US$ 5 do GPT-5.6 Sol, e o gargalo real nem é dinheiro, é a aprovação no Daybreak Red
Não compensa correr atrás se a sua equipe faz trabalho defensivo de rotina, se você não tem processo pra justificar o vetting, ou se a expectativa é usar isso como "ChatGPT com menos filtro": não é esse o produto, e quem acompanha as mudanças de geração do ChatGPT já percebeu que modelo especializado e modelo de consumo seguem trilhos bem diferentes
Conclusão
Resumo da ópera: o GPT-5.6-Cyber recusa muito menos (95,0% contra 57,3% do GPT-5.5-Cyber na Advanced Cybersecurity Completion Rate), custa mais caro na API e só chega até você por aprovação no Daybreak Red
E o outro lado da comparação entre as gerações continua em aberto: no ExploitGym a OpenAI só afirma que o modelo novo supera o GPT-5.5-Cyber e o GPT-5.6 Sol, sem divulgar o percentual dele
Ou seja, a redução de recusa tem número, o ganho de capacidade não tem
O próximo passo concreto é chato, mas é o certo: antes de planejar orçamento, checar se a sua organização se qualifica para o Daybreak Red
Sem isso, discutir preço por token é conversa fiada 😀
E vale acompanhar a publicação da OpenAI pelos números do ExploitGym que ainda não saíram, porque é ali que a comparação vai ficar completa de verdade…
até o próximo post!
Perguntas frequentes
O GPT-5.6-Cyber já está disponível pra qualquer desenvolvedor usar na API?
Não. Ele exige aprovação e provisionamento separados pelo programa Daybreak, dentro do nível Daybreak Red. Parceiros iniciais aprovados incluem Accenture, IBM, CrowdStrike e Cloudflare.
Qual a diferença entre Daybreak Blue e Daybreak Red?
Daybreak Blue dá acesso a modelos de uso geral com salvaguardas ajustadas para trabalho defensivo. Daybreak Red é o nível com modelos especializados em cibersegurança, incluindo o GPT-5.6-Cyber.
Quanto custa usar o GPT-5.6-Cyber pela API?
US$ 12,50 por milhão de tokens de entrada, US$ 75 por milhão de tokens de saída e US$ 1,25 por milhão de tokens de entrada em cache. Em prompts acima de 272 mil tokens de entrada, esses valores sobem com multiplicador de 2x na entrada e 1,5x na saída da requisição inteira.
O salto na Advanced Cybersecurity Completion Rate significa que o GPT-5.6-Cyber é mais capaz tecnicamente?
Não necessariamente. Essa avaliação é interna da OpenAI e mede com que frequência o modelo responde a pedidos de cadeias de exploit, bypass de autenticação e escalada de privilégio, ou seja, disposição em responder, não benchmark público de capacidade. A própria OpenAI liga o salto de 57,3% para 95,0% à redução de recusas que pesquisadores relatavam no GPT-5.5-Cyber.
O que é a CVE-2026-15903 que o modelo ajudou a encontrar?
É uma falha de leitura e escrita fora dos limites no V8, o motor JavaScript do Chrome, reportada pela OpenAI Codex Security em 06/07/2026. Foi corrigida na atualização 150.0.7871.128 do Chrome, e o crédito público é da OpenAI Codex Security, não de um modelo específico.
O GPT-5.6-Cyber tem números divulgados no ExploitGym, CyberGym e SEC-bench Pro?
A OpenAI afirma que ele supera tanto o GPT-5.6 Sol quanto o GPT-5.5-Cyber no ExploitGym, mas não divulgou o percentual. Os números públicos que existem hoje nesses três benchmarks são da geração anterior, o GPT-5.5-Cyber.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

Como Recuperar Conversas Apagadas no ChatGPT: É Possível?
Descubra neste artigo tudo o que você precisa saber sobre como recuperar conversas apagadas no ChatGPT, se isso é possível, quais alternativas existem para proteger […]
ChatGPT não funciona: saiba como corrigir erros
ChatGPT não funciona? O ChatGPT pode deixar de funcionar por diversos motivos, e a maioria deles está relacionada a problemas de conexão, cache ou instabilidade […]

Como limpar histórico do ChatGPT e proteger sua privacidade
Veja como limpar o histórico do ChatGPT e proteger sua privacidade de forma simples e eficaz, mantendo seus dados seguros online. Para apagar uma conversa […]
