Ox Alpha quebra código existente? O que os testes de regressão realmente mostram

O Ox Alpha nos testes de regressão é o dado que mais diz sobre confiabilidade em base madura, e ele não é bem o que circulou por aí. Os 51.469 testes são a contagem pass-to-pass de UMA tarefa do DeepSWE, a meriyah: o modelo passou 51.468 deles e 48 de 49 fail-to-pass, e mesmo assim levou reward 0, porque a nota do benchmark é binária. No run completo das 113 tarefas foram 66 resolvidas, taxa de 58,4%. E os 80% virais saíram de um recorte independente de 10 tarefas, não do leaderboard oficial
O medo de quem solta IA numa base madura não é "será que ela resolve a tarefa?"
É "será que ela quebra o que já estava funcionando?"
Fala aí, beleza? O Ox Alpha apareceu como modelo stealth no OpenRouter em 20 de agosto de 2026, sob o identificador stealth/ox-alpha, e virou assunto numa velocidade absurda
O detalhe é que o provedor por trás dele segue anônimo, nenhum laboratório assumiu o modelo até 24 de agosto de 2026, e mesmo assim os prints de benchmark já estavam rodando em todo lugar
Só que a nota do benchmark é a parte menos útil da conversa pra quem mantém código legado
O que importa mesmo é o indicador de regressão: quantos testes que já passavam continuaram passando depois que o modelo mexeu no repositório
E é aí que a história do Ox Alpha fica muito mais interessante (e bem mais torta) do que o hype vendeu
O que é o DeepSWE e por que 51.469 não é o benchmark inteiro:
Bora desfazer a confusão antes de olhar qualquer número
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
O DeepSWE é um benchmark de engenharia de software de horizonte longo, lançado pela Datacurve em 26 de maio de 2026, com leaderboard público
Horizonte longo? É tarefa que não se resolve numa tacada só: o modelo precisa navegar o repositório, entender o que está acontecendo, editar arquivos e sustentar o raciocínio por muitos passos
A composição dele é o que dá peso ao teste: 113 tarefas originais, em 91 repositórios open source e 5 linguagens, com verificadores escritos à mão e sem soluções copiadas de pull requests públicos
Esse último ponto é ULTRA importante
Verificador escrito à mão significa que alguém sentou e definiu o que é "certo", em vez de deixar o critério nascer do mesmo lugar que a solução
É o mesmo problema de deixar a IA escrever teste e código juntos: quando as duas pontas saem da mesma cabeça, a verificação vira teatro
Fail-to-pass e pass-to-pass: a diferença que muda tudo
Cada tarefa do DeepSWE tem dois grupos de teste, e eles medem coisas opostas
Fail-to-pass é o que está quebrado e a tarefa pede pra consertar
Eles falham antes, e precisam passar depois
Pass-to-pass é o resto da suíte: o que já passava e NÃO pode quebrar
Esse segundo grupo é o teste de regressão propriamente dito
Se você conhece a sensação de rodar a suíte inteira depois de um refactor grande só pra ver se não explodiu nada, é literalmente isso, automatizado e contado
E o famoso 51.469?
Aqui mora o mal-entendido que circulou
51.469 é a contagem de testes pass-to-pass de UMA tarefa específica do DeepSWE, a meriyah-explicit-resource-declarations
Não é o benchmark inteiro, não é a soma de tudo, é uma tarefa só, num projeto com suíte gigante
O resultado publicado nessa tarefa foi 48/49 nos fail-to-pass e 51.468/51.469 nos pass-to-pass
Ou seja: o modelo consertou quase tudo que devia consertar e deixou quase toda a suíte existente de pé
Mas "quase" tem consequência, e já já a gente chega nela
O run completo das 113 tarefas, que está documentado no repositório MatchaOnMuffins/oxalpha, rodou com o harness mini-swe-agent usando a configuração padrão mini.yaml
Guarde esse detalhe: harness padrão vai explicar uma fatia grande das falhas lá na frente
Ox Alpha x Claude Fable 5 x GLM-5.3 x GPT-5.6-sol: o que cada número mede
Tem três recortes diferentes rodando na internet como se fossem a mesma coisa, e eles não são
O primeiro é o recorte independente de 10 tarefas, conduzido pelo desenvolvedor Ben Davis
| Modelo | Pass@1 no recorte de 10 tarefas |
|---|---|
| Ox Alpha | 80% (8 de 10) |
| Claude Fable 5 | 65% |
| GLM-5.3 | 62% |
| GPT-5.6-sol | 52% |
É daí que saiu o número viral de 80%
Não do leaderboard oficial, e sim de um teste independente com dez tarefas
Agora os três recortes lado a lado, que é o que realmente resolve a discussão:
| Recorte | O que ele mede | Resultado do Ox Alpha |
|---|---|---|
| 10 tarefas (teste independente de Ben Davis) | amostra pequena, Pass@1 | 80%, contra 65% do Claude Fable 5, 62% do GLM-5.3 e 52% do GPT-5.6-sol |
| 113 tarefas (run completo, uma tentativa por tarefa) | cobertura total do benchmark | 66 tarefas resolvidas, taxa de 58,4%, run finalizado em 23 de agosto de 2026 |
| Tarefa meriyah isolada | preservação de comportamento numa suíte enorme | 48/49 fail-to-pass e 51.468/51.469 pass-to-pass, com reward 0 |
Repara na terceira linha, porque ela é o coração do post
Com apenas 2 asserções falhando em cerca de 51.500, o Ox Alpha recebeu nota zero naquela tarefa
A pontuação do benchmark é binária: passou tudo ou não passou
Na prática, ele pontuou igual a um modelo que não fez absolutamente nada
E não é que a tarefa fosse fácil pros outros: nessa mesma meriyah, outros modelos de fronteira já tinham falhado por completo, entre eles o GLM-5.3, o GPT-5.6-sol e também o Grok 4.6, que nem aparecia no recorte de 10 tarefas lá de cima
Por fim, o registro honesto: até 24 de agosto de 2026 o Ox Alpha não tem entrada no leaderboard oficial do DeepSWE nem índice no Artificial Analysis
Tudo que existe é teste de terceiro, com harness de terceiro 🙂
Quando esse indicador importa (e quando ele não te salva)
Beleza, e como isso vira decisão prática?
Onde o sinal de regressão pesa muito:
- Refatoração ampla, aquela que toca dezenas de arquivos e depende da suíte inteira pra provar que nada mudou de comportamento
- Migração de API interna, onde o risco não está na mudança em si, e sim no efeito colateral três camadas abaixo
- Base com suíte grande e madura, o cenário exato da meriyah: 51 mil e poucos testes existentes, e o modelo derrubando 2
Tem outro dado do run completo que conta a mesma história: 80% das tarefas, ou seja 90 de 113, passaram ao menos 90% dos seus testes fail-to-pass
Traduzindo: quando ele erra, na maioria das vezes ele erra por pouco, em vez de sair estragando o resto
Esse padrão é bem diferente de um modelo que "resolve" a tarefa arrancando código pelo caminho
Tem também o comportamento em fluxo agêntico longo, que é onde muita coisa desanda: num fluxo documentado, foram 69 chamadas de ferramenta com 1 erro e sem loops de retry
Consistência ao longo de muitas chamadas é o que separa um agente que trabalha de um que fica girando em falso queimando token
Onde o número NÃO te salva:
Primeiro problema, e ele é grande: 9,7% do benchmark foi perdido porque o modelo devolveu resposta sem nenhuma tool call três vezes seguidas, o que aborta o episódio
Isso não é falha de raciocínio
É falha de formato de chamada de ferramenta, e depende diretamente do harness que você usa (lembra do mini.yaml padrão lá de cima?)
Ou seja: parte do resultado ruim pode ser da cola entre modelo e ferramenta, não do modelo pensando errado
Segundo problema, e esse é sobre VOCÊ: teste de regressão só é sinal se existir suíte
Se o seu projeto tem cobertura fraca, ou tem teste que só reafirma o que o código já faz, o modelo pode passar 100% e ter quebrado meio sistema
Por isso vale tanto a pena pedir testes que realmente verificam antes de soltar qualquer modelo pra refatorar
Sem suíte decente, esse indicador todo vira zero informação
Vídeo: a evolução do vibe coding para a IA não quebrar nada
A lógica de "mede o que já passava, não só o que foi consertado" não nasceu com o Ox Alpha, ela é a base de qualquer fluxo sério de IA em código
Pra começar do zero nesse assunto de manter a base de pé enquanto a IA edita, este vídeo do canal mostra a ideia de Loop Engineering aplicada ao vibe coding:
Veredito: confiabilidade em refatoração ou só um número bonito?
Vou de posição honesta, com os dois lados
A favor: preservação de comportamento quase total na tarefa medida, e falha por margem estreita na maior parte do benchmark
Esse é exatamente o padrão que interessa em base legada: eu prefiro um modelo que erra 2 asserções em 51 mil a um que "acerta a tarefa" e me devolve um efeito colateral escondido
Contra: a taxa real do run completo foi 58,4%, ou seja, bem longe dos 80% que viralizaram num recorte de apenas dez tarefas
Soma nisso os 9,7% do benchmark perdidos por falha de formato de chamada de ferramenta e a ausência de entrada oficial em qualquer leaderboard de referência
E a nota binária esconde a nuance nos DOIS sentidos: ela enterra o quase-acerto, mas também esconderia um acerto sortudo, e nenhum dos dois casos aparece na tabela do leaderboard
É indício, não é aprovação
E tem os riscos operacionais, que pesam bastante na decisão de usar hoje:
- Provedor anônimo: o modelo é desenvolvido e operado por um terceiro que optou por permanecer anônimo durante o preview
- Hipótese da comunidade: apontam a Zhipu AI (Z.ai) por pistas da camada de serviço, stack trace Java, código de erro 1214 idêntico e 30/30 correspondências de tokenizer com o GLM-5.3, mas a Zhipu não confirmou nem negou
- Política de dados: a página do modelo diz que prompts e respostas são retidos pelo provedor e não são usados para treino, com o restante do uso seguindo os Stealth Model Terms
- Preço: US$ 0,00 por milhão de tokens de entrada e US$ 0,00 por milhão de tokens de saída durante o preview, com a gratuidade anunciada como temporária (a nota de lançamento do OpenCode falava em cerca de uma semana a partir de 20 de agosto de 2026, sem data exata de corte)
Um fator prático que joga a favor em refatoração ampla: 1.048.576 tokens de contexto e até 131.072 tokens de saída
Isso é espaço pra colocar módulo inteiro na mesa em vez de fatiar o problema até ele perder o sentido
Mas contexto grande não é garantia de nada sozinho, é só a condição pra tentar
Conclusão
O indicador de regressão diz mais sobre confiabilidade do que qualquer nota isolada, e a lição do 51.469 é justamente essa: o mesmo run que mostra 51.468 testes de pé recebeu reward 0
O benchmark não tem como te contar isso, mas o seu repositório tem
Então o próximo passo é simples: use a sua própria base como benchmark
Meça a taxa de testes que já passavam e continuaram passando depois da edição do modelo, e trate nota de benchmark como indício, nunca como aprovação
Enquanto o preview estiver gratuito, o custo do experimento é baixo, e isso é raro
Só não conte com a janela: ela foi anunciada como temporária, e ninguém divulgou data exata de corte…
até o próximo post! 😀
Perguntas frequentes
Quem está por trás do Ox Alpha?
Ninguém confirmou oficialmente até 24 de agosto de 2026. O modelo foi desenvolvido e é operado por um terceiro anônimo, dentro do preview stealth do OpenRouter. A hipótese mais forte da comunidade aponta pra Zhipu AI (Z.ai), por pistas da camada de serviço: stack trace em Java, código de erro 1214 idêntico e 30/30 correspondências de tokenizer com o GLM-5.3, mas a própria Zhipu não confirmou nem negou.
Quanto custa usar o Ox Alpha no OpenRouter?
Durante o preview, US$ 0,00 por milhão de tokens de entrada e US$ 0,00 por milhão de tokens de saída. Ou seja, uso gratuito enquanto durar a janela stealth.
O Ox Alpha vai continuar gratuito no OpenRouter?
A gratuidade foi anunciada como temporária, sem data exata de corte. A nota de lançamento do OpenCode falava em cerca de uma semana a partir de 20 de agosto de 2026, mas nenhuma rota anunciou quando isso encerra de fato.
Qual é a janela de contexto e o limite de saída do Ox Alpha?
O modelo suporta 1.048.576 tokens de contexto e até 131.072 tokens de saída. É uma janela bem ampla, na faixa dos modelos de fronteira atuais.
Por que o Ox Alpha perdeu quase 10% do benchmark DeepSWE por um motivo que não é raciocínio?
Porque 9,7% do benchmark foi perdido por falha de formato: o modelo devolveu resposta sem nenhuma tool call três vezes seguidas, o que aborta o episódio no harness. Isso não tem relação com a qualidade do código gerado, é um problema de protocolo de chamada de ferramenta no mini-swe-agent com a configuração padrão mini.yaml.
O Ox Alpha já aparece em leaderboards oficiais de benchmark?
Não. Até 24 de agosto de 2026 ele não tem entrada no leaderboard oficial do DeepSWE nem índice no Artificial Analysis. Tudo que circula até agora é teste de terceiro, com harness de terceiro.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Ox Alpha é confiável para agentes? O que uma sessão com 69 chamadas de ferramentas mostra
Ox Alpha é confiável para agentes de IA? Uma sessão real com 69 chamadas de ferramentas, 1 erro e zero loops mostra o que esperar desse modelo stealth grátis.
Ox Alpha vs GLM-5.3, GPT-5.6-sol e Grok 4.6: o modelo anônimo resolveu de primeira a tarefa que zerou os outros três?
O Ox Alpha, modelo anônimo do OpenRouter, resolveu de primeira uma tarefa do DeepSWE que zerou GLM-5.3, GPT-5.6-sol e Grok 4.6. Veja os números.
Saída de 131.072 tokens do Ox Alpha: quando o limite de resposta longa faz diferença?
O Ox Alpha gera até 131.072 tokens de saída por resposta, contra 1.048.576 de contexto. Veja como identificar corte de texto pelo finish_reason.
