Ox Alpha vs GLM-5.3, GPT-5.6-sol e Grok 4.6: o modelo anônimo resolveu de primeira a tarefa que zerou os outros três?

Ox Alpha comparado a GLM-5.3, GPT-5.6-sol e Grok 4.6 no benchmark DeepSWE
Resposta rápida

O Ox Alpha é um modelo anônimo publicado no OpenRouter em 20 de agosto de 2026, como preview gratuito de codificação e trabalho agêntico. Na tarefa meriyah-explicit-resource-declarations, do benchmark DeepSWE, ele passou na primeira tentativa enquanto GLM-5.3, GPT-5.6-sol e Grok 4.6 registraram 0/4. Só que ele não tem entrada no placar oficial do DeepSWE v1.1, onde Claude Opus 5 aparece com 74,0% e GPT-5.6 Sol com 72,7%. Os números que circulam sobre o modelo (cerca de 80% num recorte de 10 tarefas e perto de 63% nas 113) vêm de testes independentes, não de medição oficial do provedor do benchmark.

Um modelo que ninguém sabe de quem é passou de primeira numa tarefa em que GLM-5.3, GPT-5.6-sol e Grok 4.6 tiraram ZERO

Fala aí, beleza? O caso é a tarefa meriyah-explicit-resource-declarations, do benchmark DeepSWE, e o protagonista é o Ox Alpha, aquele modelo stealth que apareceu no OpenRouter sem dono declarado

Aqui a gente vai olhar esse resultado com calma: o que ele prova de verdade, o que ele NÃO prova, e se isso deveria mexer na sua escolha de modelo pra código

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 116 aulas
  • 4 projetos
  • 9h 23min

O que é o Ox Alpha, o modelo anônimo que apareceu no OpenRouter

O stealth/ox-alpha foi publicado no OpenRouter em 20 de agosto de 2026, como preview gratuito de um modelo voltado pra codificação e trabalho agêntico

E gratuito aqui é gratuito mesmo: US$ 0 por 1M de tokens de entrada e US$ 0 por 1M de tokens de saída durante o preview

Porém tem o detalhe chato: não foi anunciada data de término e nem preço pós-preview, então tu não sabe quanto vai custar quando a festa acabar

As specs são de brigar em cima:

  • 1.048.576 tokens de janela de contexto
  • até 131.072 tokens de saída
  • aceita texto, imagem e vídeo como entrada, e devolve texto
  • tem function calling e saída JSON estruturada

E ele também está sem custo no OpenCode durante essa janela de preview, o que ajuda quem já vive dentro de um fluxo agêntico

E quem fez? Aí mora a graça 😀

Nenhum laboratório assumiu o modelo até hoje

Análises independentes apontam pra família GLM, da Zhipu AI, mas a empresa não confirmou nem negou publicamente, então trate isso como palpite de terceiro, não como fato

Que tarefa é essa: meriyah, explicit resource declarations e o benchmark DeepSWE

Antes de olhar placar, vale entender o palco

O DeepSWE é um benchmark criado e mantido pela Datacurve

A diferença dele pra boa parte do que tu vê por aí: as tarefas são escritas do zero pelos engenheiros da empresa, não adaptadas de commits ou pull requests já existentes do GitHub

Se você já se perguntou por que um modelo vai bem no benchmark e mal no seu repo, essa distinção importa: tarefa nascida de commit público tem chance de estar no treino, tarefa escrita do zero não tem

O conjunto tem 113 tarefas originais, em 91 repositórios open source ativos, cobrindo 5 linguagens: TypeScript, JavaScript, Python, Rust e Go

E o que é o meriyah?

O meriyah é um parser de JavaScript distribuído no npm

Ele suporta propostas do TC39 em stage 3 pela opção next, e entre elas está justamente o explicit resource management

E as tais explicit resource declarations?

É a proposta Explicit Resource Management do TC39, em stage 3, que introduz as declarações using e await using pra descarte de recursos

O champion da proposta é o Ron Buckton

Ou seja: a tarefa pede que o modelo mexa na gramática de um parser real pra dar conta de uma sintaxe nova da linguagem

Não é CRUD, não é renomear variável

É o tipo de coisa em que um erro sutil quebra tudo silenciosamente, e por isso o resultado chama atenção 🙂

Ox Alpha vs GLM-5.3, GPT-5.6-sol e Grok 4.6: como cada um se saiu

Modelo Tarefa meriyah-explicit-resource-declarations DeepSWE v1.1 (placar oficial, 17/08/2026) Observação
Ox Alpha passou na primeira tentativa sem entrada oficial resultados que circulam vêm de testes independentes da comunidade
GPT-5.6 Sol 0/4 72,7% melhor colocado entre os três que zeraram a tarefa
Grok 4.6 0/4 67,0% placar oficial acima do GLM 5.3
GLM 5.3 0/4 66,9% é a família apontada por análises de terceiros como origem do modelo anônimo, sem confirmação

No mesmo leaderboard, que tem 25 modelos e foi atualizado em 17 de agosto de 2026, o Claude Opus 5 lidera com 74,0% e o Claude Fable 5 aparece com 69,7%

Na execução relatada da tarefa do meriyah, 51.469 testes de regressão passaram sem quebra, o que descarta a hipótese preguiçosa de "passou o teste da tarefa e detonou o resto"

Tome cuidado com a leitura fácil aqui: passar numa tarefa que três modelos zeraram é um sinal forte de capacidade, mas é UMA tarefa entre 113

Por que 80% e 63% saíram do mesmo modelo (e qual número olhar)

Se tu viu os dois números rodando no timeline e achou que alguém errou a conta, calma, os dois existem e medem coisas diferentes

O desenvolvedor Ben Davis rodou o modelo em 10 tarefas do DeepSWE e chegou a cerca de 80% de Pass@1

Agora se liga na matemática: 10 tarefas são menos de 9% do conjunto de 113

Nesse recorte, CADA tarefa mexe o placar em torno de dez pontos percentuais

Uma tarefa a mais ou a menos e o titulão do post muda de cara, e é exatamente por isso que vale entender acertar 8 de 10 tarefas antes de tratar isso como ranking

Do outro lado, uma avaliação independente rodando as 113 tarefas do DeepSWE colocou o ox-alpha perto de 63%, patamar próximo ao do GPT-5.6 Sol

E atenção nesse ponto, porque muita gente confunde: essa medição NÃO é uma correção da rodada do Ben Davis

São duas medições separadas, com recortes diferentes

A leitura prática é simples:

  • recorte pequeno mostra capacidade, ou seja, do que o modelo é capaz quando acerta
  • recorte completo mostra consistência, ou seja, o que tu pode esperar dele no dia a dia

Quando alguém te mostrar só um dos dois, pergunte quantas tarefas rodaram 😀

Quando vale colocar o modelo anônimo pra trabalhar e quando ficar com os do topo

Tarefa isolada e travada: é o cenário em que o caso do meriyah fala mais alto

Se tu tem um bug espinhoso que já queimou várias tentativas com outro modelo, uma passada de primeira vale muito, e o custo zero do preview torna a tentativa barata em dinheiro

Volume diário de tickets: aqui o percentual médio nas 113 tarefas pesa mais que qualquer caso isolado

Nesse terreno os modelos com entrada no placar oficial têm número pra mostrar, e o anônimo não tem

Repositório grande: 1.048.576 tokens de contexto e saída de até 131.072 dão folga pra jogar bastante código na conversa sem picotar tudo

Fluxo agêntico: entrada de texto, imagem e vídeo, mais function calling e JSON estruturado, cobrem o básico de quem monta pipeline com ferramenta chamando ferramenta

Se o que te interessa é tarefa longa com verificação no meio do caminho, dá pra comparar com Grok 4.6 checando o próprio trabalho antes de escolher

E o alerta que não dá pra ignorar: não existe preço pós-preview divulgado, nem laboratório assumindo o modelo

Montar dependência crítica em cima disso é convite pra dor de cabeça…

Vídeo: como usar modelos gratuitos sem gastar com API

Pra quem quer começar do zero rodando modelo gratuito dentro do fluxo de código, este vídeo do canal mostra a configuração completa de um setup 100% grátis

Veredito: o caso do meriyah muda a escolha do seu modelo de código?

Veredito honesto: o resultado é real e é relevante, mas não é promoção de campeão

Passar de primeira numa tarefa em que GLM-5.3, GPT-5.6-sol e Grok 4.6 ficaram em 0/4 é um sinal legítimo de capacidade, ainda mais numa tarefa que mexe em parser de verdade

Só que isso não recoloca ele acima de Claude Opus 5, GPT-5.6 Sol, Claude Fable 5, Grok 4.6 ou GLM 5.3 no único placar oficial disponível

No leaderboard do DeepSWE v1.1 ele simplesmente não aparece, e tudo que circula sobre ele vem de teste de comunidade

Minha posição: candidato a segunda opinião em tarefa travada, enquanto o preview está gratuito

Migrar o fluxo principal por causa de uma tarefa isolada e de medições independentes seria trocar o certo pelo duvidoso

Conclusão

Caso isolado é pista, não é placar

O próximo passo é bem concreto: pega uma tarefa que já travou com o modelo que tu usa hoje, roda ela no Ox Alpha pelo OpenRouter ou pelo OpenCode enquanto o preview segue gratuito, e compara o resultado lado a lado

Se ganhar, tu ganhou uma segunda opinião de graça

Se empatar, tu economizou a migração 🙂

E quando o responsável pelo modelo for revelado ou o preço pós-preview sair, a história continua por aqui

até o próximo post!

Perguntas frequentes

Quem é o responsável pelo modelo Ox Alpha no OpenRouter?

Ninguém assumiu o modelo oficialmente até hoje. Análises independentes apontam pra família GLM, da Zhipu AI, mas a empresa não confirmou nem negou publicamente, então isso segue sendo palpite de terceiro.

Quanto custa usar o Ox Alpha e até quando ele fica gratuito?

Durante o preview, o modelo custa US$ 0 por 1M de tokens de entrada e US$ 0 por 1M de tokens de saída no OpenRouter. Não foi anunciada data de término nem preço pós-preview, então o valor futuro é uma incógnita.

O Ox Alpha aparece no leaderboard oficial do DeepSWE?

Não. Não há entrada de ox-alpha entre os 25 modelos do placar oficial do DeepSWE v1.1, atualizado em 17 de agosto de 2026. Os resultados que circulam, incluindo a tarefa do meriyah, vêm de testes independentes da comunidade.

Por que o modelo aparece com 80% em um teste e 63% em outro no DeepSWE?

São duas medições diferentes, não uma correção. Ben Davis rodou 10 tarefas (menos de 9% do total de 113) e chegou a cerca de 80% de Pass@1, enquanto uma avaliação independente com as 113 tarefas completas colocou o modelo perto de 63%, próximo do GPT-5.6 Sol.

Dá pra usar o Ox Alpha em outro lugar além do OpenRouter?

Sim, ele também está disponível sem custo no OpenCode durante a janela de preview. É uma opção pra quem já trabalha dentro de um fluxo agêntico nessa ferramenta.

Quantos tokens de contexto o Ox Alpha suporta e que tipo de entrada ele aceita?

Ele tem janela de 1.048.576 tokens de contexto e saída de até 131.072 tokens. Aceita texto, imagem e vídeo como entrada, devolve texto, e tem function calling e saída JSON estruturada.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares