Ox Alpha é confiável para agentes? O que uma sessão com 69 chamadas de ferramentas mostra

O Ox Alpha é um modelo stealth que apareceu em 20 de agosto de 2026 no OpenRouter e no OpenCode, sob o ID stealth/ox-alpha, operado por um provedor anônimo durante o preview. Tem 1.048.576 tokens de contexto, até 131.072 de saída, aceita texto, imagem e vídeo, faz tool calling e saída estruturada em JSON, e está a US$ 0 por 1M de tokens enquanto o preview durar. O sinal agentic vem de uma sessão documentada por terceiros: 69 chamadas de ferramenta, 1 erro e nenhum loop de retry. Bom indício, amostra única, sem auditoria independente
Fala aí, beleza? Um modelo pode ir bem no benchmark e mesmo assim destroçar o teu agente na terceira hora de execução
O que quebra automação de verdade não é a resposta única, é a cadeia longa: dez, trinta, setenta chamadas de ferramenta em sequência, cada errinho virando retry, cada retry virando token queimado e contexto sujo
O Ox Alpha apareceu em 20 de agosto de 2026 no OpenRouter e no OpenCode, sob o ID stealth/ox-alpha, sem fabricante identificado
E o que colocou ele na conversa de quem monta agente foi uma sessão agentic documentada com 69 chamadas de ferramenta, 1 erro e nenhum loop de retry
Bora destrinchar o que esse número significa (e o que ele NÃO significa)?
O que é o Ox Alpha e por que ninguém sabe quem o fez
Ele é um modelo stealth: está listado publicamente, dá pra chamar, mas o fabricante não assinou embaixo
A própria página do modelo no OpenRouter descreve ele como "developed and operated by a third-party provider who has chosen to remain anonymous during this preview"
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 116 aulas
- 4 projetos
- 9h 23min
A ficha técnica é esta:
| Item | Ox Alpha |
|---|---|
| ID do modelo | stealth/ox-alpha |
| Aparição pública | 20 de agosto de 2026, no OpenRouter e no OpenCode |
| Contexto | 1.048.576 tokens |
| Saída máxima | 131.072 tokens |
| Entradas | texto, imagem e vídeo |
| Saída | texto |
| Recursos de agente | tool calling (tools e tool_choice) e saída estruturada em JSON |
| Preço no preview | US$ 0 por 1M de tokens de prompt e US$ 0 por 1M de completion |
Repara que a listagem não vende ele como modelo de chat genérico
A descrição de propósito é bem específica: modelo de raciocínio voltado a programação, trabalho agentic sustentado e cargas de produção
"Agentic sustentado" é justamente o assunto deste post 🙂
Sobre as modalidades, vale saber exatamente o que entra e o que não entra antes de desenhar teu pipeline, e eu já detalhei as entradas suportadas pelo modelo em outro post
E quem fez, afinal?
Até 24 de agosto de 2026, nenhum laboratório assumiu o modelo
O fingerprinting da comunidade aponta pra família GLM da Zhipu AI, mas isso é indício forense, não confirmação oficial
Sem model card do fabricante, sem anúncio, sem nada
Tome cuidado com quem já está afirmando autoria por aí: é chute com cara de notícia
O que uma sessão com 69 chamadas de ferramentas realmente mostra
Aqui está o dado que fez o modelo circular entre quem monta agente: um fluxo de agente documentado com 69 chamadas de ferramenta, apenas 1 erro, nenhum loop de retry e overhead de inferência relativamente baixo
Antes do "uau", o porquê de isso importar
Em orquestração longa, o inimigo não é a chamada errada isolada, é o efeito cascata
O modelo erra o formato de uma tool call, o harness devolve erro, o modelo tenta de novo, erra parecido, tenta de novo
Aí tu tem três coisas acontecendo ao mesmo tempo:
- Custo: cada retry recarrega contexto e paga token de novo
- Latência: a tarefa que era de 3 minutos vira de 20
- Contexto sujo: a janela enche de mensagem de erro e o modelo passa a raciocinar em cima do próprio lixo
É por isso que um agente com bom raciocínio e péssima disciplina de formato sai MUITO mais caro que um modelo mediano e obediente
O dev que já viu fatura de API depois de um loop de retry noturno sabe do que eu tô falando kkk
O que os três números dizem
69 chamadas significa cadeia longa de verdade, não demo de duas ferramentas
1 erro significa que a taxa de falha não virou bola de neve dentro da mesma sessão
Nenhum loop de retry é o número mais interessante dos três: quer dizer que o erro que apareceu foi absorvido e o fluxo seguiu, em vez de o modelo ficar batendo na mesma parede
Agora o freio de mão
Isso é uma sessão documentada por terceiros, não auditoria
Não dá pra saber qual harness rodou, qual tarefa era, nem qual conjunto de ferramentas estava exposto, porque o log original não foi publicado junto
E amostra única não vira garantia, nunca
Uma sessão limpa prova que o modelo é CAPAZ de segurar uma cadeia longa, não que ele SEMPRE segura
Trate como sinal, não como certificado
Os 80% do DeepSWE que viraram 63%: o que aconteceu
Esse é o ponto onde muita gente vai repetir número errado, então vamos com calma
O pesquisador independente Ben Davis rodou um subconjunto de 10 tarefas do DeepSWE e reportou cerca de 80%, ou seja, 8 de 10
O número viralizou nesse formato
Aí veio a correção do mesmo teste, com a rodada completa
| Rodada | Tarefas | Resultado |
|---|---|---|
| Subconjunto | 10 | cerca de 80% (8 de 10) |
| Conjunto completo | 113 | cerca de 63% |
O estado final do dado é 63%, não 80%
E não é auditoria oficial nem número publicado pelo provedor, é teste de comunidade
O detalhe que interessa pra quem monta agente
Cerca de 9,7% do benchmark foi perdido por falhas de formatação de chamada de ferramenta
Lê de novo: formatação, não raciocínio
O modelo entendia o que fazer e escorregava na hora de emitir a tool call no formato certo
Isso muda completamente a leitura do resultado
Se teu pipeline tolera uma chamada malformada (tem validação, tem reprompt, tem fallback), essa perda é recuperável no teu lado
Se teu pipeline dispara ação real a partir do primeiro JSON que chega, essa perda é um incidente
E olha a tensão bonita entre as duas evidências: a sessão de 69 chamadas mostra disciplina de formato, o benchmark completo mostra escorregão de formato
As duas coisas podem ser verdade em contextos diferentes, e é exatamente por isso que teste próprio ainda manda
E o Artificial Analysis?
Não tem score
Ele não aparece no Artificial Analysis Intelligence Index até agora
Tudo que circula de número vem de teste de comunidade, com amostra pequena e sem verificação independente
Se alguém te mostrar ranking com posição cravada, desconfia
Onde o Ox Alpha faz sentido num agente hoje
Vamos separar por perfil, porque "vale a pena?" depende de onde tu vai enfiar ele
Faz sentido pra prototipar orquestração longa
É o caso mais óbvio: o preview está a US$ 0 por 1M de tokens de prompt e de completion
Montar um fluxo com muitas ferramentas encadeadas costuma ser caro justamente na fase de tentativa e erro, quando tu ainda tá calibrando prompt e schema
Com preço zero, essa fase fica barata de doer
Faz sentido pra carga com contexto gigante
1.048.576 tokens de contexto e até 131.072 de saída não é pouca coisa
Repositório inteiro na janela, transcrição longa, histórico grande de sessão: cabe
Faz sentido pra fluxo multimodal de entrada
Ele aceita texto, imagem e vídeo como entrada e devolve texto
Então pipeline que lê screenshot, print de erro ou gravação de tela e devolve texto estruturado é território natural dele
Onde eu não colocaria ele agora
- Dado sensível: a política de dados está contraditória entre as rotas de acesso (abro as três versões logo abaixo, no tópico "O ponto sensível: pra onde vai o teu código?") e isso sozinho já basta pra segurar
- Produção crítica: o fabricante é anônimo, não tem model card, não tem preço pós-preview e não tem data de corte anunciada, ou seja, tu não controla o chão que tá pisando
- Pipeline que não tolera tool call malformada: com 9,7% do benchmark perdido em formatação, quem dispara ação irreversível direto do output precisa de validação antes, não depois
Nenhum desses pontos é sobre o modelo ser ruim
É sobre o que é medido e o que não é
Grátis até quando, com quais riscos e limites
O preço hoje é US$ 0 por 1M de tokens de prompt e US$ 0 por 1M de tokens de completion no OpenRouter
Em 24 de agosto de 2026 ele seguia gratuito, sem data de corte oficial publicada
O OpenCode anunciou gratuidade por uma semana a partir de 20/08, o que cai por volta de 27/08, mas nenhuma rota publicou data exata de encerramento nem tabela de preço pós-preview
Traduzindo: pode virar pago a qualquer momento, e não existe aviso prévio garantido pra ninguém se preparar
Só que preço não é o único limite aqui
Tem mais dois que mordem antes dele: o limite de requisição de cada rota e a política de dados, e é isso que eu abro nos próximos tópicos
Rate limit: quanto dá pra rodar por dia?
Modelos gratuitos no OpenRouter têm limite diário de requisições documentado pela plataforma, e o cliente recebe erro 429 ao estourar
O erro comum aqui é montar o agente sem tratar 429
Num fluxo de 69 chamadas, um 429 no meio derruba a cadeia inteira se teu código não tiver backoff
Já o OpenCode anunciou "generous rate limits, near unlimited usage", com capacidade declarada de 100T tokens por dia, além de 1M de contexto e suporte multimodal
Repara na diferença de natureza: um lado publica limite documentado, o outro publica promessa em texto de anúncio
Pra planejamento de agente, limite documentado vale mais que adjetivo generoso
E por falar em uso: no ranking de uso recente do OpenCode, ele aparece em 2º lugar, atrás do deepseek-v4-flash
O povo está usando pra valer, não é só curiosidade de timeline
O ponto sensível: pra onde vai o teu código?
Aqui mora a parte incômoda, e ela precisa ser dita sem enfeite
As três fontes de política de dados não batem entre si:
- A página do modelo no OpenRouter indica que o conteúdo é retido pelo provedor e não usado para treino
- A EULA de modelos stealth do OpenRouter concede à plataforma e ao provedor anônimo o direito de usar o conteúdo do usuário para treino, avaliação e melhoria
- O anúncio do OpenCode afirma Zero Data Retention
Três afirmações, duas rotas, zero explicação pública de como isso se resolve na prática
Ou seja: a mesma plataforma diz numa página que teu conteúdo não vira treino e diz no contrato que pode virar
Enquanto isso não for esclarecido, código proprietário e dado de cliente ficam de fora, ponto
Protótipo com dado sintético? Massa
Base do cliente? Não
Acesso via API compatível com OpenAI
O caminho verificável é apontar a base URL de um SDK compatível com OpenAI para o endpoint do OpenRouter e usar o slug stealth/ox-alpha
from openai import OpenAI
client = OpenAI(
base_url="<endpoint do OpenRouter>", # confira o endpoint atual na doc da plataforma
api_key="<sua chave>",
)
resp = client.chat.completions.create(
model="stealth/ox-alpha",
messages=[{"role": "user", "content": "liste os arquivos do projeto"}],
)
O slug é a parte que as pessoas erram: é stealth/ox-alpha, com o prefixo
Sobre a rota do OpenCode eu não vou ensinar passo a passo aqui, porque as descrições de menu e comando que encontrei divergem entre si, e post enxuto e certo vale mais que completo e errado
Vídeo: contexto sobre ferramentas de IA no dia a dia
Pra quem tá começando do zero no assunto de ferramentas de IA aplicadas ao dia a dia, este vídeo do canal serve de porta de entrada:
Conclusão
Estabilidade em cadeia longa é o critério que separa modelo usável de modelo caro
Dá pra ter raciocínio ótimo e mesmo assim queimar orçamento em retry, e dá pra ter raciocínio mediano que atravessa 69 chamadas sem tropeçar
No caso do Ox Alpha, o sinal é bom e a evidência é fina: uma sessão documentada por terceiros, um benchmark de comunidade que caiu de 80% pra 63% quando rodou completo, quase 10% de perda por formatação de tool call e nenhum score em índice independente
Somando com fabricante anônimo e política de dados contraditória, o veredito honesto é este: promissor pra teste, cedo demais pra confiar cego
O próximo passo é concreto e barato enquanto o preview durar
Pega o teu próprio fluxo de agente, roda com dado não sensível, e conta três coisas: quantas chamadas de ferramenta, quantos erros, quantos retries
Depois compara com o modelo que já está na tua produção hoje
Se ele segurar a tua cadeia com menos retry, tu descobriu isso medindo, não lendo timeline 😀
Até o próximo post!
Perguntas frequentes
O Ox Alpha vai continuar gratuito depois do preview?
Não tem confirmação disso. O OpenRouter cobra US$ 0 por 1M de tokens de prompt e completion durante o preview, e o OpenCode anunciou gratuidade só por uma semana a partir de 20 de agosto de 2026 (ou seja, por volta de 27/08). Nenhuma das duas rotas publicou data exata de encerramento nem preço pós-preview, então dá pra virar pago sem aviso.
Como chamar o Ox Alpha pela API?
Basta apontar a base URL de um SDK compatível com OpenAI para o endpoint do OpenRouter e usar o slug stealth/ox-alpha como modelo. Como ele suporta tool calling com tools e tool_choice, além de saída estruturada em JSON, dá pra integrar direto no mesmo formato que já se usa com outros modelos compatíveis com a API da OpenAI.
O modelo guarda os dados que eu envio para treinar?
Depende de onde você chama. A página do modelo no OpenRouter diz que o conteúdo é retido pelo provedor e não usado para treino, mas a EULA de modelos stealth da própria plataforma dá à OpenRouter e ao provedor anônimo o direito de usar o conteúdo do usuário para treino, avaliação e melhoria. Já o anúncio do OpenCode afirma Zero Data Retention, então as duas rotas de acesso não batem entre si.
Existe limite de uso no acesso gratuito?
No OpenRouter sim: modelos gratuitos têm limite diário de requisições documentado pela própria plataforma, e quem estoura recebe erro 429. Já o anúncio do OpenCode fala em ‘generous rate limits, near unlimited usage’ e capacidade declarada de 100 trilhões de tokens por dia, o que é uma promessa bem mais frouxa que a política do OpenRouter.
É o mesmo modelo GLM da Zhipu AI?
Não há confirmação oficial disso. O fingerprinting feito pela comunidade aponta pra família GLM da Zhipu AI, mas até 24 de agosto de 2026 nenhum laboratório assumiu publicamente a autoria do modelo. Trate essa ligação como indício forense, não como fato.
O Ox Alpha é muito usado no OpenCode?
Sim, ele aparece como o 2º modelo por uso recente no OpenCode, ficando atrás apenas do deepseek-v4-flash. Isso indica adoção real por quem já monta agente na ferramenta, mas não substitui teste próprio antes de colocar em produção.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Ox Alpha vs GLM-5.3, GPT-5.6-sol e Grok 4.6: o modelo anônimo resolveu de primeira a tarefa que zerou os outros três?
O Ox Alpha, modelo anônimo do OpenRouter, resolveu de primeira uma tarefa do DeepSWE que zerou GLM-5.3, GPT-5.6-sol e Grok 4.6. Veja os números.
Saída de 131.072 tokens do Ox Alpha: quando o limite de resposta longa faz diferença?
O Ox Alpha gera até 131.072 tokens de saída por resposta, contra 1.048.576 de contexto. Veja como identificar corte de texto pelo finish_reason.
Ox Alpha é gratuito? O que significa o período grátis na OpenRouter
Ox Alpha gratuito é real: a OpenRouter mostra US$ 0 por milhão de tokens no preview. Veja até quando dura o acesso grátis e o que diz o EULA da Stealth.
