Ox Alpha é confiável para agentes? O que uma sessão com 69 chamadas de ferramentas mostra

sessão de agente de IA usando o modelo Ox Alpha com 69 chamadas de ferramentas
Resposta rápida

O Ox Alpha é um modelo stealth que apareceu em 20 de agosto de 2026 no OpenRouter e no OpenCode, sob o ID stealth/ox-alpha, operado por um provedor anônimo durante o preview. Tem 1.048.576 tokens de contexto, até 131.072 de saída, aceita texto, imagem e vídeo, faz tool calling e saída estruturada em JSON, e está a US$ 0 por 1M de tokens enquanto o preview durar. O sinal agentic vem de uma sessão documentada por terceiros: 69 chamadas de ferramenta, 1 erro e nenhum loop de retry. Bom indício, amostra única, sem auditoria independente

Fala aí, beleza? Um modelo pode ir bem no benchmark e mesmo assim destroçar o teu agente na terceira hora de execução

O que quebra automação de verdade não é a resposta única, é a cadeia longa: dez, trinta, setenta chamadas de ferramenta em sequência, cada errinho virando retry, cada retry virando token queimado e contexto sujo

O Ox Alpha apareceu em 20 de agosto de 2026 no OpenRouter e no OpenCode, sob o ID stealth/ox-alpha, sem fabricante identificado

E o que colocou ele na conversa de quem monta agente foi uma sessão agentic documentada com 69 chamadas de ferramenta, 1 erro e nenhum loop de retry

Bora destrinchar o que esse número significa (e o que ele NÃO significa)?

O que é o Ox Alpha e por que ninguém sabe quem o fez

Ele é um modelo stealth: está listado publicamente, dá pra chamar, mas o fabricante não assinou embaixo

A própria página do modelo no OpenRouter descreve ele como "developed and operated by a third-party provider who has chosen to remain anonymous during this preview"

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 116 aulas
  • 4 projetos
  • 9h 23min

A ficha técnica é esta:

Item Ox Alpha
ID do modelo stealth/ox-alpha
Aparição pública 20 de agosto de 2026, no OpenRouter e no OpenCode
Contexto 1.048.576 tokens
Saída máxima 131.072 tokens
Entradas texto, imagem e vídeo
Saída texto
Recursos de agente tool calling (tools e tool_choice) e saída estruturada em JSON
Preço no preview US$ 0 por 1M de tokens de prompt e US$ 0 por 1M de completion

Repara que a listagem não vende ele como modelo de chat genérico

A descrição de propósito é bem específica: modelo de raciocínio voltado a programação, trabalho agentic sustentado e cargas de produção

"Agentic sustentado" é justamente o assunto deste post 🙂

Sobre as modalidades, vale saber exatamente o que entra e o que não entra antes de desenhar teu pipeline, e eu já detalhei as entradas suportadas pelo modelo em outro post

E quem fez, afinal?

Até 24 de agosto de 2026, nenhum laboratório assumiu o modelo

O fingerprinting da comunidade aponta pra família GLM da Zhipu AI, mas isso é indício forense, não confirmação oficial

Sem model card do fabricante, sem anúncio, sem nada

Tome cuidado com quem já está afirmando autoria por aí: é chute com cara de notícia

O que uma sessão com 69 chamadas de ferramentas realmente mostra

Aqui está o dado que fez o modelo circular entre quem monta agente: um fluxo de agente documentado com 69 chamadas de ferramenta, apenas 1 erro, nenhum loop de retry e overhead de inferência relativamente baixo

Antes do "uau", o porquê de isso importar

Em orquestração longa, o inimigo não é a chamada errada isolada, é o efeito cascata

O modelo erra o formato de uma tool call, o harness devolve erro, o modelo tenta de novo, erra parecido, tenta de novo

Aí tu tem três coisas acontecendo ao mesmo tempo:

  • Custo: cada retry recarrega contexto e paga token de novo
  • Latência: a tarefa que era de 3 minutos vira de 20
  • Contexto sujo: a janela enche de mensagem de erro e o modelo passa a raciocinar em cima do próprio lixo

É por isso que um agente com bom raciocínio e péssima disciplina de formato sai MUITO mais caro que um modelo mediano e obediente

O dev que já viu fatura de API depois de um loop de retry noturno sabe do que eu tô falando kkk

O que os três números dizem

69 chamadas significa cadeia longa de verdade, não demo de duas ferramentas

1 erro significa que a taxa de falha não virou bola de neve dentro da mesma sessão

Nenhum loop de retry é o número mais interessante dos três: quer dizer que o erro que apareceu foi absorvido e o fluxo seguiu, em vez de o modelo ficar batendo na mesma parede

Agora o freio de mão

Isso é uma sessão documentada por terceiros, não auditoria

Não dá pra saber qual harness rodou, qual tarefa era, nem qual conjunto de ferramentas estava exposto, porque o log original não foi publicado junto

E amostra única não vira garantia, nunca

Uma sessão limpa prova que o modelo é CAPAZ de segurar uma cadeia longa, não que ele SEMPRE segura

Trate como sinal, não como certificado

Os 80% do DeepSWE que viraram 63%: o que aconteceu

Esse é o ponto onde muita gente vai repetir número errado, então vamos com calma

O pesquisador independente Ben Davis rodou um subconjunto de 10 tarefas do DeepSWE e reportou cerca de 80%, ou seja, 8 de 10

O número viralizou nesse formato

Aí veio a correção do mesmo teste, com a rodada completa

Rodada Tarefas Resultado
Subconjunto 10 cerca de 80% (8 de 10)
Conjunto completo 113 cerca de 63%

O estado final do dado é 63%, não 80%

E não é auditoria oficial nem número publicado pelo provedor, é teste de comunidade

O detalhe que interessa pra quem monta agente

Cerca de 9,7% do benchmark foi perdido por falhas de formatação de chamada de ferramenta

Lê de novo: formatação, não raciocínio

O modelo entendia o que fazer e escorregava na hora de emitir a tool call no formato certo

Isso muda completamente a leitura do resultado

Se teu pipeline tolera uma chamada malformada (tem validação, tem reprompt, tem fallback), essa perda é recuperável no teu lado

Se teu pipeline dispara ação real a partir do primeiro JSON que chega, essa perda é um incidente

E olha a tensão bonita entre as duas evidências: a sessão de 69 chamadas mostra disciplina de formato, o benchmark completo mostra escorregão de formato

As duas coisas podem ser verdade em contextos diferentes, e é exatamente por isso que teste próprio ainda manda

E o Artificial Analysis?

Não tem score

Ele não aparece no Artificial Analysis Intelligence Index até agora

Tudo que circula de número vem de teste de comunidade, com amostra pequena e sem verificação independente

Se alguém te mostrar ranking com posição cravada, desconfia

Onde o Ox Alpha faz sentido num agente hoje

Vamos separar por perfil, porque "vale a pena?" depende de onde tu vai enfiar ele

Faz sentido pra prototipar orquestração longa

É o caso mais óbvio: o preview está a US$ 0 por 1M de tokens de prompt e de completion

Montar um fluxo com muitas ferramentas encadeadas costuma ser caro justamente na fase de tentativa e erro, quando tu ainda tá calibrando prompt e schema

Com preço zero, essa fase fica barata de doer

Faz sentido pra carga com contexto gigante

1.048.576 tokens de contexto e até 131.072 de saída não é pouca coisa

Repositório inteiro na janela, transcrição longa, histórico grande de sessão: cabe

Faz sentido pra fluxo multimodal de entrada

Ele aceita texto, imagem e vídeo como entrada e devolve texto

Então pipeline que lê screenshot, print de erro ou gravação de tela e devolve texto estruturado é território natural dele

Onde eu não colocaria ele agora

  • Dado sensível: a política de dados está contraditória entre as rotas de acesso (abro as três versões logo abaixo, no tópico "O ponto sensível: pra onde vai o teu código?") e isso sozinho já basta pra segurar
  • Produção crítica: o fabricante é anônimo, não tem model card, não tem preço pós-preview e não tem data de corte anunciada, ou seja, tu não controla o chão que tá pisando
  • Pipeline que não tolera tool call malformada: com 9,7% do benchmark perdido em formatação, quem dispara ação irreversível direto do output precisa de validação antes, não depois

Nenhum desses pontos é sobre o modelo ser ruim

É sobre o que é medido e o que não é

Grátis até quando, com quais riscos e limites

O preço hoje é US$ 0 por 1M de tokens de prompt e US$ 0 por 1M de tokens de completion no OpenRouter

Em 24 de agosto de 2026 ele seguia gratuito, sem data de corte oficial publicada

O OpenCode anunciou gratuidade por uma semana a partir de 20/08, o que cai por volta de 27/08, mas nenhuma rota publicou data exata de encerramento nem tabela de preço pós-preview

Traduzindo: pode virar pago a qualquer momento, e não existe aviso prévio garantido pra ninguém se preparar

Só que preço não é o único limite aqui

Tem mais dois que mordem antes dele: o limite de requisição de cada rota e a política de dados, e é isso que eu abro nos próximos tópicos

Rate limit: quanto dá pra rodar por dia?

Modelos gratuitos no OpenRouter têm limite diário de requisições documentado pela plataforma, e o cliente recebe erro 429 ao estourar

O erro comum aqui é montar o agente sem tratar 429

Num fluxo de 69 chamadas, um 429 no meio derruba a cadeia inteira se teu código não tiver backoff

Já o OpenCode anunciou "generous rate limits, near unlimited usage", com capacidade declarada de 100T tokens por dia, além de 1M de contexto e suporte multimodal

Repara na diferença de natureza: um lado publica limite documentado, o outro publica promessa em texto de anúncio

Pra planejamento de agente, limite documentado vale mais que adjetivo generoso

E por falar em uso: no ranking de uso recente do OpenCode, ele aparece em 2º lugar, atrás do deepseek-v4-flash

O povo está usando pra valer, não é só curiosidade de timeline

O ponto sensível: pra onde vai o teu código?

Aqui mora a parte incômoda, e ela precisa ser dita sem enfeite

As três fontes de política de dados não batem entre si:

  • A página do modelo no OpenRouter indica que o conteúdo é retido pelo provedor e não usado para treino
  • A EULA de modelos stealth do OpenRouter concede à plataforma e ao provedor anônimo o direito de usar o conteúdo do usuário para treino, avaliação e melhoria
  • O anúncio do OpenCode afirma Zero Data Retention

Três afirmações, duas rotas, zero explicação pública de como isso se resolve na prática

Ou seja: a mesma plataforma diz numa página que teu conteúdo não vira treino e diz no contrato que pode virar

Enquanto isso não for esclarecido, código proprietário e dado de cliente ficam de fora, ponto

Protótipo com dado sintético? Massa

Base do cliente? Não

Acesso via API compatível com OpenAI

O caminho verificável é apontar a base URL de um SDK compatível com OpenAI para o endpoint do OpenRouter e usar o slug stealth/ox-alpha

from openai import OpenAI

client = OpenAI(
    base_url="<endpoint do OpenRouter>",  # confira o endpoint atual na doc da plataforma
    api_key="<sua chave>",
)

resp = client.chat.completions.create(
    model="stealth/ox-alpha",
    messages=[{"role": "user", "content": "liste os arquivos do projeto"}],
)

O slug é a parte que as pessoas erram: é stealth/ox-alpha, com o prefixo

Sobre a rota do OpenCode eu não vou ensinar passo a passo aqui, porque as descrições de menu e comando que encontrei divergem entre si, e post enxuto e certo vale mais que completo e errado

Vídeo: contexto sobre ferramentas de IA no dia a dia

Pra quem tá começando do zero no assunto de ferramentas de IA aplicadas ao dia a dia, este vídeo do canal serve de porta de entrada:

Conclusão

Estabilidade em cadeia longa é o critério que separa modelo usável de modelo caro

Dá pra ter raciocínio ótimo e mesmo assim queimar orçamento em retry, e dá pra ter raciocínio mediano que atravessa 69 chamadas sem tropeçar

No caso do Ox Alpha, o sinal é bom e a evidência é fina: uma sessão documentada por terceiros, um benchmark de comunidade que caiu de 80% pra 63% quando rodou completo, quase 10% de perda por formatação de tool call e nenhum score em índice independente

Somando com fabricante anônimo e política de dados contraditória, o veredito honesto é este: promissor pra teste, cedo demais pra confiar cego

O próximo passo é concreto e barato enquanto o preview durar

Pega o teu próprio fluxo de agente, roda com dado não sensível, e conta três coisas: quantas chamadas de ferramenta, quantos erros, quantos retries

Depois compara com o modelo que já está na tua produção hoje

Se ele segurar a tua cadeia com menos retry, tu descobriu isso medindo, não lendo timeline 😀

Até o próximo post!

Perguntas frequentes

O Ox Alpha vai continuar gratuito depois do preview?

Não tem confirmação disso. O OpenRouter cobra US$ 0 por 1M de tokens de prompt e completion durante o preview, e o OpenCode anunciou gratuidade só por uma semana a partir de 20 de agosto de 2026 (ou seja, por volta de 27/08). Nenhuma das duas rotas publicou data exata de encerramento nem preço pós-preview, então dá pra virar pago sem aviso.

Como chamar o Ox Alpha pela API?

Basta apontar a base URL de um SDK compatível com OpenAI para o endpoint do OpenRouter e usar o slug stealth/ox-alpha como modelo. Como ele suporta tool calling com tools e tool_choice, além de saída estruturada em JSON, dá pra integrar direto no mesmo formato que já se usa com outros modelos compatíveis com a API da OpenAI.

O modelo guarda os dados que eu envio para treinar?

Depende de onde você chama. A página do modelo no OpenRouter diz que o conteúdo é retido pelo provedor e não usado para treino, mas a EULA de modelos stealth da própria plataforma dá à OpenRouter e ao provedor anônimo o direito de usar o conteúdo do usuário para treino, avaliação e melhoria. Já o anúncio do OpenCode afirma Zero Data Retention, então as duas rotas de acesso não batem entre si.

Existe limite de uso no acesso gratuito?

No OpenRouter sim: modelos gratuitos têm limite diário de requisições documentado pela própria plataforma, e quem estoura recebe erro 429. Já o anúncio do OpenCode fala em ‘generous rate limits, near unlimited usage’ e capacidade declarada de 100 trilhões de tokens por dia, o que é uma promessa bem mais frouxa que a política do OpenRouter.

É o mesmo modelo GLM da Zhipu AI?

Não há confirmação oficial disso. O fingerprinting feito pela comunidade aponta pra família GLM da Zhipu AI, mas até 24 de agosto de 2026 nenhum laboratório assumiu publicamente a autoria do modelo. Trate essa ligação como indício forense, não como fato.

O Ox Alpha é muito usado no OpenCode?

Sim, ele aparece como o 2º modelo por uso recente no OpenCode, ficando atrás apenas do deepseek-v4-flash. Isso indica adoção real por quem já monta agente na ferramenta, mas não substitui teste próprio antes de colocar em produção.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares