Janela de 1 milhão de tokens do Ox Alpha: o que cabe de verdade em uma conversa?

O Ox Alpha 1 milhão de tokens é um modelo que apareceu em 20 de agosto de 2026 no OpenRouter e no OpenCode sob o provedor genérico ‘Stealth’, sem anúncio oficial e sem dono declarado. A rota stealth/ox-alpha lista 1.048.576 tokens de contexto, 131.072 tokens de saída máxima e preço de US$ 0,00 por milhão de tokens de entrada e de saída durante o preview. Na prática, uma janela desse tamanho comporta base de código extensa e documentação longa de uma vez, mas até agora nenhuma avaliação independente mediu o modelo perto de 1 milhão de tokens
Um milhão de tokens em uma conversa só, de graça, e ninguém assinando embaixo 🙂
Fala aí, beleza? No dia 20 de agosto de 2026 apareceu no OpenRouter e no OpenCode um modelo listado sob o provedor genérico "Stealth", sem nome de empresa e sem post de lançamento: o Ox Alpha
E ele chegou com uma janela de contexto de 1.048.576 tokens e preço listado de US$ 0,00 por milhão de tokens de entrada e de saída durante o preview
O número é bonito, mas número solto não constrói nada. A pergunta que interessa é outra: o que cabe DE VERDADE ali dentro?
O que é o Ox Alpha e de onde ele apareceu
O Ox Alpha estreou em 20 de agosto de 2026, listado no OpenRouter sob o provedor genérico "Stealth"
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
O identificador na rota é stealth/ox-alpha, e a página do modelo pode ser conferida direto no OpenRouter
O modelo apareceu nas plataformas e ganhou nota de lançamento do OpenCode, que é a ferramenta que passou a oferecer ele. O que não existe é laboratório assumindo a autoria: nenhum nome de empresa, nenhum card de modelo com a marca de ninguém
Os números publicados na rota são estes: 1.048.576 tokens de contexto e 131.072 tokens de saída máxima
O preço listado durante o preview é US$ 0,00 por milhão de tokens de entrada e de saída. Isso é condição de preview, não preço definitivo, e vale guardar essa distinção pro final do post
A entrada aceita texto, imagem e vídeo. A saída é texto
E quem fez esse modelo?
Ninguém assumiu oficialmente
A hipótese que circula na comunidade aponta pra Zhipu AI (Z.ai) e pra família GLM, montada em cima de forense de gente curiosa: fingerprint de tokenizer, códigos de erro, stack trace
Só que não houve confirmação nem desmentido do provedor, então aqui fica como está: autoria não confirmada
É o tipo de coisa que dá muito debate no Twitter e nenhuma certeza pra quem vai colocar o modelo pra trabalhar
O que dá pra carregar em uma conversa só
Agora a parte prática. 1.048.576 tokens é quanta coisa, afinal?
A documentação de contexto longo do Gemini API do Google usa uma referência bem útil pra calibrar a cabeça: 1 milhão de tokens equivale a cerca de 50.000 linhas de código (contando 80 caracteres por linha) ou 8 romances em inglês de tamanho médio
Se liga no que isso muda:
- Base de código extensa de uma vez: em vez de mandar arquivo por arquivo e ficar explicando o que já foi explicado, tu joga um bloco enorme do projeto e conversa em cima dele
- Documentação longa inteira: manual, especificação, RFC, changelog, tudo junto, sem picotar em pedacinhos
- Material de vídeo e imagem como entrada: como a entrada aceita esses formatos, dá pra levar mais do que texto puro pra dentro da conversa
O ganho aqui não é o número em si, é a quantidade de ida e volta que tu para de fazer. Menos "lembra do arquivo que eu te mandei há 20 mensagens?" e mais trabalho em cima do material completo
Esse papo de janela gigante já apareceu por aqui em outros modelos, inclusive quando falamos sobre a janela do Claude Fable 5
O lado operacional que também muda o fluxo
Janela grande sem ferramenta em volta vira só uma caixa de texto grande
A rota do Ox Alpha aceita tools e tool_choice pra function calling, e response_format pra saída em JSON. Um detalhe importante: sem imposição de JSON Schema
Tome cuidado com isso! Sem enforcement de schema, a saída pode sair fora do formato que tu esperava, então validação do lado da tua aplicação continua sendo obrigação sua
Entre os parâmetros suportados aparecem reasoning_effort, max_tokens, temperature, top_p e top_k
Contexto grande não significa resposta grande
Essa é a confusão mais comum de todas, então bora separar
Entrada e saída são orçamentos DIFERENTES
A janela de 1.048.576 tokens é o que tu consegue enfiar na conversa. A saída máxima na rota do OpenRouter é 131.072 tokens, e é ela que limita o tamanho do que volta pra ti
Ou seja: dá pra ler um projeto inteiro e pedir análise, mas não espere que ele reescreva o projeto inteiro numa tacada só. Já vimos exatamente essa mesma assimetria no teto de saída do DeepSeek V4 Pro, e o raciocínio vale igual aqui
Veja também: IA de programar grátis com 1 milhão de contexto
Falando em janela gigante sem pagar nada, esse vídeo do canal mostra o MiMo Code: uma IA de programar grátis, sem login e com 1 milhão de contexto
Dá pra ver a ferramenta funcionando e o que cabe dentro de uma janela desse tamanho
Ox Alpha e Claude Sonnet 4.6: a mesma janela em condições diferentes
Janela de 1 milhão não é mais raridade absoluta
A janela de 1 milhão de tokens do Claude Sonnet 4.6 e do Claude Opus 4.6 está em disponibilidade geral desde 13 de março de 2026
A diferença entre os dois casos não está no tamanho, está em tudo que vem em volta
| Item | Ox Alpha | Claude Sonnet 4.6 |
|---|---|---|
| Janela de contexto | 1.048.576 tokens | 1 milhão de tokens |
| Preço | US$ 0,00 por milhão de entrada e de saída (preview) | a partir de US$ 3 por milhão de entrada e US$ 15 por milhão de saída |
| Status | acesso stealth, temporário, pode ser removido com ou sem aviso | disponibilidade geral desde 13 de março de 2026 (junto com o Opus 4.6) |
| Autoria | não confirmada oficialmente | Anthropic |
O ponto da comparação é esse: janela igual, previsibilidade completamente diferente
Um você coloca em produção sabendo quanto custa e quem responde por ele. O outro você usa enquanto está de pé
O que muda pra você (e o que ainda não dá pra afirmar)
Aqui vem o balde de água fria necessário, porque janela declarada não é a mesma coisa que contexto efetivo
Até agora nenhuma avaliação independente de contexto longo mediu o Ox Alpha em entradas próximas de 1 milhão de tokens
Traduzindo: o número deve ser tratado como capacidade de entrada, não como prova de que o modelo raciocina bem sobre 1 milhão de tokens
E aquele resultado que viralizou? Cerca de 80% de Pass@1 no DeepSWE, acima dos rivais, veio de um teste de usuário com apenas 10 tarefas
Não é leaderboard auditado, é resultado preliminar. Legal como sinal, ruim como decisão de arquitetura 😀
Os limites "quase ilimitados"
O OpenCode descreveu os limites como "quase ilimitados" durante a janela gratuita e citou capacidade de 100 trilhões de tokens por dia
No OpenCode Go, o "Ox Alpha Free" aparece como requisições ilimitadas por janela de 5 horas, por tempo limitado
Só que isso é alegação de capacidade do operador, não medição nem garantia de serviço. São coisas bem diferentes
O relógio está correndo
A janela gratuita é de cerca de uma semana contada a partir da nota de lançamento do OpenCode de 20 de agosto, o que aponta pra por volta de 27 de agosto de 2026
Repare que essa data sai da comunicação do OpenCode, a ferramenta, e não de um laboratório: quem fez o modelo segue sem se apresentar
E os termos de modelos stealth do OpenRouter são explícitos: esse acesso é limitado no tempo e pode ser removido com ou sem aviso prévio
Ou seja, não é base pra construir nada que precise estar de pé mês que vem
O conflito sobre os teus dados
Essa é a parte que merece atenção de verdade
Existe conflito documentado sobre o que acontece com o que tu manda pro modelo:
- o aviso do modelo no OpenRouter diz que prompts e completions são retidos pelo provedor e não usados para treino
- o OpenCode fala em política de retenção zero
- o EULA de modelos stealth do OpenRouter concede direito de usar o conteúdo do usuário para treino, avaliação e melhoria
Três versões que não fecham entre si, sobre um provedor que ninguém sabe qual é
Enquanto isso estiver assim, código proprietário e dado sensível ficam de fora. Sem drama, só bom senso
Conclusão
O Ox Alpha 1 milhão de tokens é real como capacidade de entrada: 1.048.576 tokens de contexto, 131.072 de saída máxima, entrada de texto, imagem e vídeo, tools e response_format disponíveis, e preço zero listado durante o preview
Isso é bastante coisa pra brincar, e o preview está de pé agora
Mas o próximo passo é tratar como experimento, não como fundação: sem código sensível enquanto a política de dados estiver em conflito, sem contar com ele daqui a um mês, e de olho em duas coisas que ainda não existem, ou seja, verificação independente em contexto longo e um nome de laboratório assumindo a autoria
Quando (e se) aparecer, a conversa muda de figura…
Bora acompanhar, e até o próximo post! 😀
Perguntas frequentes
Até quando o Ox Alpha fica gratuito no OpenRouter?
A janela gratuita é de cerca de uma semana contada a partir da nota de lançamento do OpenCode em 20 de agosto de 2026, o que aponta para o fim por volta de 27 de agosto de 2026. Essa referência vem do OpenCode, a ferramenta que oferece o modelo, e não de um laboratório, já que ninguém assumiu a autoria do Ox Alpha. Depois disso o preço de US$ 0,00 por milhão de tokens deixa de valer, porque essa é uma condição de preview, não um preço definitivo.
Dá pra mandar dado sensível da empresa pro Ox Alpha?
Existe conflito documentado sobre isso: o aviso do modelo no OpenRouter fala em retenção pelo provedor sem uso para treino, o OpenCode fala em retenção zero, e o EULA de modelos stealth do OpenRouter concede direito de usar o conteúdo do usuário para treino, avaliação e melhoria. Enquanto isso não for esclarecido, o mais seguro é tratar como se o dado pudesse ser retido.
Qual o identificador do Ox Alpha pra chamar via API?
Na rota do OpenRouter o identificador é stealth/ox-alpha, listado sob o provedor genérico Stealth. Não há nome de laboratório associado ao modelo até o momento.
O resultado de 80% no DeepSWE prova que o Ox Alpha é o melhor pra código?
Não. Esse número veio de um teste de usuário com apenas 10 tarefas, não de um leaderboard auditado, então é um resultado preliminar e não uma medição independente.
Tem limite de uso durante o período gratuito do Ox Alpha?
O OpenCode descreveu os limites como quase ilimitados durante a janela gratuita e citou capacidade de 100 trilhões de tokens por dia. No OpenCode Go, o Ox Alpha Free aparece como requisições ilimitadas por janela de 5 horas, por tempo limitado, o que é alegação de capacidade do operador, não uma garantia de serviço.
O Ox Alpha aceita vídeo como entrada, ou só texto e imagem?
O Ox Alpha aceita texto, imagem e vídeo como entrada, e devolve texto como saída. Isso amplia o que dá pra colocar dentro da janela de 1.048.576 tokens além de texto puro.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
