Ox Alpha aceita áudio? As entradas suportadas pelo modelo (texto, imagem e vídeo)

As entradas suportadas pelo Ox Alpha são texto, imagem e vídeo, e a saída é sempre texto. Áudio não entra: a listagem do modelo na OpenRouter não documenta essa modalidade e requisições com áudio são rejeitadas. Também não tem saída de áudio, nem geração de imagem ou de vídeo. Quem precisa de voz no fluxo resolve isso fora do modelo, transcrevendo antes com um modelo de speech to text e mandando o texto adiante. O modelo roda com o slug stealth/ox-alpha, 1.048.576 tokens de contexto, 131.072 de saída máxima e tool calling disponível.
Áudio não entra
Essa é a resposta curta pra quem chegou aqui antes de escrever a integração, e não depois de quebrar a cara com uma requisição rejeitada
O Ox Alpha apareceu na OpenRouter em 20 de agosto de 2026 como modelo stealth, com o slug stealth/ox-alpha, em preview gratuito
Stealth é exatamente o que o nome diz: o provedor por trás dele optou por permanecer anônimo durante o preview e nenhuma empresa assumiu a autoria até agora
E quando aparece um modelo assim, forte e de graça, todo mundo quer plugar no fluxo AGORA
Aí vem a pergunta que sempre chega antes do código: o que esse troço aceita de entrada? 🙂
Porque descobrir que o modelo não lê áudio depois de montar o pipeline inteiro é o tipo de descoberta que custa um dia de trabalho…
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
O que o Ox Alpha aceita e o que ele rejeita
A tabela abaixo é a consulta rápida de compatibilidade, linha por linha
| Modalidade | Suporta? |
|---|---|
| Entrada de texto | Sim |
| Entrada de imagem | Sim |
| Entrada de vídeo | Sim |
| Entrada de áudio | Não |
| Saída de texto | Sim |
| Saída de áudio | Não |
| Geração de imagem | Não |
| Geração de vídeo | Não |
| Tool calling | Sim |
Repara no desenho: ele é multimodal na ENTRADA e monomodal na saída
Ou seja, você joga texto, imagem e vídeo pra dentro, e o que volta é sempre texto
Nada de ele te devolver um áudio narrado, uma imagem gerada ou um vídeo montado, beleza?
E o áudio simplesmente não está na lista de entradas suportadas
O que é o Ox Alpha e onde ele roda
O Ox Alpha vive na OpenRouter com o identificador stealth/ox-alpha
Se você já usou a OpenRouter, não muda nada no seu jeito de chamar: o modelo é acessado pela API compatível com OpenAI, no endpoint de chat completions /api/v1/chat/completions
Na prática, tu troca só a base URL e o slug do modelo
É igual trocar de driver mantendo o mesmo código em volta, o resto do seu client continua de pé
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stealth/ox-alpha",
"messages": [
{ "role": "user", "content": "Resuma o conteudo em 3 bullets" }
]
}'
Agora os números que realmente pesam no planejamento
- Janela de contexto: 1.048.576 tokens (1M)
- Saída máxima: 131.072 tokens
- Preço durante o preview: US$ 0 por milhão de tokens de entrada e US$ 0 por milhão de tokens de saída
- Tool calling: disponível
1M de contexto com tool calling e custo zero no preview é um combo bem massa pra quem quer testar tarefa longa sem queimar orçamento
Só que contexto gigante não compra modalidade nova
Cabem 1M de tokens ali dentro, mas nenhum deles pode chegar em forma de áudio
Enviei áudio e a requisição foi rejeitada: por que acontece
O sintoma: você monta o payload com um arquivo de voz, dispara pro stealth/ox-alpha e a requisição volta rejeitada
A causa: na OpenRouter, áudio é enviado pelo content type input_audio dentro do mesmo endpoint /api/v1/chat/completions
O arquivo vai em base64 e URL direta não é aceita pra áudio (diferente do que muita gente assume de cara)
A documentação da plataforma cita os formatos wav, mp3, aiff, aac, ogg, flac, m4a, pcm16 e pcm24, sempre com a ressalva de que nem todo modelo suporta todos eles
E é aí que mora o detalhe: o transporte existe na plataforma, mas a listagem do Ox Alpha não documenta entrada de áudio
O canal está lá, o modelo do outro lado é que não atende
É o mesmo tipo de parede que aparece quando você esbarra nos limites de fontes do NotebookLM: a ferramenta não está quebrada, ela só não aceita aquele tipo de material
A solução: resolver o áudio FORA do modelo
- Pegue o arquivo de voz e mande primeiro pra um modelo de speech to text do catálogo da OpenRouter, tipo o Whisper, usando a rota de transcrição
- Guarde o texto que voltou, com os cortes e a limpeza que o seu caso pedir
- Envie esse texto como mensagem normal pro
stealth/ox-alpha, junto com imagem ou vídeo se o fluxo precisar
O erro comum aqui é tentar economizar etapa e mandar o base64 do áudio junto "pra ver se cola"
Não cola, e ainda te faz debugar payload achando que o problema é formatação
A prevenção: antes de escrever qualquer linha de integração, use o filtro por modalidade de entrada de áudio na página Models da OpenRouter
São dois cliques que economizam meia tarde de investigação… faça o teste!
Quando o Ox Alpha resolve seu fluxo multimodal (e quando não)
Vamos separar isso de forma bem prática, porque "multimodal" virou palavra guarda-chuva e cada modelo entende uma coisa
Cenários em que ele encaixa direto:
- Análise de imagem: print de tela, diagrama, foto de documento, interface pra descrever
- Leitura de vídeo, com o modelo devolvendo a descrição ou o resumo em texto
- Tarefas longas que aproveitam a janela de 1.048.576 tokens, tipo varrer um monte de material de uma vez
- Automações com tool calling, chamando suas funções e devolvendo texto estruturado
Cenários que exigem etapa extra ou outro modelo:
- Qualquer entrada de voz: comando falado, áudio de WhatsApp, nota de voz
- Reunião gravada, podcast, aula gravada, atendimento telefônico
- Tudo que precise SAIR como áudio, imagem ou vídeo, porque a saída dele é texto e ponto
O desenho mental é esse: transcrição fora, raciocínio dentro
Se você já monta esteiras de processamento multimodal no n8n, a lógica é a mesma de sempre: um nó converte, outro nó pensa
O Ox Alpha é o nó que pensa, não o que escuta
O que considerar antes de apostar no preview gratuito
Aqui entra o papo chato mas necessário, antes de você fincar bandeira nesse modelo
O acesso segue gratuito em 24/08/2026, só que não existe preço pós-preview publicado nem data de término anunciada
Somando isso ao fato de que o provedor é anônimo e não foi revelado oficialmente, tu tem um ótimo lugar pra experimentar e um lugar arriscado pra amarrar produto
Duas decisões de arquitetura resolvem quase tudo:
- Mantenha a troca de modelo desacoplada. Como a chamada é pela API compatível com OpenAI, trocar de modelo deveria ser mudar uma string de slug no seu config, nunca reescrever o client
- Mantenha a transcrição como etapa separada. Se o áudio já vira texto num passo próprio, qualquer modelo que você colocar depois herda o fluxo pronto
Fazendo assim, se o preview acabar amanhã, você troca a peça e segue o jogo
Se amarrar tudo no stealth/ox-alpha, aí é retrabalho na certa 😛
Conclusão: planeje o áudio fora do modelo
Recapitulando o que importa: as entradas suportadas do Ox Alpha são texto, imagem e vídeo, a saída é texto, tool calling está disponível e o áudio fica de fora nas duas pontas
Ele tem 1.048.576 tokens de contexto, 131.072 tokens de saída máxima e custo de US$ 0 por milhão de tokens de entrada e de saída durante o preview
O próximo passo prático é simples
Confirme a modalidade pelo filtro da página Models antes de codar, deixe a transcrição num passo separado do pipeline e aproveite pra testar o modelo com texto, imagem e vídeo enquanto o preview gratuito durar
Modelo stealth é assim mesmo: aparece do nada, some do nada, e quem tiver a arquitetura desacoplada só dá de ombros 🙂
até o próximo post!
Perguntas frequentes
O Ox Alpha consegue transcrever um áudio que eu enviar?
Não. A listagem do modelo não documenta entrada de áudio, então uma requisição com arquivo de voz é rejeitada. O caminho é transcrever antes num modelo de speech to text do catálogo da OpenRouter, como o Whisper, e só depois mandar o texto pro stealth/ox-alpha.
Qual o tamanho da janela de contexto do Ox Alpha?
A janela de contexto é de 1.048.576 tokens, o equivalente a 1M. A saída máxima fica em 131.072 tokens por resposta.
O Ox Alpha é gratuito pra usar na OpenRouter?
Sim, durante o preview o preço é US$ 0 por milhão de tokens de entrada e US$ 0 por milhão de tokens de saída. O acesso gratuito segue valendo em 24/08/2026, sem data de término anunciada e sem preço pós-preview publicado ainda.
Como faço a primeira chamada de API pro Ox Alpha?
Você usa o endpoint de chat completions da OpenRouter, /api/v1/chat/completions, trocando o slug do modelo pra stealth/ox-alpha. Se seu client já fala com a API compatível com OpenAI da OpenRouter, não muda mais nada na estrutura da chamada.
O Ox Alpha gera imagem ou vídeo como resposta?
Não. A saída dele é sempre texto, mesmo quando a entrada é imagem ou vídeo. Não há geração de imagem, geração de vídeo nem saída em áudio disponível no modelo.
Quem é o provedor por trás do Ox Alpha?
Ninguém sabe ao certo, e é assim de propósito: o Ox Alpha é um modelo stealth operado por um provedor terceiro que optou por permanecer anônimo durante o preview. Nenhuma empresa assumiu a autoria até agora.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
