Qwen vale a pena? Análise honesta da IA chinesa do Alibaba

Qwen vale a pena? Depende do seu perfil, e os números ajudam a decidir. O Qwen é a família de modelos da Alibaba Cloud, e o topo de linha, o Qwen3.8-Max, foi anunciado em 3 de agosto de 2026 com 2,4 trilhões de parâmetros totais (95 bilhões ativos por token), contexto de 1 milhão e entrada de texto, imagem e vídeo. Na Artificial Analysis ele marca 53 de inteligência contra mediana 32 da faixa, mas entrega 46,5 tokens por segundo contra mediana de 72,0. Custa US$ 2,00 na entrada e US$ 6,00 na saída por milhão de tokens, com cache a US$ 0,25
Toda semana pinta um modelo chinês novo prometendo virar a mesa
E aí vem a dúvida real, aquela que raramente é respondida sem enrolação: troco a IA que eu já uso ou isso é só moda?
O Qwen é a família de modelos de linguagem desenvolvida pela Alibaba Cloud, a divisão de nuvem do grupo Alibaba
Aqui a gente vai de veredito, não de hype: o que é verificável, o que é forte, o que é limitação e pra quem esse modelo faz sentido de verdade
Bora? 🙂
O que é o Qwen e o que a Alibaba lançou em agosto de 2026
O Qwen não é um modelo só, é uma linha inteira mantida pela Alibaba Cloud, com versões de tamanhos e propósitos diferentes
Se você já acompanhou as novidades do Qwen 3 em português, a lógica continua a mesma: geração nova, numeração nova, e um topo de linha chamado Max
O Qwen3.8-Max foi anunciado em 3 de agosto de 2026
O que ele traz, sem adjetivo de marketing:
- 2,4 trilhões de parâmetros no total, com 95 bilhões ativos por token
- arquitetura MoE (Mixture of Experts), ou seja, só uma fração dos parâmetros é acionada a cada token
- janela de contexto de 1 milhão de tokens
- entrada de texto, imagem e vídeo, com saída em texto
E o que é MoE, na prática?
É o modelo dividir o cérebro em especialistas e chamar só os que interessam pra aquele token
Por isso ele consegue ser gigante no total e continuar viável de servir, sem precisar de um PC da Nasa por trás de cada requisição haha
Qwen3.8-Max na prática: números contra a faixa de preço
Modelo bom no papel é fácil, difícil é bater os números contra a concorrência do mesmo preço
A tabela abaixo cruza os dados da Artificial Analysis com o preço de API, e coloca a geração anterior do lado pra você ver a evolução
| Item | Qwen3.8-Max | Qwen3.7-Max | Mediana da faixa de preço |
|---|---|---|---|
| Índice de inteligência (Artificial Analysis) | 53 | 46 | 32 |
| Velocidade de saída | 46,5 tokens/s | sem dado | 72,0 tokens/s |
| Tempo até o primeiro token (TTFT) | 2,48s | sem dado | 2,74s |
| Janela de contexto | 1M tokens | 1M tokens | sem dado |
| Entrada por milhão de tokens | US$ 2,00 | US$ 2,50 | sem dado |
| Saída por milhão de tokens | US$ 6,00 | US$ 7,50 | sem dado |
| Leitura de entrada em cache | US$ 0,25 por milhão | sem dado | sem dado |
| Parâmetros | 2,4T totais / 95B ativos | sem dado | sem dado |
Repara no detalhe mais interessante da tabela: a geração nova ficou MAIS inteligente (53 contra 46) e mais barata (US$ 2,00 contra US$ 2,50 na entrada)
Isso não é comum, o normal é o topo de linha novo chegar cobrando mais caro
E tem outro ponto que passa batido: a leitura de entrada em cache sai por US$ 0,25 por milhão de tokens, sem sobretaxa de contexto longo
Ou seja, encher a janela de 1M não dispara um preço diferente por token
Pontos fortes e limitações do Qwen, sem filtro
Vamos separar o joio, porque tem coisa boa e tem coisa que ainda trava decisão
O que é realmente forte:
- inteligência de 53 no índice da Artificial Analysis contra mediana de 32 dos modelos de raciocínio da mesma faixa de preço, uma distância grande
- contexto de 1 milhão de tokens, que abre caso de uso de base grande sem gambiarra de chunk
- cache a US$ 0,25 por milhão, sem sobretaxa de contexto longo
- entrada multimodal de texto, imagem e vídeo
- geração nova mais inteligente E mais barata que a anterior
- TTFT de 2,48s, melhor que a mediana de 2,74s da faixa
O que limita:
- velocidade de saída de 46,5 tokens por segundo contra mediana de 72,0 t/s da faixa, ele começa a responder rápido e depois cospe devagar
- a Alibaba anunciou que vai liberar os pesos do Qwen3.8-Max no Hugging Face e no ModelScope, mas eles não estavam disponíveis no anúncio
- nenhuma licença foi nomeada pro Qwen3.8-Max até o momento do anúncio
Esse último ponto é o mais chato de todos
"Pesos abertos em breve" e licença não publicada não dá pra colocar em planejamento de produto comercial
Promessa não é termo jurídico, beleza? Enquanto não sai a licença nomeada, o topo de linha é um modelo de API como qualquer outro
Para quem o Qwen faz sentido (e para quem não faz)
Aqui é onde a conversa fica prática
Faz sentido pra quem processa MUITO texto
Se o teu fluxo é jogar base gigante pra dentro do modelo (documentação inteira, transcrição longa, repositório todo), a combinação de 1M de contexto com cache a US$ 0,25 por milhão de tokens é o argumento mais forte do Qwen3.8-Max
É um caso em que a saída lenta pesa pouco, porque o gargalo tá na leitura, não na escrita
Faz sentido pra quem precisa de modelo aberto de verdade
Se o requisito é rodar na sua máquina, o caminho não é o Max
O Qwen3.6-27B é de pesos abertos sob licença Apache 2.0, que permite uso comercial, modificação e redistribuição
Ele roda local via Ollama:
ollama run qwen3.6:27bTome cuidado com o hardware antes de sair rodando: são cerca de 17 GB de VRAM na quantização Q4_K_M
Se a sua placa não tem isso, o modelo não sobe (ou cai pra CPU e vira lesma)
Faz sentido pra quem quer agente de terminal
O Qwen Code é um agente de codificação de terminal de código aberto, mantido no repositório oficial QwenLM/qwen-code
A instalação é global via npm:
npm install -g @qwen-code/qwen-code@latestSe você já usa agente de terminal, a curva aqui é curtinha, é o mesmo tipo de bicho
NÃO faz sentido pra quem…
- vive em fluxo interativo, digitando e esperando resposta na hora: 46,5 t/s contra mediana de 72,0 t/s se sente no dedo
- depende de licença fechada e nomeada pra aprovar uso comercial em cima do topo de linha, porque a licença do Qwen3.8-Max não foi publicada
Como acessar o Qwen hoje: chat, API e Qwen Code
Tem três rotas reais, e elas não custam a mesma coisa
- Qwen Chat, em
chat.qwen.ai: acesso gratuito com conta gratuita e limite de requisições, é o jeito mais barato de formar opinião antes de mexer em código - API da Alibaba Cloud: cobrada por uso, é a rota pra quem vai integrar
- OpenRouter: o Qwen3.8-Max está listado lá como
qwen/qwen3.8-max, o que dá uma rota alternativa à API direta da Alibaba
E no Qwen Code, presta atenção nessa mudança, porque muito tutorial na internet ainda ensina o caminho velho
O nível gratuito de autenticação por Qwen OAuth foi descontinuado em 15 de abril de 2026 e não aparece mais como opção no diálogo de autenticação
Se você seguir um passo a passo antigo procurando essa opção na tela, ela simplesmente não vai estar lá
As opções atuais de autenticação são:
- Alibaba Cloud Coding Plan (assinatura com cota)
- chave de API do Alibaba Cloud Model Studio
- provedores de terceiros integrados, entre eles OpenRouter e ModelScope
- provedor customizado
Dados e privacidade: o ponto que trava adoção em empresa
Essa é a objeção número um sobre IA chinesa, e ela merece resposta honesta em vez de "relaxa que tá tudo bem"
O que dá pra afirmar: ao usar chave de API do Alibaba Cloud, valem os Termos de Serviço e o Aviso de Privacidade da Alibaba Cloud quanto a uso, retenção e privacidade dos dados
Ou seja, quem define a regra do jogo é o contrato da Alibaba Cloud, e é ele que o teu jurídico vai ler
Outro dado que costuma pesar na conversa: a operação internacional do Alibaba Cloud é registrada e sediada em Singapura
Agora, se o teu bloqueio é duro, do tipo "esse dado não sai da nossa infra", nenhum termo de serviço resolve
A saída nesse caso é uma só: modelo de pesos abertos rodando local
É exatamente pra isso que o Qwen3.6-27B em Apache 2.0 existe no cardápio, ele te dá o nome Qwen sem mandar o dado pra lugar nenhum
Conclusão
Então, Qwen vale a pena?
O veredito muda por perfil, e é assim que tem que ser:
- Processa base enorme de texto: vale muito olhar, 1M de contexto com cache a US$ 0,25 por milhão é argumento de peso
- Precisa de velocidade em fluxo interativo: pensa duas vezes, 46,5 t/s contra mediana de 72,0 t/s incomoda
- Precisa de modelo aberto e local: o caminho é o Qwen3.6-27B em Apache 2.0, não o topo de linha
- Precisa de licença nomeada pro Max: espera, porque ela não foi publicada
O próximo passo mais barato é óbvio e quase ninguém faz: abre o Qwen Chat gratuito e roda as tuas tarefas reais lá antes de mexer em uma linha de código
Se o bloqueio for dado sensível, sobe o Qwen3.6-27B local com o ollama run qwen3.6:27b e resolve na sua máquina
E deixa esses dois itens como critério pra decidir se troca agora ou espera: os pesos do Qwen3.8-Max no Hugging Face e no ModelScope, que foram prometidos mas não estavam disponíveis no anúncio, e a licença, que segue sem nome
Quando esses dois saírem, a conversa muda de figura…
até o próximo post! 😀
Perguntas frequentes
O Qwen3.8-Max já tem pesos abertos pra baixar?
Ainda não. A Alibaba anunciou que vai liberar os pesos no Hugging Face e no ModelScope, mas eles não estavam disponíveis na data do anúncio (3 de agosto de 2026), e nenhuma licença foi nomeada pro modelo até esse momento.
Dá pra usar o Qwen de graça?
Sim, pelo Qwen Chat (chat.qwen.ai), com conta gratuita e limite de requisições. Já a API da Alibaba Cloud é paga por token, e o nível gratuito de autenticação por Qwen OAuth no Qwen Code foi descontinuado em 15 de abril de 2026.
Quanto custa usar o Qwen3.8-Max pela API?
US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída. A leitura de entrada em cache sai por US$ 0,25 por milhão, sem sobretaxa mesmo em contexto longo.
O que mudou do Qwen3.7-Max pro Qwen3.8-Max?
O índice de inteligência da Artificial Analysis subiu de 46 pra 53, e o preço caiu: de US$ 2,50 pra US$ 2,00 na entrada e de US$ 7,50 pra US$ 6,00 na saída. Os dois mantêm janela de contexto de 1M tokens.
Como faço login no Qwen Code hoje, já que o OAuth gratuito acabou?
As opções atuais são o Alibaba Cloud Coding Plan (assinatura com cota), chave de API do Alibaba Cloud Model Studio, provedores de terceiros integrados como OpenRouter e ModelScope, ou um provedor customizado.
Dá pra rodar o Qwen localmente, sem depender de API?
Dá, mas não com o Max. O Qwen3.6-27B é de pesos abertos sob licença Apache 2.0 e roda via Ollama com ollama run qwen3.6:27b, exigindo cerca de 17 GB de VRAM na quantização Q4_K_M.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

As diferenças de var, let e const

Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]

ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]
