Qwen vale a pena? Análise honesta da IA chinesa do Alibaba

Qwen vale a pena, análise dos números do Qwen3-Max da Alibaba
Resposta rápida

Qwen vale a pena? Depende do seu perfil, e os números ajudam a decidir. O Qwen é a família de modelos da Alibaba Cloud, e o topo de linha, o Qwen3.8-Max, foi anunciado em 3 de agosto de 2026 com 2,4 trilhões de parâmetros totais (95 bilhões ativos por token), contexto de 1 milhão e entrada de texto, imagem e vídeo. Na Artificial Analysis ele marca 53 de inteligência contra mediana 32 da faixa, mas entrega 46,5 tokens por segundo contra mediana de 72,0. Custa US$ 2,00 na entrada e US$ 6,00 na saída por milhão de tokens, com cache a US$ 0,25

Toda semana pinta um modelo chinês novo prometendo virar a mesa

E aí vem a dúvida real, aquela que raramente é respondida sem enrolação: troco a IA que eu já uso ou isso é só moda?

O Qwen é a família de modelos de linguagem desenvolvida pela Alibaba Cloud, a divisão de nuvem do grupo Alibaba

Aqui a gente vai de veredito, não de hype: o que é verificável, o que é forte, o que é limitação e pra quem esse modelo faz sentido de verdade

Bora? 🙂

O que é o Qwen e o que a Alibaba lançou em agosto de 2026

O Qwen não é um modelo só, é uma linha inteira mantida pela Alibaba Cloud, com versões de tamanhos e propósitos diferentes

Se você já acompanhou as novidades do Qwen 3 em português, a lógica continua a mesma: geração nova, numeração nova, e um topo de linha chamado Max

O Qwen3.8-Max foi anunciado em 3 de agosto de 2026

O que ele traz, sem adjetivo de marketing:

  • 2,4 trilhões de parâmetros no total, com 95 bilhões ativos por token
  • arquitetura MoE (Mixture of Experts), ou seja, só uma fração dos parâmetros é acionada a cada token
  • janela de contexto de 1 milhão de tokens
  • entrada de texto, imagem e vídeo, com saída em texto

E o que é MoE, na prática?

É o modelo dividir o cérebro em especialistas e chamar só os que interessam pra aquele token

Por isso ele consegue ser gigante no total e continuar viável de servir, sem precisar de um PC da Nasa por trás de cada requisição haha

Qwen3.8-Max na prática: números contra a faixa de preço

Modelo bom no papel é fácil, difícil é bater os números contra a concorrência do mesmo preço

A tabela abaixo cruza os dados da Artificial Analysis com o preço de API, e coloca a geração anterior do lado pra você ver a evolução

ItemQwen3.8-MaxQwen3.7-MaxMediana da faixa de preço
Índice de inteligência (Artificial Analysis)534632
Velocidade de saída46,5 tokens/ssem dado72,0 tokens/s
Tempo até o primeiro token (TTFT)2,48ssem dado2,74s
Janela de contexto1M tokens1M tokenssem dado
Entrada por milhão de tokensUS$ 2,00US$ 2,50sem dado
Saída por milhão de tokensUS$ 6,00US$ 7,50sem dado
Leitura de entrada em cacheUS$ 0,25 por milhãosem dadosem dado
Parâmetros2,4T totais / 95B ativossem dadosem dado

Repara no detalhe mais interessante da tabela: a geração nova ficou MAIS inteligente (53 contra 46) e mais barata (US$ 2,00 contra US$ 2,50 na entrada)

Isso não é comum, o normal é o topo de linha novo chegar cobrando mais caro

E tem outro ponto que passa batido: a leitura de entrada em cache sai por US$ 0,25 por milhão de tokens, sem sobretaxa de contexto longo

Ou seja, encher a janela de 1M não dispara um preço diferente por token

Pontos fortes e limitações do Qwen, sem filtro

Vamos separar o joio, porque tem coisa boa e tem coisa que ainda trava decisão

O que é realmente forte:

  • inteligência de 53 no índice da Artificial Analysis contra mediana de 32 dos modelos de raciocínio da mesma faixa de preço, uma distância grande
  • contexto de 1 milhão de tokens, que abre caso de uso de base grande sem gambiarra de chunk
  • cache a US$ 0,25 por milhão, sem sobretaxa de contexto longo
  • entrada multimodal de texto, imagem e vídeo
  • geração nova mais inteligente E mais barata que a anterior
  • TTFT de 2,48s, melhor que a mediana de 2,74s da faixa

O que limita:

  • velocidade de saída de 46,5 tokens por segundo contra mediana de 72,0 t/s da faixa, ele começa a responder rápido e depois cospe devagar
  • a Alibaba anunciou que vai liberar os pesos do Qwen3.8-Max no Hugging Face e no ModelScope, mas eles não estavam disponíveis no anúncio
  • nenhuma licença foi nomeada pro Qwen3.8-Max até o momento do anúncio

Esse último ponto é o mais chato de todos

"Pesos abertos em breve" e licença não publicada não dá pra colocar em planejamento de produto comercial

Promessa não é termo jurídico, beleza? Enquanto não sai a licença nomeada, o topo de linha é um modelo de API como qualquer outro

Para quem o Qwen faz sentido (e para quem não faz)

Aqui é onde a conversa fica prática

Faz sentido pra quem processa MUITO texto

Se o teu fluxo é jogar base gigante pra dentro do modelo (documentação inteira, transcrição longa, repositório todo), a combinação de 1M de contexto com cache a US$ 0,25 por milhão de tokens é o argumento mais forte do Qwen3.8-Max

É um caso em que a saída lenta pesa pouco, porque o gargalo tá na leitura, não na escrita

Faz sentido pra quem precisa de modelo aberto de verdade

Se o requisito é rodar na sua máquina, o caminho não é o Max

O Qwen3.6-27B é de pesos abertos sob licença Apache 2.0, que permite uso comercial, modificação e redistribuição

Ele roda local via Ollama:

ollama run qwen3.6:27b

Tome cuidado com o hardware antes de sair rodando: são cerca de 17 GB de VRAM na quantização Q4_K_M

Se a sua placa não tem isso, o modelo não sobe (ou cai pra CPU e vira lesma)

Faz sentido pra quem quer agente de terminal

O Qwen Code é um agente de codificação de terminal de código aberto, mantido no repositório oficial QwenLM/qwen-code

A instalação é global via npm:

npm install -g @qwen-code/qwen-code@latest

Se você já usa agente de terminal, a curva aqui é curtinha, é o mesmo tipo de bicho

NÃO faz sentido pra quem…

  • vive em fluxo interativo, digitando e esperando resposta na hora: 46,5 t/s contra mediana de 72,0 t/s se sente no dedo
  • depende de licença fechada e nomeada pra aprovar uso comercial em cima do topo de linha, porque a licença do Qwen3.8-Max não foi publicada

Como acessar o Qwen hoje: chat, API e Qwen Code

Tem três rotas reais, e elas não custam a mesma coisa

  1. Qwen Chat, em chat.qwen.ai: acesso gratuito com conta gratuita e limite de requisições, é o jeito mais barato de formar opinião antes de mexer em código
  2. API da Alibaba Cloud: cobrada por uso, é a rota pra quem vai integrar
  3. OpenRouter: o Qwen3.8-Max está listado lá como qwen/qwen3.8-max, o que dá uma rota alternativa à API direta da Alibaba

E no Qwen Code, presta atenção nessa mudança, porque muito tutorial na internet ainda ensina o caminho velho

O nível gratuito de autenticação por Qwen OAuth foi descontinuado em 15 de abril de 2026 e não aparece mais como opção no diálogo de autenticação

Se você seguir um passo a passo antigo procurando essa opção na tela, ela simplesmente não vai estar lá

As opções atuais de autenticação são:

  • Alibaba Cloud Coding Plan (assinatura com cota)
  • chave de API do Alibaba Cloud Model Studio
  • provedores de terceiros integrados, entre eles OpenRouter e ModelScope
  • provedor customizado

Dados e privacidade: o ponto que trava adoção em empresa

Essa é a objeção número um sobre IA chinesa, e ela merece resposta honesta em vez de "relaxa que tá tudo bem"

O que dá pra afirmar: ao usar chave de API do Alibaba Cloud, valem os Termos de Serviço e o Aviso de Privacidade da Alibaba Cloud quanto a uso, retenção e privacidade dos dados

Ou seja, quem define a regra do jogo é o contrato da Alibaba Cloud, e é ele que o teu jurídico vai ler

Outro dado que costuma pesar na conversa: a operação internacional do Alibaba Cloud é registrada e sediada em Singapura

Agora, se o teu bloqueio é duro, do tipo "esse dado não sai da nossa infra", nenhum termo de serviço resolve

A saída nesse caso é uma só: modelo de pesos abertos rodando local

É exatamente pra isso que o Qwen3.6-27B em Apache 2.0 existe no cardápio, ele te dá o nome Qwen sem mandar o dado pra lugar nenhum

Conclusão

Então, Qwen vale a pena?

O veredito muda por perfil, e é assim que tem que ser:

  • Processa base enorme de texto: vale muito olhar, 1M de contexto com cache a US$ 0,25 por milhão é argumento de peso
  • Precisa de velocidade em fluxo interativo: pensa duas vezes, 46,5 t/s contra mediana de 72,0 t/s incomoda
  • Precisa de modelo aberto e local: o caminho é o Qwen3.6-27B em Apache 2.0, não o topo de linha
  • Precisa de licença nomeada pro Max: espera, porque ela não foi publicada

O próximo passo mais barato é óbvio e quase ninguém faz: abre o Qwen Chat gratuito e roda as tuas tarefas reais lá antes de mexer em uma linha de código

Se o bloqueio for dado sensível, sobe o Qwen3.6-27B local com o ollama run qwen3.6:27b e resolve na sua máquina

E deixa esses dois itens como critério pra decidir se troca agora ou espera: os pesos do Qwen3.8-Max no Hugging Face e no ModelScope, que foram prometidos mas não estavam disponíveis no anúncio, e a licença, que segue sem nome

Quando esses dois saírem, a conversa muda de figura…

até o próximo post! 😀

Perguntas frequentes

O Qwen3.8-Max já tem pesos abertos pra baixar?

Ainda não. A Alibaba anunciou que vai liberar os pesos no Hugging Face e no ModelScope, mas eles não estavam disponíveis na data do anúncio (3 de agosto de 2026), e nenhuma licença foi nomeada pro modelo até esse momento.

Dá pra usar o Qwen de graça?

Sim, pelo Qwen Chat (chat.qwen.ai), com conta gratuita e limite de requisições. Já a API da Alibaba Cloud é paga por token, e o nível gratuito de autenticação por Qwen OAuth no Qwen Code foi descontinuado em 15 de abril de 2026.

Quanto custa usar o Qwen3.8-Max pela API?

US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída. A leitura de entrada em cache sai por US$ 0,25 por milhão, sem sobretaxa mesmo em contexto longo.

O que mudou do Qwen3.7-Max pro Qwen3.8-Max?

O índice de inteligência da Artificial Analysis subiu de 46 pra 53, e o preço caiu: de US$ 2,50 pra US$ 2,00 na entrada e de US$ 7,50 pra US$ 6,00 na saída. Os dois mantêm janela de contexto de 1M tokens.

Como faço login no Qwen Code hoje, já que o OAuth gratuito acabou?

As opções atuais são o Alibaba Cloud Coding Plan (assinatura com cota), chave de API do Alibaba Cloud Model Studio, provedores de terceiros integrados como OpenRouter e ModelScope, ou um provedor customizado.

Dá pra rodar o Qwen localmente, sem depender de API?

Dá, mas não com o Max. O Qwen3.6-27B é de pesos abertos sob licença Apache 2.0 e roda via Ollama com ollama run qwen3.6:27b, exigindo cerca de 17 GB de VRAM na quantização Q4_K_M.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares