Qwen para programar: dá para usar como assistente de código?
Qwen para programar hoje é duas coisas diferentes: o modelo Qwen3-Coder-Next (MoE de 80 bilhões de parâmetros totais com 3 bilhões ativos por token, contexto nativo de 256K, licença Apache 2.0) e o Qwen Code, agente de terminal open source adaptado do Google Gemini CLI. Dá pra usar como assistente de código sim, via OpenRouter (US$ 0,11 por milhão de tokens de entrada e US$ 0,80 de saída), Coding Plan da Alibaba, Amazon Bedrock ou Ollama local. O nível gratuito hospedado acabou em 15 de abril de 2026. Vale como segundo assistente por custo e por rodar na sua máquina, não como troca automática do principal
Fala aí, beleza? Em 4 de fevereiro de 2026 a equipe Qwen (Alibaba) soltou o Qwen3-Coder-Next, o modelo da linha voltado pra agentes de programação e desenvolvimento local
E ele chega num cenário bem específico: quase todo dev que leva IA a sério já tem UM assistente de código rodando, então a pergunta deixou de ser "qual eu adoto" e virou "vale a pena ter um segundo?"
Só que aí mora a confusão
Usar Qwen para programar pode significar três decisões diferentes: trocar de modelo, trocar de ferramenta ou simplesmente trocar de conta de custo
Bora separar isso, porque a decisão muda completamente dependendo do que você está tentando resolver
Qwen3-Coder-Next e Qwen Code: modelo e ferramenta são coisas diferentes
Primeiro o modelo
O Qwen3-Coder-Next é um Mixture-of-Experts com 80 bilhões de parâmetros totais e apenas 3 bilhões ativados por token
Se você nunca mexeu com MoE, a analogia de aproximação é simples: em vez de acordar o modelo inteiro a cada token, ele acorda só o pedaço especialista que precisa naquele momento
A janela de contexto nativa é de 256K tokens e os pesos saem sob licença Apache 2.0, ou seja, pesos abertos de verdade
E ele não é filho único: a linha Qwen3-Coder tem também o Qwen3-Coder-480B-A35B-Instruct e o Qwen3-Coder-30B-A3B-Instruct publicados no Hugging Face e no Amazon Bedrock
Agora a ferramenta
O QwenLM/qwen-code é um agente de código open source que roda no terminal, mantido pela própria equipe Qwen
E tem um detalhe honesto na origem dele: o Qwen Code é adaptado do Google Gemini CLI v0.8.2, com adaptações em nível de parser pros modelos Qwen-Coder
Aqui está o ponto que trava muita gente na hora de decidir
O CLI aceita outros modelos além do Qwen, e o modelo roda fora do CLI numa boa
Dá pra usar o Qwen Code apontando pra OpenAI, Anthropic, Google, Azure OpenAI, OpenRouter, Requesty, ModelScope ou pra um endpoint local tipo Ollama ou vLLM
Só presta atenção em COMO isso aparece na tela, porque é aqui que a documentação confunde: o menu /auth mostra três opções de nível superior (Alibaba ModelStudio, Third-party Providers e Custom Provider), e os únicos nomes que vêm listados dentro de Third-party Providers são ModelScope, DeepSeek, MiniMax, OpenRouter e Requesty
Todo o resto (OpenAI, Anthropic, Google, Azure OpenAI e os endpoints locais tipo Ollama e vLLM) entra pelo Custom Provider, configurado por API compatível com OpenAI
E dá pra usar o Qwen3-Coder-Next dentro de outra ferramenta qualquer que fale API compatível com OpenAI
São duas escolhas independentes, beleza? Vale lembrar também que a linha Qwen é bem maior que código, tem modelo pra outras frentes como a edição de imagem da linha Qwen, então não confunda um lançamento com o outro
Formas de acessar o Qwen para programar e quanto custa cada uma
Essa é a parte que ninguém organiza direito, então segue a tabela com as vias verificadas e o que cada uma cobra ou limita:
| Via de acesso | O que é | Custo ou limite verificado |
|---|---|---|
| OpenRouter | API por token | US$ 0,11 por milhão de tokens de entrada e US$ 0,80 por milhão de saída |
| Coding Plan (Alibaba Cloud Model Studio) | Assinatura mensal de valor fixo no lugar da cobrança por token, usável em ferramentas de código populares | Plano Pro suporta no máximo 90.000 requisições/mês. Plano Lite sem novas assinaturas desde 20/03/2026 e sem renovação ou upgrade desde 13/04/2026 |
| Amazon Bedrock | Modelo gerenciado na nuvem da AWS | ID do modelo qwen.qwen3-coder-next, pelas APIs bedrock-runtime e Converse |
| Ollama (local) | Roda na sua máquina | ollama run qwen3-coder-next, tags latest e q4_K_M com 52GB e q8_0 com 85GB, contexto de 256K |
| ModelScope (provedor terceiro) | Camada gratuita dentro do Qwen Code | 2.000 chamadas/dia, apenas para China continental |
Sobre o plano Lite: quem já é assinante usa até expirar e depois migra pro Pro
E tem uma mudança que você precisa saber ANTES de montar qualquer fluxo em cima disso
O nível gratuito hospedado acabou
O acesso gratuito de inferência via Qwen OAuth foi descontinuado
A cota caiu de 1.000 pra 100 requisições por dia e foi encerrada em 15 de abril de 2026, sem substituto gratuito anunciado
A cobertura independente do caso registrou os caminhos indicados depois disso: Alibaba Cloud Coding Plan, OpenRouter, Fireworks AI ou chave própria
Tome cuidado com conteúdo antigo circulando por aí prometendo "2.000 chamadas grátis por dia" no Qwen Code: hoje essa gratuidade existe pelo ModelScope e é restrita à China continental
O que continua gratuito é o CLI em si, que segue open source 🙂
Em que tipo de tarefa de código o Qwen se encaixa
Os encaixes saem direto do que o modelo e a ferramenta são:
- Agente de terminal em base grande: contexto nativo de 256K é bastante espaço pra jogar arquivo, log e histórico de mudança na mesma sessão
- Código que não pode sair da rede: com
ollama run qwen3-coder-nexta inferência acontece na sua máquina ou no seu servidor, o que resolve o caso do repositório que a empresa não deixa subir pra API de terceiro - Tarefa de volume com custo por token baixo: US$ 0,11 de entrada e US$ 0,80 de saída por milhão via OpenRouter muda a conta de coisa repetitiva (varredura, refactor mecânico, geração de teste em série)
- Integração corporativa: quem já vive dentro da AWS pega o modelo gerenciado no Bedrock pelo ID
qwen.qwen3-coder-next, sem provisionar GPU - Segundo assistente ao lado do principal: você mantém o caro pro que é difícil e joga o barato no resto
Esse último ponto é o mesmo raciocínio de quem coloca IA dentro de fluxo pra escalar automações sem código: o que manda na viabilidade não é o hype do modelo, é o custo por chamada multiplicado pelo volume
E onde ele NÃO é a aposta óbvia
Aqui vale a honestidade, e ela vem da própria Qwen
A equipe reconhece limitações do Qwen3-Coder-Next frente aos modelos proprietários de fronteira, por conta da pegada menor de computação ativa e de treino
É um trade-off assumido: eficiência de deploy em troca de capacidade
Então pra tarefa de raciocínio pesado, aquela arquitetura chata que exige o modelo segurar dez fios ao mesmo tempo, essa troca pesa contra
E atenção no caminho local: as tags do Ollama pedem 52GB (q4_K_M) ou 85GB (q8_0), não é qualquer notebook que aguenta o tranco
Como instalar o Qwen Code e apontar para um provedor
Passo a passo curto, só com o que está documentado:
- Instale via npm (o requisito é Node.js 22+):
npm install -g @qwen-code/qwen-code@latestO erro comum deste passo é rodar em Node antigo: confira sua versão antes, porque o requisito é 22 pra cima
- No macOS e no Linux, a alternativa é o Homebrew:
brew install qwen-code- Abra a interface interativa no terminal:
qwen- Na primeira execução, escolha a autenticação no menu
/auth, que oferece três opções de nível superior: Alibaba ModelStudio (Coding Plan, Token Plan ou API Key), Third-party Providers (ModelScope, DeepSeek, MiniMax, OpenRouter, Requesty) e Custom Provider
Repara que esses são os nomes que o menu lista: provedor que não aparece ali dentro, incluindo endpoint local, é o caso do Custom Provider, configurado pela API compatível com OpenAI do passo seguinte
- Se você vai por API compatível com OpenAI, configure as três variáveis, em variável de ambiente ou no arquivo
.envdo projeto:
OPENAI_API_KEY=sua_chave
OPENAI_BASE_URL=url_do_provedor
OPENAI_MODEL=modelo_escolhido- A configuração fica no arquivo
~/.qwen/settings.json
E esse é o erro comum que faz gente perder tarde inteira: o campo envKey aponta o NOME da variável de ambiente, não a chave em si
Se você colar a API key ali, não é isso que ele espera
- Caminho local: se o servidor de inferência não sobe, a documentação do modelo orienta reduzir o context length pra um valor menor, por exemplo 32768
Faz sentido: 256K de contexto é lindo no papel e brutal na memória
Veredito: quando vale adotar o Qwen como segundo assistente
Juntando tudo, olha como fica a balança
O que pesa a favor:
- Pesos abertos sob Apache 2.0, o que libera rodar onde você quiser
- 70,6 no SWE-Bench Verified usando o scaffold SWE-Agent, segundo o anúncio oficial da Qwen
- Preço por token baixo na via OpenRouter
- Troca de modelo em tempo de execução no CLI, com OpenAI, Anthropic, Google, Azure OpenAI, OpenRouter, Requesty, ModelScope e endpoints locais como Ollama e vLLM (os que não vêm nomeados no menu
/authentram pelo Custom Provider)
O que pesa contra:
- A limitação assumida pela própria Qwen frente aos modelos de fronteira
- O fim do nível gratuito hospedado em 15 de abril de 2026
- O plano Lite do Coding Plan encerrado pra novas assinaturas e pra renovação
- A gratuidade do ModelScope existir só pra China continental
Quem ganha com a troca: time com restrição de dados que precisa de inferência dentro de casa, quem tem volume alto de tarefa mecânica e sente o custo por token, e quem quer um agente de terminal que aceita trocar de provedor sem trocar de ferramenta
Quem não ganha: quem espera substituir o assistente principal em raciocínio difícil, e quem está atrás de opção gratuita e estável, porque essa porta fechou
Conclusão
Usar Qwen para programar não é uma decisão só, são três: o modelo, o agente de terminal e a via de acesso que você vai pagar
O Qwen3-Coder-Next é MoE de 80B totais com 3B ativos, contexto de 256K e Apache 2.0
O Qwen Code é o agente open source de terminal, adaptado do Gemini CLI v0.8.2, e ele aceita provedor de fora e endpoint local
Próximo passo prático: instala o CLI, aponta pra uma chave própria ou pra um provedor barato e roda UMA tarefa real de baixo risco antes de mover qualquer fluxo principal
E fica de olho no repositório oficial github.com/QwenLM/qwen-code pras mudanças de acesso, porque elas já mudaram uma vez e podem mudar de novo…
Até o próximo post! 😀
Perguntas frequentes
O Qwen Code é gratuito para usar em 2026?
O CLI em si continua open source e gratuito para instalar e rodar. O que acabou foi o nível gratuito hospedado via Qwen OAuth, com a cota caindo de 1.000 para 100 requisições por dia até ser encerrada em 15 de abril de 2026. Hoje, sem chave própria, a única via gratuita restante é o ModelScope, com 2.000 chamadas por dia restritas à China continental.
Como instalar o Qwen Code no terminal?
Via npm, o comando é npm install -g @qwen-code/qwen-code@latest, exigindo Node.js 22 ou superior. Em macOS ou Linux também dá para instalar pelo Homebrew com brew install qwen-code. Depois de instalado, o comando qwen abre a interface interativa no terminal.
Dá para rodar o Qwen3-Coder-Next localmente, sem depender de API?
Sim, o modelo está na biblioteca oficial do Ollama e sobe com ollama run qwen3-coder-next. A tag q4_K_M ocupa 52GB e a q8_0 ocupa 85GB, ambas mantendo o contexto de 256K. Se o servidor de inferência não subir, a orientação é reduzir o context length para um valor menor, como 32768.
O Qwen Code funciona só com modelos da Qwen ou aceita outros, como Claude e GPT?
O Qwen Code aceita outros provedores além da própria Qwen, já que suporta OpenAI, Anthropic, Google, Azure OpenAI, OpenRouter, Requesty, ModelScope e endpoints locais como Ollama e vLLM. Na tela, porém, o menu /auth traz três opções de nível superior: Alibaba ModelStudio, Third-party Providers (onde vêm nomeados ModelScope, DeepSeek, MiniMax, OpenRouter e Requesty) e Custom Provider, que é por onde entram os demais, configurados via API compatível com OpenAI. Ou seja, escolher a ferramenta e escolher o modelo são decisões independentes.
Quanto custa usar o Qwen3-Coder-Next pago, fora dos planos de assinatura?
Via OpenRouter, o preço é de US$ 0,11 por milhão de tokens de entrada e US$ 0,80 por milhão de tokens de saída. Já quem prefere assinatura fixa tem o Coding Plan da Alibaba Cloud Model Studio, cujo plano Pro suporta no máximo 90.000 requisições por mês. O plano Lite, mais barato, parou de aceitar novas assinaturas em 20 de março de 2026 e parou renovação e upgrade em 13 de abril de 2026.
O Qwen3-Coder-Next é melhor que os modelos de código proprietários?
Não segundo a própria Qwen, que reconhece limitações frente aos modelos proprietários de fronteira por causa da pegada menor de computação ativa e de treino. O modelo pontuou 70,6 no SWE-Bench Verified com o scaffold SWE-Agent, o que é uma marca acima de 70%, mas o trade-off assumido é eficiência de deploy em troca de capacidade. Por isso ele tende a encaixar melhor como segundo assistente de custo baixo do que como substituto único em tarefa de raciocínio pesado.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

As diferenças de var, let e const

Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]

ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]
