Vale a pena rodar o Qwen no seu computador? Quando o modelo local compensa
Rodar o Qwen local compensa em três situações: dado sensível que não pode sair da máquina, trabalho offline e automação própria consumindo a API do Ollama em http://localhost:11434. Os pesos abertos do Qwen3.6 saem sob Apache 2.0, então dá pra baixar sem pedir licença a ninguém: a variante densa qwen3.6:27b pesa 17 GB e a MoE qwen3.6:35b-a3b pesa 24 GB, as duas com janela de 256K. Já se você só quer conversar com um modelo, o chat.qwen.ai oficial é gratuito e ainda traz imagem, vídeo, documentos e busca na web
Rodar um modelo forte dentro do seu próprio computador é uma daquelas promessas que soam boas demais: nada sai da sua máquina, ninguém te cobra por uso, e o modelo continua lá mesmo com a internet caindo
O Qwen é a família de modelos do time Qwen, do Alibaba Group, e as variantes de peso aberto do Qwen3.6 vêm sob licença Apache 2.0
Ou seja: os pesos estão abertos, você baixa e roda sem pedir autorização pra ninguém
Só que "dá pra rodar" e "compensa rodar" são coisas bem diferentes, beleza?
Este post é sobre a DECISÃO: quando o Qwen local paga o esforço, quando a versão online resolve melhor e como você testa isso na sua própria máquina 🙂
O que é o Qwen e por que existe uma versão que roda offline
O Qwen3.6 é desenvolvido pelo time Qwen, do Alibaba Group, e mora no repositório oficial QwenLM/Qwen3.6
A primeira variante aberta da série, o Qwen3.6-35B-A3B, foi publicada no Hugging Face Hub e no ModelScope em 16/04/2026
Depois veio o Qwen3.6-27B, também no Hugging Face Hub e no ModelScope, em 22/04/2026
E o que significa "peso aberto" na prática?
Peso é o arquivo do modelo, o miolo mesmo
Os modelos de peso aberto do Qwen3.6 usam licença Apache 2.0, e é isso que muda o jogo: o arquivo fica disponível pra download, você guarda no seu disco e executa localmente
Se você já mexeu com biblioteca open source no dia a dia, é a mesma sensação: baixou, é seu, roda quando quiser
Sem esse tipo de licença, "rodar local" simplesmente não existiria como opção
As gerações anteriores continuam por aí
Um detalhe que muita gente ignora: o Qwen3.5 e o Qwen3 seguem disponíveis, em várias contagens de parâmetros
Isso amplia MUITO o leque, porque a escolha deixa de ser "cabe ou não cabe o modelo top de linha" e vira "qual degrau da escada cabe aqui"
Volto nisso na segunda tabela 😀
Qwen local x Qwen online: o que muda na prática
Do outro lado do local existe a versão online oficial, mantida pela própria Qwen: o chat.qwen.ai, também chamado de Qwen Studio, um assistente gratuito e aberto a todos
A comparação honesta é essa:
| Critério | Qwen local (Ollama ou LM Studio) | Qwen online oficial (chat.qwen.ai) |
|---|---|---|
| Onde o processamento acontece | Na sua máquina, o modelo está no seu disco e executa aí | No serviço da Qwen, você acessa pelo navegador |
| Custo de uso | Você não paga por uso, o custo é a sua máquina e o espaço em disco | Assistente gratuito e aberto a todos |
| O que entrega | Texto do modelo que você baixou, e só | Chat, entendimento de imagem e vídeo, geração de imagem, processamento de documentos, busca na web, uso de ferramentas e artifacts |
| Espaço em disco | 17 GB na variante densa do Qwen3.6, 24 GB na MoE | Zero, nada fica no seu computador |
| Sem internet | Depois do download, funciona offline | Precisa de conexão, é um serviço web |
| Plugar em outra ferramenta | O Ollama expõe uma API na própria máquina, em http://localhost:11434 | Você usa pela interface do Qwen Studio |
Repara que a linha mais decisiva não é custo, é a terceira
O online oficial vem completão: imagem, vídeo, documento, busca na web, ferramentas
O local entrega o que o arquivo que você baixou sabe fazer, e nada além disso
Qual variante do Qwen cabe no seu computador
Aqui vale a regra mais chata e mais útil de todas: a decisão começa pelo tamanho do arquivo
Não é o único fator, mas é o primeiro filtro, porque um download de 24 GB é um compromisso de verdade com o seu SSD
| Modelo (tag no Ollama) | Download | Observação |
|---|---|---|
qwen3.6:27b | 17 GB | Variante densa da série 3.6, janela de contexto de 256K |
qwen3.6:35b-a3b | 24 GB | Variante MoE da série 3.6, janela de contexto de 256K |
qwen3.5:4b | 3,4 GB | Degrau baixo da geração anterior |
qwen3.5:9b | 6,6 GB | Meio termo do Qwen3.5 |
qwen3.5:27b | 17 GB | Mesmo peso de download da densa 3.6 |
qwen3:0.6b | 523 MB | O menorzinho da família Qwen3 |
qwen3:4b | 2,5 GB | Bom ponto de partida pra teste |
qwen3:14b | 9,3 GB | Degrau intermediário do Qwen3 |
qwen3:32b | 20 GB | Topo prático do Qwen3 fora do 235b |
A escada do Qwen3.5 vai de 0.8b a 122b (0.8b, 2b, 4b, 9b, 27b, 35b e 122b) e a do Qwen3 vai de 0.6b a 235b (0.6b, 1.7b, 4b, 8b, 14b, 30b, 32b e 235b)
O recado é simples: existe versão pequena o bastante pra quase qualquer máquina
O que muda não é a possibilidade de rodar, é o que aquele arquivo entrega quando você pede uma tarefa séria
E o conforto de rodar varia de máquina pra máquina, então a régua honesta é a prática: começa por um arquivo pequeno e sobe um degrau por vez 😛
Ollama ou LM Studio: como escolher a porta de entrada
São os dois caminhos mais diretos pra colocar um modelo aberto pra rodar aí
Um é terminal, o outro é janela com botão
| Critério | Ollama | LM Studio | |
|---|---|---|---|
| Como você usa | Linha de comando | Aplicativo com interface gráfica | |
| Instalação | `curl -fsSL https://ollama.com/install.sh \ | sh no macOS e Linux, ou o OllamaSetup.exe` no Windows, sem exigir privilégio de Administrador | Aplicativo pra baixar e instalar |
| Sistemas | macOS, Linux e Windows (no Windows o comando ollama fica disponível no cmd, PowerShell ou outro terminal) | macOS com M1/M2/M3/M4, Windows x86 ou ARM, e Linux x86 com processador que suporte AVX2 | |
| Modelos | Biblioteca oficial com qwen3.6:27b e qwen3.6:35b-a3b prontos | Modelos do Hugging Face em GGUF (llama.cpp) e em MLX (só Mac), rodando com llama.cpp e MLX por baixo | |
| Plugar em outra coisa | API servida em http://localhost:11434 | CLI lms e Core SDK disponíveis | |
| Aberto? | Projeto público no repositório do Ollama | A CLI lms, o Core SDK e o motor de inferência MLX são open source sob MIT | |
| Perfil de quem usa | Quem vive no terminal e quer automatizar | Quem quer clicar, testar modelo e comparar sem decorar comando |
Se o seu plano é ligar o modelo em alguma coisa que você mesmo escreve, o Ollama já nasce pronto pra isso pela API local
Se o seu plano é experimentar modelos e sentir a diferença entre eles, o LM Studio é a porta mais gentil: roda LLMs locais de forma privada e gratuita, sem terminal
Quando rodar o Qwen local realmente compensa (e quando não)
Código e documento que não podem sair da máquina
Esse é o caso mais forte, e o mais fácil de defender
Se você mexe com contrato, base de cliente ou código de projeto fechado, o processamento local resolve a pergunta "pra onde isso vai" de um jeito que nenhuma política escrita resolve: não vai pra lugar nenhum, tá rodando aí
Trabalho offline ou com internet capenga
Depois que o arquivo tá no disco, acabou a dependência de conexão
Avião, coworking com wi-fi de mentira, casa de praia com 3G, tanto faz
Uso repetitivo, em volume
Se você roda a mesma tarefa cem vezes por dia (classificar, resumir, padronizar texto), a previsibilidade importa mais que a esperteza do modelo
O local não muda de comportamento porque um serviço atualizou algo do outro lado: o arquivo é o mesmo que você baixou
Automação própria consumindo a API local
Aqui mora o argumento mais massa: o Ollama expõe a API em http://localhost:11434, então o seu script, o seu job noturno, a sua ferramentinha interna conversam com o modelo direto
É o mesmo tipo de decisão de arquitetura que aparece quando você escolhe entre skills e MCP num agente: não é qual é mais bonito, é qual encaixa no fluxo que você já tem
Quando NÃO compensa
Uso esporádico: se você abre uma vez por semana pra tirar uma dúvida, baixar 17 GB é overkill
Necessidade de imagem, vídeo, documento ou busca na web: o chat.qwen.ai já entrega tudo isso de graça, e o modelo local que você baixou entrega só o texto daquele arquivo, nada além
Máquina sem espaço: 17 GB ou 24 GB parados no SSD não é detalhe, é decisão
Como testar o Qwen local antes de decidir
A parte honesta é essa: em vez de acreditar em mim, roda aí e tira sua conclusão
O caminho mínimo é curto
- Instale o Ollama. No macOS e no Linux é o script oficial
curl -fsSL https://ollama.com/install.sh | shNo Windows, o caminho é o instalador OllamaSetup.exe, que instala na conta do usuário sem exigir Administrador. Depois disso o comando ollama fica disponível no cmd, no PowerShell ou em outro terminal
Erro comum deste passo: abrir o terminal que já estava aberto ANTES da instalação e achar que o comando não existe. Fecha e abre de novo
- Baixe um modelo PEQUENO primeiro
ollama pull qwen3:4bSão 2,5 GB, não 17 GB
Erro comum deste passo: ir direto no modelo grande, comprometer 24 GB de disco e só depois descobrir que a máquina não te agrada nessa faixa
- Rode e converse com ele
ollama run qwen3:4bErro comum deste passo: esperar do modelo pequeno o resultado do grande. Um 0.6b de 523 MB e um 27b de 17 GB não jogam o mesmo campeonato, e comparar os dois com a mesma régua só gera frustração
- Veja o que está instalado e o que está rodando
ollama list
ollama psO ollama list mostra o que já ocupa disco, o ollama ps mostra o que está em execução agora
Erro comum deste passo: achar que baixou "o Qwen" uma vez. Cada tag é um arquivo separado, então qwen3:4b e qwen3.6:27b são dois downloads e dois espaços em disco
- Faça a comparação que interessa: pegue uma tarefa REAL sua e rode no modelo local e no chat.qwen.ai
Não é teste de vestibular, é o seu trabalho de terça-feira
Erro comum deste passo: testar com pergunta genérica de curiosidade. Isso não te diz nada sobre o seu uso
- Limpe o que não serviu e suba o serviço quando precisar
ollama rm qwen3:4b
ollama serveO ollama rm devolve o espaço, o ollama serve sobe o serviço
Erro comum deste passo: acumular cinco variantes "pra testar depois" e ver o SSD sumindo sem entender por quê
Veredito: para quem o Qwen local vale o esforço
Sem ficar em cima do muro
Se você só quer conversar com um modelo bom: a versão online oficial resolve melhor, é gratuita, aberta a todos e vem com chat, imagem, vídeo, documento, busca na web e artifacts. Baixar 17 GB pra ter menos recursos não faz sentido nenhum
Se o seu dado não pode sair da máquina, ou você trabalha offline: aí o local ganha, e ganha fácil. Não tem substituto
Se você constrói alguma coisa em cima: o argumento real é a soma de licença Apache 2.0 nos pesos abertos com a API local em http://localhost:11434. Você tem o arquivo, tem o endpoint, e ninguém muda as regras embaixo do seu pé
Velocidade e conforto dependem do hardware que tá na sua mesa, e isso só o seu teste responde
É justamente por isso que o roteiro acima começa por um modelo de 2,5 GB, e não pelo maior da lista 😀
Próximo passo
A régua é essa: privacidade, offline e integração puxam pro local; conveniência e recursos extras puxam pro online
O tamanho do arquivo é o primeiro filtro, o seu caso de uso é o segundo
O movimento concreto é baixar um modelo pequeno pelo Ollama, jogar a mesma tarefa nele e no chat.qwen.ai e comparar com os seus olhos
Se o seu terreno é código, vale olhar também o Qwen Code, o agente de código open-source oficial da Qwen, que é outra conversa e merece post próprio
E se você já organiza seu fluxo com agente, a lógica de quando usar skills, rules ou workflows ajuda a decidir onde o modelo local encaixa sem virar gambiarra
Me conta nos comentários: qual é o SEU caso de uso? Privacidade, offline, volume ou só curiosidade mesmo?
até o próximo post!
Perguntas frequentes
O Qwen local continua funcionando sem internet depois de baixado?
Sim. Depois que o modelo é baixado pelo Ollama ou pelo LM Studio, ele fica no seu disco e roda offline, sem depender de conexão. Isso é justamente o que diferencia essa rota do chat.qwen.ai, que é um serviço web e precisa de internet pra funcionar.
Preciso pagar alguma licença pra usar o Qwen3.6 no meu computador?
Não. Os modelos de peso aberto do Qwen3.6 usam licença Apache 2.0, então você baixa e roda sem pedir autorização nem pagar por isso. O custo real é outro: espaço em disco e a capacidade da sua máquina de rodar o modelo.
Qual a diferença entre a variante densa e a MoE do Qwen3.6?
A densa é o qwen3.6:27b, com 17 GB de download, e a MoE é o qwen3.6:35b-a3b, com 24 GB. Ambas têm janela de contexto de 256K no Ollama, então a escolha entre elas passa mais pelo espaço em disco disponível do que pela janela de contexto.
Dá pra usar o Qwen rodando local em outra ferramenta, além do terminal?
Dá. O Ollama expõe uma API na própria máquina, em http://localhost:11434, e é por aí que outras ferramentas conversam com o modelo que você baixou. O LM Studio, por sua vez, disponibiliza a CLI lms e o Core SDK pra quem quer integrar de outro jeito.
O Qwen Code precisa do Qwen local pra funcionar?
O Qwen Code é o agente de código open-source oficial publicado pela Qwen, e é um projeto separado da conversa de rodar modelo local. São coisas diferentes: o Qwen Code é o agente de código, enquanto Ollama e LM Studio são as portas de entrada pra executar os pesos abertos do Qwen na sua máquina.
Qual o menor modelo Qwen pra testar sem ocupar muito espaço em disco?
O qwen3:0.6b, com 523 MB, é o menorzinho de toda a família e serve bem pra um primeiro teste rápido no Ollama. Se quiser algo um pouco mais robusto sem sair do território pequeno, o qwen3:4b, com 2,5 GB, é outra opção que cabe em quase qualquer máquina.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

As diferenças de var, let e const

Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]

ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]
