Como rodar o DeepSeek V4 no Ollama: o passo a passo e o que checar antes de tentar

Rodar o DeepSeek V4 no Ollama hoje é experiência cloud: na biblioteca oficial só existem tags terminadas em -cloud (deepseek-v4-flash:cloud, deepseek-v4-flash:0731-cloud e deepseek-v4-pro:cloud). Tag cloud não baixa peso nenhum pro seu disco, a inferência acontece nos servidores do Ollama e exige login com ollama signin. O caminho real é: signin, ollama pull da tag cloud e uso normal via CLI ou pela API local em http://localhost:11434/api/chat. Se offline for requisito de verdade, o peso local documentado sai pelo llama.cpp com os GGUF da Unsloth (103 GB na versão de 3 bits, rodando com 110 GB de RAM)
Todo mundo que leu "DeepSeek V4 open source" já abriu o terminal pensando em baixar o bicho e rodar offline no fim de semana
Aí você digita o ollama pull e descobre que a história é um pouco diferente do que o hype vendeu 😅
Neste post eu te mostro o caminho que REALMENTE funciona hoje pra usar o DeepSeek V4 no Ollama, o que checar antes de rodar o primeiro comando, os erros que aparecem no meio do caminho e o plano B pra quem quer peso local de verdade e descobriu que a máquina não dá conta
O DeepSeek V4 em vídeo
Pra começar do zero e entender o que é a família V4 antes de sujar as mãos no terminal, este vídeo do canal apresenta o modelo e o contexto do lançamento
Depois do vídeo, se liga: o passo a passo escrito continua logo abaixo, com os comandos na ordem certa
O que checar antes de tentar rodar o DeepSeek V4
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Antes do primeiro comando, quatro checagens que economizam uma tarde inteira de frustração
1) Ollama instalado e funcionando
Óbvio? É, mas é o passo que todo mundo pula e depois culpa o modelo 🙂
2) Conta no ollama.com criada
Essa é a pegadinha do tema
Na biblioteca oficial do Ollama, o DeepSeek V4 Flash aparece com 2 tags, deepseek-v4-flash:cloud e deepseek-v4-flash:0731-cloud
As duas terminam em -cloud
O V4 Pro segue a mesma lógica: deepseek-v4-pro:cloud, com os marcadores tools, thinking e cloud
Nenhuma tag de peso local na biblioteca oficial
3) Entender que aqui "pull" não é download de peso
Que história é essa de tag cloud?
Segundo a documentação do Ollama, modelos cloud usam a computação de inferência do próprio ollama.com e exigem login
Ou seja: o peso NÃO desce pro seu disco, o processamento acontece do lado de lá e o seu terminal é só a ponta do cabo
Isso muda tudo na hora de responder "então eu tô rodando local?"
4) A régua de hardware, pra quem sonha com o peso local
Se o seu plano era baixar o modelo inteiro e nunca mais depender de internet, olha os números que estão na mesa
O V4 Flash é um Mixture-of-Experts com 284 bilhões de parâmetros totais, 13 bilhões ativados e janela de contexto de 1 milhão de tokens
O repositório oficial no Hugging Face tem 166,9 GB em safetensors distribuídos em 48 arquivos, com licença MIT
Já nas versões quantizadas GGUF da Unsloth, o arquivo de 8 bits tem 162 GB e o de 3 bits tem 103 GB, sendo que o de 3 bits roda numa máquina com 110 GB de RAM
Então sim: PC da Nasa, e olhe lá
Se você quer entender melhor as opções de execução na sua máquina antes de decidir, vale passar por este guia sobre rodar o DeepSeek localmente
E tem mais um detalhe que ajuda a calibrar expectativa: a própria página do Ollama classifica o consumo dos dois em faixas diferentes, o V4 Flash como uso medium e o V4 Pro como uso extra high
Passo a passo: rodando o DeepSeek V4 no Ollama
Agora sim, mão na massa
- Faça login na sua conta com
ollama signin
ollama signin
O comando abre o navegador pra você confirmar a conta
Tá numa máquina sem interface gráfica (servidor, VPS, container)? Ele imprime a URL de confirmação no terminal, aí é só abrir de outro lugar
O erro comum deste passo: pular ele
Como tag cloud exige conta no ollama.com, tentar usar o modelo deslogado é o clássico "não funciona e eu não sei por quê"
- Puxe a tag cloud do modelo
ollama pull deepseek-v4-flash:cloud
Se você quer a versão datada ou o topo de linha, é o mesmo padrão:
ollama pull deepseek-v4-flash:0731-cloud
ollama pull deepseek-v4-pro:cloud
O erro comum deste passo: achar que esse pull encheu o seu SSD
Não encheu
Modelo cloud não baixa peso pro disco, a inferência fica no servidor do Ollama
Se você foi conferir o espaço livre esperando ver 100 e tantos GB a menos, pode relaxar 😀
- Use normalmente, por CLI ou pela API local
O padrão documentado é usar os comandos normais depois do pull, via CLI ou via API local:
ollama run deepseek-v4-flash:cloud
curl http://localhost:11434/api/chat -d '{
"model": "deepseek-v4-flash:cloud",
"messages": [
{ "role": "user", "content": "resume esse arquivo pra mim" }
]
}'
Repara que o endpoint continua sendo o http://localhost:11434/api/chat de sempre
É isso que deixa a experiência confusa: o endereço é local, o processamento não é
O erro comum deste passo: trocar a tag no meio do caminho e perder o sufixo
Se você escrever deepseek-v4-flash sem o :cloud, não é a mesma coisa que está publicada na biblioteca oficial
- Escolha a variante (e o modo de raciocínio, no Pro)
O Flash é o de uso medium, o Pro é o de uso extra high
E o V4 Pro oferece três modos de raciocínio: No thinking (resposta rápida), Thinking (análise lógica) e Max thinking (esforço máximo de raciocínio)
É aqui que você decide se quer velocidade ou profundidade, antes de sair reclamando que o modelo "pensou demais" numa pergunta boba
Erros comuns e o que fazer em cada um
Sintoma: o modelo não responde ou o acesso é negado
Causa provável: você não está logado
Modelos cloud exigem conta no ollama.com, não tem jeito
Solução: rode ollama signin e confirme no navegador (ou pela URL impressa, se a máquina não tiver interface)
Como prevenir: trate o signin como parte da instalação, não como um passo opcional que "depois eu vejo"
Sintoma: "The specified tag is a sharded GGUF. Ollama does not support this yet"
Causa: você tentou puxar um GGUF de terceiro que está dividido em várias partes, e o Ollama ainda não suporta sharded GGUF
Solução: ou você usa a tag cloud oficial, ou muda de ferramenta e vai de llama.cpp pro caminho do peso local
Como prevenir: antes de sair copiando comando de repositório da comunidade, confere se o modelo está em arquivo único
Já me ferrei uma vez esperando download gigante terminar pra descobrir que o formato nem era suportado 🙃
Sintoma: requisição enfileirada ou bloqueada do nada
Causa: limite de plano
Os planos do Ollama pra uso cloud têm limite por sessão que reseta a cada 5 horas e limite semanal que reseta a cada 7 dias
Tem também limite de concorrência: requisição acima do limite entra em fila
Solução: espere a janela virar ou reduza o paralelismo do seu script
Como prevenir: se você tem um pipeline disparando várias chamadas ao mesmo tempo, serialize
Disparar tudo junto é o jeito mais rápido de bater no teto de concorrência e achar que o modelo travou
E se a minha máquina não der conta? Os caminhos possíveis
São três rotas reais hoje, e cada uma cobra um preço diferente
| Caminho | O que exige | O que entrega |
|---|---|---|
| Ollama com tag cloud | Conta no ollama.com e ollama signin, zero download de pesos |
Uso imediato do V4 Flash ou Pro pelos comandos normais, sujeito a limite de sessão (5h), limite semanal (7d) e fila por concorrência |
| Peso local via llama.cpp (GGUF da Unsloth) | 103 GB no 3 bits (rodando com 110 GB de RAM) ou 162 GB no 8 bits, e ajuste fino de flags | Execução local de verdade, offline, sem depender de servidor de terceiro |
| API oficial da DeepSeek | Manter a base_url e trocar o nome do modelo | deepseek-v4-pro ou deepseek-v4-flash com APIs OpenAI ChatCompletions e Anthropic e 1M de contexto |
Uma observação importante sobre a linha do meio: a documentação da Unsloth ensina a rodar o V4 Flash localmente pelo llama.cpp, não pelo Ollama
O comando documentado é este:
./llama.cpp/llama-cli -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S
E aí você ajusta --threads, --ctx-size e --n-gpu-layers conforme a sua máquina aguenta
Tome cuidado com a terceira linha da tabela também: os modelos deepseek-chat e deepseek-reasoner foram totalmente aposentados e ficaram inacessíveis após 24/07/2026, 15:59 UTC
Se você tem script antigo apontando pra esses nomes, ele simplesmente não roda mais
Flash ou Pro: qual variante escolher para cada uso
Vai de Flash quando o assunto é volume, agente e contexto longo
O V4 Flash tem 284B totais com só 13B ativados e 1 milhão de tokens de contexto, na faixa de uso medium
A versão oficial é a DeepSeek-V4-Flash-0731, que sucede a preview com capacidades agênticas ampliadas
É o perfil de quem vai mastigar arquivo grande, rodar tarefa repetitiva ou montar agente que faz muitas chamadas
Vai de Pro quando o problema é difícil o suficiente pra justificar
O V4 Pro é o topo de linha da família: 1,6 trilhão de parâmetros totais, 49 bilhões ativados e também 1 milhão de contexto
Ele carrega os marcadores tools e thinking e os três modos de raciocínio (No thinking, Thinking e Max thinking), mas a página do Ollama classifica ele como uso extra high
Tradução: não é o modelo pra perguntar que horas são
E tem um critério que vale mais que a variante: escolha primeiro o CAMINHO
Se offline é requisito de negócio, seu caminho é llama.cpp com o GGUF, e a variante vem depois
Se o que você precisa é escala e integração, a API oficial resolve mantendo a base_url e trocando só o nome do modelo
Se você só quer experimentar hoje sem encher o disco, a tag cloud no Ollama é a porta de entrada
Conclusão: o próximo passo depois do primeiro run
O veredito honesto é esse: na biblioteca oficial, usar o DeepSeek V4 no Ollama é uma experiência cloud, não uma execução na sua máquina
São 2 tags do Flash e 1 do Pro, todas terminadas em -cloud, e nenhuma delas baixa peso pro seu disco
Isso não é ruim, mas MUDA o significado de "rodar local", e é melhor você saber disso antes de prometer processamento offline pra alguém
O próximo passo concreto pra testar hoje é curto: ollama signin, ollama pull deepseek-v4-flash:cloud e uso normal pela CLI ou pelo endpoint local
Só encare os 103 GB do GGUF de 3 bits (via llama.cpp) se offline for requisito mesmo, e não só vontade de dizer que roda na sua máquina 😀
Último lembrete: o DeepSeek V4 foi lançado em preview em 24 de abril de 2026, já aberto, com as variantes V4-Pro e V4-Flash
Modelo novo é assim, as tags mudam rápido
Antes de repetir comando velho que você achou por aí, dá uma reconferida na biblioteca…
até o próximo post!
Perguntas frequentes
Dá pra rodar o DeepSeek V4 offline no Ollama, sem internet?
Não, pelo menos não pela biblioteca oficial do Ollama. As tags disponíveis são todas cloud (deepseek-v4-flash:cloud, deepseek-v4-flash:0731-cloud e deepseek-v4-pro:cloud), e modelo cloud roda nos servidores do ollama.com, exigindo login e conexão ativa. Não existe tag de peso local do V4 na biblioteca oficial.
Qual a diferença entre DeepSeek V4 Flash e V4 Pro no Ollama?
O V4 Flash é um Mixture-of-Experts com 284 bilhões de parâmetros totais e 13 bilhões ativados, classificado como uso medium. Já o V4 Pro é o topo de linha, com 1,6 trilhão de parâmetros totais e 49 bilhões ativados, classificado como uso extra high e com três modos de raciocínio (No thinking, Thinking e Max thinking). Os dois compartilham a janela de 1 milhão de tokens de contexto.
O comando ollama pull deepseek-v4-flash sem o :cloud funciona?
Não, a tag precisa vir completa, do jeito que está publicada na biblioteca oficial. As duas tags válidas do Flash terminam em -cloud (deepseek-v4-flash:cloud e deepseek-v4-flash:0731-cloud), e o Pro segue o mesmo padrão com deepseek-v4-pro:cloud. Trocar ou cortar o sufixo tira o comando do padrão documentado.
Quanto de RAM preciso pra rodar o DeepSeek V4 Flash localmente, fora do Ollama?
Depende da quantização. O GGUF de 8 bits da Unsloth tem 162 GB, enquanto o de 3 bits tem 103 GB e roda numa máquina com 110 GB de RAM. Esse caminho local passa pelo llama.cpp, já que o Ollama não suporta o formato sharded GGUF em que esses arquivos são distribuídos.
Dá pra usar o DeepSeek V4 direto pela API oficial da DeepSeek em vez do Ollama?
Sim, e é o caminho mais simples pra quem só quer o modelo funcionando sem se preocupar com hardware. Basta manter a mesma base_url e trocar o nome do modelo para deepseek-v4-pro ou deepseek-v4-flash, ambos com suporte às APIs OpenAI ChatCompletions e Anthropic e 1M de contexto. Vale lembrar que os antigos deepseek-chat e deepseek-reasoner foram aposentados e ficaram inacessíveis após 24/07/2026, 15:59 UTC, o mesmo aviso que está no corpo do post.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]
