Como rodar o DeepSeek V4 no Ollama: o passo a passo e o que checar antes de tentar

passo a passo para rodar o deepseek v4 no ollama
Resposta rápida

Rodar o DeepSeek V4 no Ollama hoje é experiência cloud: na biblioteca oficial só existem tags terminadas em -cloud (deepseek-v4-flash:cloud, deepseek-v4-flash:0731-cloud e deepseek-v4-pro:cloud). Tag cloud não baixa peso nenhum pro seu disco, a inferência acontece nos servidores do Ollama e exige login com ollama signin. O caminho real é: signin, ollama pull da tag cloud e uso normal via CLI ou pela API local em http://localhost:11434/api/chat. Se offline for requisito de verdade, o peso local documentado sai pelo llama.cpp com os GGUF da Unsloth (103 GB na versão de 3 bits, rodando com 110 GB de RAM)

Todo mundo que leu "DeepSeek V4 open source" já abriu o terminal pensando em baixar o bicho e rodar offline no fim de semana

Aí você digita o ollama pull e descobre que a história é um pouco diferente do que o hype vendeu 😅

Neste post eu te mostro o caminho que REALMENTE funciona hoje pra usar o DeepSeek V4 no Ollama, o que checar antes de rodar o primeiro comando, os erros que aparecem no meio do caminho e o plano B pra quem quer peso local de verdade e descobriu que a máquina não dá conta

O DeepSeek V4 em vídeo

Pra começar do zero e entender o que é a família V4 antes de sujar as mãos no terminal, este vídeo do canal apresenta o modelo e o contexto do lançamento

Depois do vídeo, se liga: o passo a passo escrito continua logo abaixo, com os comandos na ordem certa

O que checar antes de tentar rodar o DeepSeek V4

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Antes do primeiro comando, quatro checagens que economizam uma tarde inteira de frustração

1) Ollama instalado e funcionando

Óbvio? É, mas é o passo que todo mundo pula e depois culpa o modelo 🙂

2) Conta no ollama.com criada

Essa é a pegadinha do tema

Na biblioteca oficial do Ollama, o DeepSeek V4 Flash aparece com 2 tags, deepseek-v4-flash:cloud e deepseek-v4-flash:0731-cloud

As duas terminam em -cloud

O V4 Pro segue a mesma lógica: deepseek-v4-pro:cloud, com os marcadores tools, thinking e cloud

Nenhuma tag de peso local na biblioteca oficial

3) Entender que aqui "pull" não é download de peso

Que história é essa de tag cloud?

Segundo a documentação do Ollama, modelos cloud usam a computação de inferência do próprio ollama.com e exigem login

Ou seja: o peso NÃO desce pro seu disco, o processamento acontece do lado de lá e o seu terminal é só a ponta do cabo

Isso muda tudo na hora de responder "então eu tô rodando local?"

4) A régua de hardware, pra quem sonha com o peso local

Se o seu plano era baixar o modelo inteiro e nunca mais depender de internet, olha os números que estão na mesa

O V4 Flash é um Mixture-of-Experts com 284 bilhões de parâmetros totais, 13 bilhões ativados e janela de contexto de 1 milhão de tokens

O repositório oficial no Hugging Face tem 166,9 GB em safetensors distribuídos em 48 arquivos, com licença MIT

Já nas versões quantizadas GGUF da Unsloth, o arquivo de 8 bits tem 162 GB e o de 3 bits tem 103 GB, sendo que o de 3 bits roda numa máquina com 110 GB de RAM

Então sim: PC da Nasa, e olhe lá

Se você quer entender melhor as opções de execução na sua máquina antes de decidir, vale passar por este guia sobre rodar o DeepSeek localmente

E tem mais um detalhe que ajuda a calibrar expectativa: a própria página do Ollama classifica o consumo dos dois em faixas diferentes, o V4 Flash como uso medium e o V4 Pro como uso extra high

Passo a passo: rodando o DeepSeek V4 no Ollama

Agora sim, mão na massa

  1. Faça login na sua conta com ollama signin
ollama signin

O comando abre o navegador pra você confirmar a conta

Tá numa máquina sem interface gráfica (servidor, VPS, container)? Ele imprime a URL de confirmação no terminal, aí é só abrir de outro lugar

O erro comum deste passo: pular ele

Como tag cloud exige conta no ollama.com, tentar usar o modelo deslogado é o clássico "não funciona e eu não sei por quê"

  1. Puxe a tag cloud do modelo
ollama pull deepseek-v4-flash:cloud

Se você quer a versão datada ou o topo de linha, é o mesmo padrão:

ollama pull deepseek-v4-flash:0731-cloud
ollama pull deepseek-v4-pro:cloud

O erro comum deste passo: achar que esse pull encheu o seu SSD

Não encheu

Modelo cloud não baixa peso pro disco, a inferência fica no servidor do Ollama

Se você foi conferir o espaço livre esperando ver 100 e tantos GB a menos, pode relaxar 😀

  1. Use normalmente, por CLI ou pela API local

O padrão documentado é usar os comandos normais depois do pull, via CLI ou via API local:

ollama run deepseek-v4-flash:cloud
curl http://localhost:11434/api/chat -d '{
  "model": "deepseek-v4-flash:cloud",
  "messages": [
    { "role": "user", "content": "resume esse arquivo pra mim" }
  ]
}'

Repara que o endpoint continua sendo o http://localhost:11434/api/chat de sempre

É isso que deixa a experiência confusa: o endereço é local, o processamento não é

O erro comum deste passo: trocar a tag no meio do caminho e perder o sufixo

Se você escrever deepseek-v4-flash sem o :cloud, não é a mesma coisa que está publicada na biblioteca oficial

  1. Escolha a variante (e o modo de raciocínio, no Pro)

O Flash é o de uso medium, o Pro é o de uso extra high

E o V4 Pro oferece três modos de raciocínio: No thinking (resposta rápida), Thinking (análise lógica) e Max thinking (esforço máximo de raciocínio)

É aqui que você decide se quer velocidade ou profundidade, antes de sair reclamando que o modelo "pensou demais" numa pergunta boba

Erros comuns e o que fazer em cada um

Sintoma: o modelo não responde ou o acesso é negado

Causa provável: você não está logado

Modelos cloud exigem conta no ollama.com, não tem jeito

Solução: rode ollama signin e confirme no navegador (ou pela URL impressa, se a máquina não tiver interface)

Como prevenir: trate o signin como parte da instalação, não como um passo opcional que "depois eu vejo"

Sintoma: "The specified tag is a sharded GGUF. Ollama does not support this yet"

Causa: você tentou puxar um GGUF de terceiro que está dividido em várias partes, e o Ollama ainda não suporta sharded GGUF

Solução: ou você usa a tag cloud oficial, ou muda de ferramenta e vai de llama.cpp pro caminho do peso local

Como prevenir: antes de sair copiando comando de repositório da comunidade, confere se o modelo está em arquivo único

Já me ferrei uma vez esperando download gigante terminar pra descobrir que o formato nem era suportado 🙃

Sintoma: requisição enfileirada ou bloqueada do nada

Causa: limite de plano

Os planos do Ollama pra uso cloud têm limite por sessão que reseta a cada 5 horas e limite semanal que reseta a cada 7 dias

Tem também limite de concorrência: requisição acima do limite entra em fila

Solução: espere a janela virar ou reduza o paralelismo do seu script

Como prevenir: se você tem um pipeline disparando várias chamadas ao mesmo tempo, serialize

Disparar tudo junto é o jeito mais rápido de bater no teto de concorrência e achar que o modelo travou

E se a minha máquina não der conta? Os caminhos possíveis

São três rotas reais hoje, e cada uma cobra um preço diferente

CaminhoO que exigeO que entrega
Ollama com tag cloudConta no ollama.com e ollama signin, zero download de pesosUso imediato do V4 Flash ou Pro pelos comandos normais, sujeito a limite de sessão (5h), limite semanal (7d) e fila por concorrência
Peso local via llama.cpp (GGUF da Unsloth)103 GB no 3 bits (rodando com 110 GB de RAM) ou 162 GB no 8 bits, e ajuste fino de flagsExecução local de verdade, offline, sem depender de servidor de terceiro
API oficial da DeepSeekManter a base_url e trocar o nome do modelodeepseek-v4-pro ou deepseek-v4-flash com APIs OpenAI ChatCompletions e Anthropic e 1M de contexto

Uma observação importante sobre a linha do meio: a documentação da Unsloth ensina a rodar o V4 Flash localmente pelo llama.cpp, não pelo Ollama

O comando documentado é este:

./llama.cpp/llama-cli -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S

E aí você ajusta --threads, --ctx-size e --n-gpu-layers conforme a sua máquina aguenta

Tome cuidado com a terceira linha da tabela também: os modelos deepseek-chat e deepseek-reasoner foram totalmente aposentados e ficaram inacessíveis após 24/07/2026, 15:59 UTC

Se você tem script antigo apontando pra esses nomes, ele simplesmente não roda mais

Flash ou Pro: qual variante escolher para cada uso

Vai de Flash quando o assunto é volume, agente e contexto longo

O V4 Flash tem 284B totais com só 13B ativados e 1 milhão de tokens de contexto, na faixa de uso medium

A versão oficial é a DeepSeek-V4-Flash-0731, que sucede a preview com capacidades agênticas ampliadas

É o perfil de quem vai mastigar arquivo grande, rodar tarefa repetitiva ou montar agente que faz muitas chamadas

Vai de Pro quando o problema é difícil o suficiente pra justificar

O V4 Pro é o topo de linha da família: 1,6 trilhão de parâmetros totais, 49 bilhões ativados e também 1 milhão de contexto

Ele carrega os marcadores tools e thinking e os três modos de raciocínio (No thinking, Thinking e Max thinking), mas a página do Ollama classifica ele como uso extra high

Tradução: não é o modelo pra perguntar que horas são

E tem um critério que vale mais que a variante: escolha primeiro o CAMINHO

Se offline é requisito de negócio, seu caminho é llama.cpp com o GGUF, e a variante vem depois

Se o que você precisa é escala e integração, a API oficial resolve mantendo a base_url e trocando só o nome do modelo

Se você só quer experimentar hoje sem encher o disco, a tag cloud no Ollama é a porta de entrada

Conclusão: o próximo passo depois do primeiro run

O veredito honesto é esse: na biblioteca oficial, usar o DeepSeek V4 no Ollama é uma experiência cloud, não uma execução na sua máquina

São 2 tags do Flash e 1 do Pro, todas terminadas em -cloud, e nenhuma delas baixa peso pro seu disco

Isso não é ruim, mas MUDA o significado de "rodar local", e é melhor você saber disso antes de prometer processamento offline pra alguém

O próximo passo concreto pra testar hoje é curto: ollama signin, ollama pull deepseek-v4-flash:cloud e uso normal pela CLI ou pelo endpoint local

Só encare os 103 GB do GGUF de 3 bits (via llama.cpp) se offline for requisito mesmo, e não só vontade de dizer que roda na sua máquina 😀

Último lembrete: o DeepSeek V4 foi lançado em preview em 24 de abril de 2026, já aberto, com as variantes V4-Pro e V4-Flash

Modelo novo é assim, as tags mudam rápido

Antes de repetir comando velho que você achou por aí, dá uma reconferida na biblioteca…

até o próximo post!

Perguntas frequentes

Dá pra rodar o DeepSeek V4 offline no Ollama, sem internet?

Não, pelo menos não pela biblioteca oficial do Ollama. As tags disponíveis são todas cloud (deepseek-v4-flash:cloud, deepseek-v4-flash:0731-cloud e deepseek-v4-pro:cloud), e modelo cloud roda nos servidores do ollama.com, exigindo login e conexão ativa. Não existe tag de peso local do V4 na biblioteca oficial.

Qual a diferença entre DeepSeek V4 Flash e V4 Pro no Ollama?

O V4 Flash é um Mixture-of-Experts com 284 bilhões de parâmetros totais e 13 bilhões ativados, classificado como uso medium. Já o V4 Pro é o topo de linha, com 1,6 trilhão de parâmetros totais e 49 bilhões ativados, classificado como uso extra high e com três modos de raciocínio (No thinking, Thinking e Max thinking). Os dois compartilham a janela de 1 milhão de tokens de contexto.

O comando ollama pull deepseek-v4-flash sem o :cloud funciona?

Não, a tag precisa vir completa, do jeito que está publicada na biblioteca oficial. As duas tags válidas do Flash terminam em -cloud (deepseek-v4-flash:cloud e deepseek-v4-flash:0731-cloud), e o Pro segue o mesmo padrão com deepseek-v4-pro:cloud. Trocar ou cortar o sufixo tira o comando do padrão documentado.

Quanto de RAM preciso pra rodar o DeepSeek V4 Flash localmente, fora do Ollama?

Depende da quantização. O GGUF de 8 bits da Unsloth tem 162 GB, enquanto o de 3 bits tem 103 GB e roda numa máquina com 110 GB de RAM. Esse caminho local passa pelo llama.cpp, já que o Ollama não suporta o formato sharded GGUF em que esses arquivos são distribuídos.

Dá pra usar o DeepSeek V4 direto pela API oficial da DeepSeek em vez do Ollama?

Sim, e é o caminho mais simples pra quem só quer o modelo funcionando sem se preocupar com hardware. Basta manter a mesma base_url e trocar o nome do modelo para deepseek-v4-pro ou deepseek-v4-flash, ambos com suporte às APIs OpenAI ChatCompletions e Anthropic e 1M de contexto. Vale lembrar que os antigos deepseek-chat e deepseek-reasoner foram aposentados e ficaram inacessíveis após 24/07/2026, 15:59 UTC, o mesmo aviso que está no corpo do post.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares