Download do DeepSeek V4 feito: qual hardware você precisa pra rodar local?

Fez o download do DeepSeek V4 e agora quer saber se a máquina aguenta? A conversa local é só com o V4-Flash (284B totais, 13B ativos por token), que já vem com quantização embutida: os experts roteados, 96% do modelo, são nativamente MXFP4. Na prática o que manda é memória total, VRAM mais RAM somadas, com folga acima do arquivo. O GGUF de 8 bits lossless pesa 162 GB, o de 4 bits economiza só 7 GB, e o corte real aparece no 3 bits, com 103 GB rodando em dispositivo de 110 GB de memória
O arquivo terminou de baixar e aí vem a pergunta que realmente importa: a tua máquina aguenta isso?
A DeepSeek soltou o V4 em preview e com pesos abertos, em duas versões ao mesmo tempo: V4-Pro e V4-Flash
O Flash já saiu do preview, o checkpoint DeepSeek-V4-Flash-0731 é a versão oficial e substitui a de preview
O Pro continua em preview, com a DeepSeek dizendo que a versão oficial vem em breve, sem data anunciada
E só um desses dois é conversa de máquina local, se liga nisso antes de perder horas
O que você precisa ter antes de tentar rodar
Antes de qualquer comando, o checklist honesto:
- Memória total somando VRAM da GPU e RAM do sistema, com folga confortável acima do tamanho do arquivo quantizado
- Espaço em disco pro GGUF (spoiler: são centenas de gigas nas versões maiores)
- llama.cpp pra servir o modelo
- A CLI
hf, que é quem baixa os pesos do Hugging Face
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Repara que a primeira linha do checklist não é "placa de vídeo do PC da Nasa"
É memória TOTAL, VRAM mais RAM, somadas
Esse é o número que decide se dá ou não dá
Por que só o Flash entra nessa conversa:
O V4-Flash é o modelo menor, com arquitetura MoE de 284B parâmetros totais e 13B ativados por token
O V4-Pro é o irmão grande: 1.6T parâmetros totais e 49B ativados por token
As duas versões têm janela de contexto de 1 milhão de tokens, o que é insano, mas guarda essa informação que ela volta a doer lá na frente
O Flash ainda tem um detalhe que muda tudo: ele foi treinado com quantização embutida, o famoso QAT
E o que isso significa na prática? Que os experts roteados, que são 96% do modelo, já vêm nativamente em MXFP4, e o resto dos tensores em FP8 ou BF16
Ou seja: o modelo já nasceu comprimido, não é você que vai comprimir ele depois
Se você ainda está escolhendo o programa que vai servir o modelo, o caminho geral de rodar o DeepSeek localmente ajuda a decidir isso antes de mexer em flag
Tome cuidado com a procedência do arquivo!
Esse aqui não é papo de paranoia, é caso real
Os pesos oficiais ficam no Hugging Face, na organização deepseek-ai, nos repositórios DeepSeek-V4-Flash-0731, DeepSeek-V4-Flash e DeepSeek-V4-Pro
Cerca de 45 minutos depois do anúncio oficial, golpistas puseram no ar uma organização falsa no GitHub chamada DeepSeek-V4, com logo e gráficos reais copiados do lançamento
O que ela distribuía não era modelo nenhum: era instalador entregando o infostealer Vidar
A org falsa juntou 91 stars e 27 forks em quatro dias, até a Microsoft avisar o GitHub e o repositório, a organização e a conta do operador serem removidos
Moral da história: confira de qual org você está baixando, sempre
E aqui vale separar duas coisas que confundem MUITA gente
Os pesos oficiais do modelo ficam na org deepseek-ai, como falei ali em cima
Já os arquivos GGUF, que são a versão empacotada pro llama.cpp, saem da org unsloth: é o repositório que o próprio guia da Unsloth manda usar no comando de download
São duas origens nomeadas em documentação, cada uma entregando uma coisa diferente
O que não pode é baixar de uma terceira org que apareceu do nada no resultado de busca com o nome parecidinho
Q8, Q4 ou Q3: qual quantização do V4-Flash escolher
Aqui mora a parte contraintuitiva do post, e é ela que vale o teu tempo
Na maioria dos modelos, descer de 8 pra 4 bits corta o tamanho quase pela metade
No V4-Flash, não
| Versão GGUF | Tamanho em disco | O que exige de memória |
|---|---|---|
| UD-Q8_K_XL | 162 GB | VRAM + RAM somadas acima de 162 GB, com margem |
| UD-Q4_K_XL | 7 GB a menos que o Q8 | praticamente o mesmo do Q8 |
| GGUF de 3 bits | 103 GB | roda em dispositivo com 110 GB de memória |
O Q8 (UD-Q8_K_XL) é sem perda, lossless, e ocupa 162 GB
O Q4 (UD-Q4_K_XL) fica apenas 7 GB menor que ele
E por quê? Porque o Q4 mantém os experts bit a bit, exatamente como vieram do QAT, e só quantiza os tensores não-expert pra Q8_0
Como os experts são 96% do modelo, sobra pouquíssima coisa pra encolher
Então se você ia baixar o Q4 achando que estava economizando metade da memória: não estava
O corte real de memória só aparece no 3 bits, que desce pra 103 GB e roda em máquina com 110 GB de memória
legal né? 🙂 é o tipo de detalhe que só aparece depois de você já ter torrado a banda larga baixando a versão errada
Passo a passo: do download ao primeiro prompt local
- Meça a memória disponível e escolha a quantização pela tabela
Soma VRAM da GPU com a RAM do sistema e compara com o tamanho do arquivo, deixando margem por cima
O erro comum deste passo: olhar só pra VRAM da placa de vídeo e concluir que "não dá", ou o oposto, achar que empata no limite e vai rodar liso
- Baixe os GGUFs do repositório certo
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF
Repara na org: unsloth, e não deepseek-ai
É o repositório de GGUF indicado pelo guia da Unsloth, aquela separação que combinamos ali em cima: pesos oficiais na deepseek-ai, GGUF na unsloth
O erro comum deste passo: pegar o arquivo em uma org qualquer que apareceu no resultado de busca, fora dessas duas. Lembra do Vidar ali em cima?
- Suba no llama.cpp ajustando os parâmetros de carga
Os três que importam aqui são --threads (número de threads de CPU), --ctx-size (tamanho do contexto) e --n-gpu-layers (quantas camadas vão pra GPU)
Os valores de exemplo do guia da Unsloth são:
--threads 32 --ctx-size 32768 --n-gpu-layers 2
Repara no --n-gpu-layers 2: pouquíssima camada na GPU, o grosso do modelo vive na RAM
O erro comum deste passo: abrir o --ctx-size no talo porque o modelo suporta 1 milhão de tokens de contexto. Suportar é uma coisa, ter memória pra materializar isso é outra bem diferente
- Use os parâmetros de amostragem recomendados
--temp 1.0 --top-p 1.0 --min-p 0.0
O erro comum deste passo: chegar mexendo na temperatura por hábito de outro modelo e depois culpar o V4 pela saída estranha
O que esperar de velocidade na sua máquina
Vamos ser honestos aqui: depende muito de onde o modelo vai morar
Quem tem memória unificada grande é o perfil mais confortável, porque VRAM e RAM são a mesma piscina e o arquivo inteiro cabe sem malabarismo
Quem tem GPU pequena e muita RAM também joga, e é exatamente pra esse cenário que o --n-gpu-layers 2 do exemplo aponta: poucas camadas na placa, o resto na RAM do sistema
Quem não tem memória sobrando não vai fazer milagre com flag. Nesse caso o caminho sensato é consumir o modelo por API e seguir a vida
E quanto isso rende em tokens por segundo? Aqui eu não vou chutar
A referência que existe medida é de API, não local: a página viva do Artificial Analysis mede o DeepSeek V4 Flash 0731 em modo raciocínio máximo a 113,5 tokens por segundo, e a versão sem raciocínio a 103,7 tokens por segundo
Trata esses números como teto de infraestrutura dedicada, não como previsão da tua rodada local
Modelo com offload pra RAM anda em outro ritmo, e qualquer número que eu jogasse aqui seria achismo
Um panorama do lançamento, pra quem chegou direto no download
Se você baixou o arquivo antes de entender direito o que a DeepSeek soltou, esse vídeo do canal dá o panorama do V4 e do contexto do lançamento:
Conclusão
O caminho é curto quando você inverte a ordem: primeiro mede a memória, depois escolhe a quantização, e só então baixa
Somou VRAM e RAM e passou com folga dos 162 GB? O Q8 lossless é teu
Ficou na faixa dos 110 GB? Vai de 3 bits, que é onde o corte de memória realmente acontece
Não sobrou memória nenhuma? Fica na API sem culpa, é decisão de engenharia, não derrota 😀
E se a tentação for esperar o V4-Pro pra rodar local: ele segue em preview, sem data anunciada pra versão oficial, então o Flash é o que está na mesa hoje
Pra acompanhar o que muda no modelo, o lugar certo é a org deepseek-ai no Hugging Face, e pros GGUFs, a unsloth
até o próximo post!
Perguntas frequentes
Quanto de memória preciso pra rodar o DeepSeek V4-Flash local?
A conta é VRAM da GPU somada com a RAM do sistema, com folga acima do tamanho do arquivo quantizado escolhido. O Q8 lossless pesa 162 GB, o Q4 fica só 7 GB menor que isso, e o de 3 bits cai pra 103 GB, rodando numa máquina com 110 GB de memória.
Dá pra rodar o DeepSeek V4-Pro em casa?
O V4-Pro tem 1.6T parâmetros totais e 49B ativados por token, e continua em preview, sem data anunciada pra versão oficial. É o V4-Flash, bem menor (284B totais, 13B ativos), que faz sentido tentar rodar localmente.
Por que o Q4 do V4-Flash não é muito menor que o Q8?
Porque os experts roteados, que são 96% do modelo, já vieram do treino com QAT nativamente em MXFP4 e o Q4 mantém eles bit a bit. Só os tensores não-expert são quantizados pra Q8_0, por isso o UD-Q4_K_XL fica apenas 7 GB abaixo dos 162 GB do UD-Q8_K_XL.
Onde baixar o DeepSeek V4 com segurança?
Os pesos oficiais ficam no Hugging Face, na organização deepseek-ai, nos repositórios DeepSeek-V4-Flash-0731, DeepSeek-V4-Flash e DeepSeek-V4-Pro. Os arquivos GGUF pro llama.cpp saem da org unsloth, que é o repositório indicado pelo guia da Unsloth. Cuidado redobrado no GitHub: uma organização falsa chamada DeepSeek-V4 foi ao ar cerca de 45 minutos após o lançamento, distribuindo o malware Vidar disfarçado de instalador.
Qual comando baixa os GGUFs do DeepSeek V4-Flash-0731?
É hf download unsloth/DeepSeek-V4-Flash-0731-GGUF. Repara que a org é a unsloth, que é quem publica esses GGUFs, enquanto os pesos oficiais ficam na deepseek-ai. Depois é só apontar o llama.cpp pro arquivo baixado e ajustar --threads, --ctx-size e --n-gpu-layers conforme a tua memória disponível.
O checkpoint DeepSeek-V4-Flash-0731 é diferente da versão de preview?
Sim, o DeepSeek-V4-Flash-0731 é a versão oficial e substitui a de preview, sobre a mesma base de 284B parâmetros totais e 13B ativados por token. Já o V4-Pro segue só em preview, sem data anunciada.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
