DeepSeek V4 Flash: o que é o modelo rápido da família V4 e para que ele serve

O DeepSeek V4 Flash é a variante menor da família V4: 284 bilhões de parâmetros totais e cerca de 13 bilhões ativos por token num desenho Mixture-of-Experts, com 1 milhão de tokens de contexto e até 131.072 tokens de saída por resposta. Na API oficial sai por US$ 0,14 por 1M de entrada e US$ 0,28 por 1M de saída, cerca de um terço do V4 Pro. A build 0731 manteve arquitetura, tamanho e preço, e trocou o pós-treino por um focado em agentes e código. Pesos abertos sob licença MIT, em beta público na API
Fala aí, beleza? A DeepSeek atualizou o V4 Flash e ele não chegou pra ser o modelo mais inteligente da casa
Ele chegou pra ser o que aguenta chamada em cima de chamada sem doer no bolso
Esse é o perfil de um modelo Flash: menor, mais barato por token e rápido na saída, na mesma lógica do modelo rápido e barato do Google que virou padrão da categoria
Neste post tu vai ver o que o V4 Flash é por dentro, o que mudou na build 0731, onde esse perfil rende de verdade em tarefas de código e onde ele simplesmente não é a melhor escolha
O que é o DeepSeek V4 Flash e o que mudou na build 0731
O V4 Flash é um modelo Mixture-of-Experts com 284 bilhões de parâmetros totais e cerca de 13 bilhões ativos por token
E o que significa isso na prática? Que o modelo é grande no papel, mas só uma fatia dele acorda a cada token gerado
Se tu já mexeu com aquele esquema de carregar só o módulo que a rota precisa em vez de subir o sistema inteiro, é bem parecido: capacidade guardada, custo de execução baixo
A série V4 usa um mecanismo de atenção híbrido que combina Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA), pensado pra eficiência em contexto longo
E contexto longo aqui não é força de expressão: são 1 milhão de tokens de janela (1.048.576) com teto de 131.072 tokens de saída por resposta
O que a 0731 mudou (e o que ela NÃO mudou)
A build atual é a DeepSeek-V4-Flash-0731, anunciada em 31 de julho de 2026, que substituiu o checkpoint de preview e está em beta público na API
Ou seja: ela é a versão corrente, a que o nome do modelo entrega hoje, mas segue rodando como beta público, não como release estável fechado
O ponto importante: arquitetura, tamanho, janela de contexto e preço ficaram iguais
O que mudou foi um novo pós-treino, voltado a capacidades agênticas e código
Junto disso vieram duas coisas bem práticas pra quem monta agente: suporte nativo ao formato da Responses API e adaptação pro Codex
Onde ele aparece nos índices públicos
No Artificial Analysis Intelligence Index, o V4 Flash 0731 em modo de raciocínio com esforço máximo marca 50 pontos, 10 acima da versão anterior do V4 Flash
Em esforço alto, são 37 pontos
E a versão sem raciocínio marca 29
Ou seja: o mesmo modelo entrega placares BEM diferentes conforme o esforço que tu deixa ele gastar, e isso vai importar lá na hora de escolher o modo por tarefa
Na velocidade, a mesma medição aponta 113,5 tokens por segundo de saída e 1,56 segundo até o primeiro token
V4 Flash x V4 Pro: onde cada um se encaixa
O Flash é a variante menor da família
O irmão maior é o V4 Pro, e a diferença de porte é grande:
| Item | V4 Flash | V4 Pro |
|---|---|---|
| Parâmetros totais | 284B | 1,6T |
| Ativos por token | ~13B | ~49B |
| Entrada (por 1M de tokens) | US$ 0,14 | US$ 0,435 |
| Saída (por 1M de tokens) | US$ 0,28 | US$ 0,87 |
Na conta redonda, o Pro custa cerca de 3 vezes o Flash nos dois lados da fatura
Agora se liga num detalhe que a própria DeepSeek publicou junto da 0731: em algumas provas de código e terminal, o Flash atualizado aparece na frente do preview do Pro
| Benchmark | V4 Flash 0731 | V4 Pro (preview) |
|---|---|---|
| Terminal Bench 2.1 | 82,7 | 72,1 |
| NL2Repo | 54,2 | 38,5 |
| Cybergym | 76,7 | 52,7 |
| DeepSWE | 54,4 | 12,8 |
Tome cuidado com a leitura desses números: são do próprio fabricante, comparando a build nova contra um preview do irmão maior
Isso não é medição independente, é material de anúncio
O critério de escolha, em uma linha: se a tarefa é volume, repetição e agente rodando em loop, o Flash é o encaixe natural; se a tarefa exige o teto de capacidade num problema difícil e único, o Pro entra
Em quais tarefas de código o perfil do V4 Flash rende
Aqui é o coração da coisa
Modelo rápido e barato não é "modelo pior", é modelo pra outro tipo de trabalho
O perfil do V4 Flash combina três coisas: custo baixo por chamada, saída rápida e um pós-treino recente focado em agentes
Onde isso costuma render:
- Autocomplete e sugestão em fluxo: aqui latência é tudo, o tempo até o primeiro token pesa mais que sofisticação de raciocínio
- Refactor repetitivo espalhado por muitos arquivos: renomear padrão, trocar assinatura, ajustar import, aquele trabalho braçal que multiplica chamada
- Agentes com muitas chamadas seguidas: um agente de verdade não faz uma chamada, faz dezenas por tarefa, e é aí que o preço por token vira orçamento mensal
- Varredura de base grande: com 1M de tokens de janela dá pra jogar um pedaço bem gordo do repositório de uma vez, em vez de picotar em vinte requisições
E onde ele NÃO compensa?
Quando o problema é difícil de verdade: bug que exige raciocínio longo, decisão de arquitetura, aquele caso em que tu prefere pagar mais e receber uma resposta só, certa
Nesses momentos, ou tu sobe o esforço de raciocínio (lembra dos 29 sem raciocínio contra 50 no esforço máximo?) ou tu vai pro Pro
A graça é justamente misturar: o barato faz o volume, o caro faz o gargalo
Como acessar o V4 Flash e o que observar no custo
Na API oficial da DeepSeek, o nome do modelo aponta pra versão mais recente:
model = "deepseek-v4-flash"
Os pesos são abertos e distribuídos sob licença MIT, no repositório deepseek-ai/DeepSeek-V4-Flash-0731 do Hugging Face
Fora da API oficial, o modelo também tem página no OpenRouter, no DeepInfra, no Ollama e no LM Studio
Se a tua ideia é rodar o DeepSeek na sua máquina, o card oficial já dá o ponto de partida: temperature = 1.0 e top_p = 1.0
E pro modo de raciocínio Think Max, a recomendação é contexto de pelo menos 384 mil tokens
Detalhe que morde: se tu configurar Think Max com janela curta, o modo simplesmente não tem espaço pra fazer o que promete
O ponto de atenção no preço
A tabela oficial hoje é preço único: US$ 0,14 por 1M de entrada e US$ 0,28 por 1M de saída
Mas a DeepSeek anunciou uma política de tarifa em horário de pico que dobraria os valores, das 9h às 12h e das 14h às 18h no horário de Pequim
Até 2 de agosto de 2026 ela não estava em vigor e a tabela seguia com valor único
Se o teu agente roda em loop dentro dessas faixas, vale deixar isso no radar antes de fechar orçamento
Vale usar o V4 Flash?
Depende do que tu precisa, e essa é a resposta honesta
Pra quem quer o perfil "muitas chamadas, custo baixo, contexto grande", ele é uma opção óbvia de testar: preço de entrada bem abaixo do Pro, janela de 1M, pesos abertos sob MIT e um pós-treino recente mirando agente e código
Pra quem precisa do teto de capacidade num problema espinhoso, o caminho é o Pro ou outro modelo
Os limites, sem enfeite:
- a build 0731 é a versão corrente que o nome
deepseek-v4-flashentrega, mas está em beta público na API, então trate como algo que ainda pode mudar - os placares de código citados aqui (Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE) são do próprio fabricante
- não tem teste próprio neste post, então trate tudo acima como especificação e anúncio, não como veredito de bancada
Conclusão
O V4 Flash não é a versão fraquinha da família, é a versão feita pra outro tipo de tarefa: repetição, volume e agente rodando sem parar
O próximo passo prático é simples: pega uma tarefa repetitiva e de baixo risco no teu fluxo, um refactor chato, uma varredura de arquivos, e roda nele primeiro
Mede custo e latência no TEU cenário antes de mexer no modelo principal, porque benchmark de fabricante não paga a tua fatura
E fica de olho se aquela tarifa de pico entra em vigor, que ela muda a conta na hora 😀
até o próximo post!
Perguntas frequentes
O DeepSeek V4 Flash é gratuito?
Os pesos são abertos, sob licença MIT, e podem ser baixados de graça no Hugging Face. Já o uso pela API oficial é pago: US$ 0,14 por 1 milhão de tokens de entrada e US$ 0,28 por 1 milhão de tokens de saída.
Dá para rodar o DeepSeek V4 Flash na minha própria máquina?
Sim, os pesos oficiais estão no repositório deepseek-ai/DeepSeek-V4-Flash-0731 no Hugging Face, sob licença MIT. O card recomenda temperature 1.0 e top_p 1.0, e pelo menos 384 mil tokens de contexto pra usar o modo Think Max.
Qual o limite de tokens de saída do DeepSeek V4 Flash?
O teto é de 131.072 tokens por resposta, dentro de uma janela de contexto de 1 milhão de tokens. Isso dá pra jogar um trecho grande de código numa chamada só, sem picotar em várias requisições.
O DeepSeek V4 Flash funciona com o Codex?
A partir da build 0731, o modelo passou a suportar nativamente o formato da Responses API e foi adaptado pra uso com o Codex. Isso não fazia parte do preview anterior.
Como chamar o DeepSeek V4 Flash na API oficial?
Basta usar o nome do modelo deepseek-v4-flash, que a DeepSeek mantém apontando sempre pra versão mais recente (hoje a build 0731, em beta público na API). Não precisa fixar a data da build no código.
O preço do DeepSeek V4 Flash pode dobrar em horário de pico?
A DeepSeek anunciou uma tarifa de pico que dobraria os valores em certos horários de Pequim, mas essa política ainda não está em vigor. A tabela oficial segue com preço único, US$ 0,14 de entrada e US$ 0,28 de saída por 1 milhão de tokens.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]