DeepSeek V4 Flash: o que é o modelo rápido da família V4 e para que ele serve

DeepSeek V4 Flash, modelo rápido e econômico da família V4
Resposta rápida

O DeepSeek V4 Flash é a variante menor da família V4: 284 bilhões de parâmetros totais e cerca de 13 bilhões ativos por token num desenho Mixture-of-Experts, com 1 milhão de tokens de contexto e até 131.072 tokens de saída por resposta. Na API oficial sai por US$ 0,14 por 1M de entrada e US$ 0,28 por 1M de saída, cerca de um terço do V4 Pro. A build 0731 manteve arquitetura, tamanho e preço, e trocou o pós-treino por um focado em agentes e código. Pesos abertos sob licença MIT, em beta público na API

Fala aí, beleza? A DeepSeek atualizou o V4 Flash e ele não chegou pra ser o modelo mais inteligente da casa

Ele chegou pra ser o que aguenta chamada em cima de chamada sem doer no bolso

Esse é o perfil de um modelo Flash: menor, mais barato por token e rápido na saída, na mesma lógica do modelo rápido e barato do Google que virou padrão da categoria

Neste post tu vai ver o que o V4 Flash é por dentro, o que mudou na build 0731, onde esse perfil rende de verdade em tarefas de código e onde ele simplesmente não é a melhor escolha

O que é o DeepSeek V4 Flash e o que mudou na build 0731

O V4 Flash é um modelo Mixture-of-Experts com 284 bilhões de parâmetros totais e cerca de 13 bilhões ativos por token

E o que significa isso na prática? Que o modelo é grande no papel, mas só uma fatia dele acorda a cada token gerado

Se tu já mexeu com aquele esquema de carregar só o módulo que a rota precisa em vez de subir o sistema inteiro, é bem parecido: capacidade guardada, custo de execução baixo

A série V4 usa um mecanismo de atenção híbrido que combina Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA), pensado pra eficiência em contexto longo

E contexto longo aqui não é força de expressão: são 1 milhão de tokens de janela (1.048.576) com teto de 131.072 tokens de saída por resposta

O que a 0731 mudou (e o que ela NÃO mudou)

A build atual é a DeepSeek-V4-Flash-0731, anunciada em 31 de julho de 2026, que substituiu o checkpoint de preview e está em beta público na API

Ou seja: ela é a versão corrente, a que o nome do modelo entrega hoje, mas segue rodando como beta público, não como release estável fechado

O ponto importante: arquitetura, tamanho, janela de contexto e preço ficaram iguais

O que mudou foi um novo pós-treino, voltado a capacidades agênticas e código

Junto disso vieram duas coisas bem práticas pra quem monta agente: suporte nativo ao formato da Responses API e adaptação pro Codex

Onde ele aparece nos índices públicos

No Artificial Analysis Intelligence Index, o V4 Flash 0731 em modo de raciocínio com esforço máximo marca 50 pontos, 10 acima da versão anterior do V4 Flash

Em esforço alto, são 37 pontos

E a versão sem raciocínio marca 29

Ou seja: o mesmo modelo entrega placares BEM diferentes conforme o esforço que tu deixa ele gastar, e isso vai importar lá na hora de escolher o modo por tarefa

Na velocidade, a mesma medição aponta 113,5 tokens por segundo de saída e 1,56 segundo até o primeiro token

V4 Flash x V4 Pro: onde cada um se encaixa

O Flash é a variante menor da família

O irmão maior é o V4 Pro, e a diferença de porte é grande:

ItemV4 FlashV4 Pro
Parâmetros totais284B1,6T
Ativos por token~13B~49B
Entrada (por 1M de tokens)US$ 0,14US$ 0,435
Saída (por 1M de tokens)US$ 0,28US$ 0,87

Na conta redonda, o Pro custa cerca de 3 vezes o Flash nos dois lados da fatura

Agora se liga num detalhe que a própria DeepSeek publicou junto da 0731: em algumas provas de código e terminal, o Flash atualizado aparece na frente do preview do Pro

BenchmarkV4 Flash 0731V4 Pro (preview)
Terminal Bench 2.182,772,1
NL2Repo54,238,5
Cybergym76,752,7
DeepSWE54,412,8

Tome cuidado com a leitura desses números: são do próprio fabricante, comparando a build nova contra um preview do irmão maior

Isso não é medição independente, é material de anúncio

O critério de escolha, em uma linha: se a tarefa é volume, repetição e agente rodando em loop, o Flash é o encaixe natural; se a tarefa exige o teto de capacidade num problema difícil e único, o Pro entra

Em quais tarefas de código o perfil do V4 Flash rende

Aqui é o coração da coisa

Modelo rápido e barato não é "modelo pior", é modelo pra outro tipo de trabalho

O perfil do V4 Flash combina três coisas: custo baixo por chamada, saída rápida e um pós-treino recente focado em agentes

Onde isso costuma render:

  • Autocomplete e sugestão em fluxo: aqui latência é tudo, o tempo até o primeiro token pesa mais que sofisticação de raciocínio
  • Refactor repetitivo espalhado por muitos arquivos: renomear padrão, trocar assinatura, ajustar import, aquele trabalho braçal que multiplica chamada
  • Agentes com muitas chamadas seguidas: um agente de verdade não faz uma chamada, faz dezenas por tarefa, e é aí que o preço por token vira orçamento mensal
  • Varredura de base grande: com 1M de tokens de janela dá pra jogar um pedaço bem gordo do repositório de uma vez, em vez de picotar em vinte requisições

E onde ele NÃO compensa?

Quando o problema é difícil de verdade: bug que exige raciocínio longo, decisão de arquitetura, aquele caso em que tu prefere pagar mais e receber uma resposta só, certa

Nesses momentos, ou tu sobe o esforço de raciocínio (lembra dos 29 sem raciocínio contra 50 no esforço máximo?) ou tu vai pro Pro

A graça é justamente misturar: o barato faz o volume, o caro faz o gargalo

Como acessar o V4 Flash e o que observar no custo

Na API oficial da DeepSeek, o nome do modelo aponta pra versão mais recente:

model = "deepseek-v4-flash"

Os pesos são abertos e distribuídos sob licença MIT, no repositório deepseek-ai/DeepSeek-V4-Flash-0731 do Hugging Face

Fora da API oficial, o modelo também tem página no OpenRouter, no DeepInfra, no Ollama e no LM Studio

Se a tua ideia é rodar o DeepSeek na sua máquina, o card oficial já dá o ponto de partida: temperature = 1.0 e top_p = 1.0

E pro modo de raciocínio Think Max, a recomendação é contexto de pelo menos 384 mil tokens

Detalhe que morde: se tu configurar Think Max com janela curta, o modo simplesmente não tem espaço pra fazer o que promete

O ponto de atenção no preço

A tabela oficial hoje é preço único: US$ 0,14 por 1M de entrada e US$ 0,28 por 1M de saída

Mas a DeepSeek anunciou uma política de tarifa em horário de pico que dobraria os valores, das 9h às 12h e das 14h às 18h no horário de Pequim

Até 2 de agosto de 2026 ela não estava em vigor e a tabela seguia com valor único

Se o teu agente roda em loop dentro dessas faixas, vale deixar isso no radar antes de fechar orçamento

Vale usar o V4 Flash?

Depende do que tu precisa, e essa é a resposta honesta

Pra quem quer o perfil "muitas chamadas, custo baixo, contexto grande", ele é uma opção óbvia de testar: preço de entrada bem abaixo do Pro, janela de 1M, pesos abertos sob MIT e um pós-treino recente mirando agente e código

Pra quem precisa do teto de capacidade num problema espinhoso, o caminho é o Pro ou outro modelo

Os limites, sem enfeite:

  • a build 0731 é a versão corrente que o nome deepseek-v4-flash entrega, mas está em beta público na API, então trate como algo que ainda pode mudar
  • os placares de código citados aqui (Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE) são do próprio fabricante
  • não tem teste próprio neste post, então trate tudo acima como especificação e anúncio, não como veredito de bancada

Conclusão

O V4 Flash não é a versão fraquinha da família, é a versão feita pra outro tipo de tarefa: repetição, volume e agente rodando sem parar

O próximo passo prático é simples: pega uma tarefa repetitiva e de baixo risco no teu fluxo, um refactor chato, uma varredura de arquivos, e roda nele primeiro

Mede custo e latência no TEU cenário antes de mexer no modelo principal, porque benchmark de fabricante não paga a tua fatura

E fica de olho se aquela tarifa de pico entra em vigor, que ela muda a conta na hora 😀

até o próximo post!

Perguntas frequentes

O DeepSeek V4 Flash é gratuito?

Os pesos são abertos, sob licença MIT, e podem ser baixados de graça no Hugging Face. Já o uso pela API oficial é pago: US$ 0,14 por 1 milhão de tokens de entrada e US$ 0,28 por 1 milhão de tokens de saída.

Dá para rodar o DeepSeek V4 Flash na minha própria máquina?

Sim, os pesos oficiais estão no repositório deepseek-ai/DeepSeek-V4-Flash-0731 no Hugging Face, sob licença MIT. O card recomenda temperature 1.0 e top_p 1.0, e pelo menos 384 mil tokens de contexto pra usar o modo Think Max.

Qual o limite de tokens de saída do DeepSeek V4 Flash?

O teto é de 131.072 tokens por resposta, dentro de uma janela de contexto de 1 milhão de tokens. Isso dá pra jogar um trecho grande de código numa chamada só, sem picotar em várias requisições.

O DeepSeek V4 Flash funciona com o Codex?

A partir da build 0731, o modelo passou a suportar nativamente o formato da Responses API e foi adaptado pra uso com o Codex. Isso não fazia parte do preview anterior.

Como chamar o DeepSeek V4 Flash na API oficial?

Basta usar o nome do modelo deepseek-v4-flash, que a DeepSeek mantém apontando sempre pra versão mais recente (hoje a build 0731, em beta público na API). Não precisa fixar a data da build no código.

O preço do DeepSeek V4 Flash pode dobrar em horário de pico?

A DeepSeek anunciou uma tarifa de pico que dobraria os valores em certos horários de Pequim, mas essa política ainda não está em vigor. A tabela oficial segue com preço único, US$ 0,14 de entrada e US$ 0,28 de saída por 1 milhão de tokens.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares