DeepSeek V4 Flash: o que é o modelo rápido da família V4 e para que ele serve

DeepSeek V4 Flash, modelo rápido e econômico da família V4
Resposta rápida

O DeepSeek V4 Flash é a variante menor da família V4: 284 bilhões de parâmetros totais e cerca de 13 bilhões ativos por token num desenho Mixture-of-Experts, com 1 milhão de tokens de contexto e até 131.072 tokens de saída por resposta. Na API oficial sai por US$ 0,14 por 1M de entrada e US$ 0,28 por 1M de saída, cerca de um terço do V4 Pro. A build 0731 manteve arquitetura, tamanho e preço, e trocou o pós-treino por um focado em agentes e código. Pesos abertos sob licença MIT, em beta público na API

Fala aí, beleza? A DeepSeek atualizou o V4 Flash e ele não chegou pra ser o modelo mais inteligente da casa

Ele chegou pra ser o que aguenta chamada em cima de chamada sem doer no bolso

Esse é o perfil de um modelo Flash: menor, mais barato por token e rápido na saída, na mesma lógica do modelo rápido e barato do Google que virou padrão da categoria

Neste post tu vai ver o que o V4 Flash é por dentro, o que mudou na build 0731, onde esse perfil rende de verdade em tarefas de código e onde ele simplesmente não é a melhor escolha

O que é o DeepSeek V4 Flash e o que mudou na build 0731

O V4 Flash é um modelo Mixture-of-Experts com 284 bilhões de parâmetros totais e cerca de 13 bilhões ativos por token

E o que significa isso na prática? Que o modelo é grande no papel, mas só uma fatia dele acorda a cada token gerado

Se tu já mexeu com aquele esquema de carregar só o módulo que a rota precisa em vez de subir o sistema inteiro, é bem parecido: capacidade guardada, custo de execução baixo

A série V4 usa um mecanismo de atenção híbrido que combina Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA), pensado pra eficiência em contexto longo

E contexto longo aqui não é força de expressão: são 1 milhão de tokens de janela (1.048.576) com teto de 131.072 tokens de saída por resposta

O que a 0731 mudou (e o que ela NÃO mudou)

A build atual é a DeepSeek-V4-Flash-0731, anunciada em 31 de julho de 2026, que substituiu o checkpoint de preview e está em beta público na API

Ou seja: ela é a versão corrente, a que o nome do modelo entrega hoje, mas segue rodando como beta público, não como release estável fechado

O ponto importante: arquitetura, tamanho, janela de contexto e preço ficaram iguais

O que mudou foi um novo pós-treino, voltado a capacidades agênticas e código

Junto disso vieram duas coisas bem práticas pra quem monta agente: suporte nativo ao formato da Responses API e adaptação pro Codex

Onde ele aparece nos índices públicos

No Artificial Analysis Intelligence Index, o V4 Flash 0731 em modo de raciocínio com esforço máximo marca 50 pontos, 10 acima da versão anterior do V4 Flash

Em esforço alto, são 37 pontos

E a versão sem raciocínio marca 29

Ou seja: o mesmo modelo entrega placares BEM diferentes conforme o esforço que tu deixa ele gastar, e isso vai importar lá na hora de escolher o modo por tarefa

Na velocidade, a mesma medição aponta 113,5 tokens por segundo de saída e 1,56 segundo até o primeiro token

V4 Flash x V4 Pro: onde cada um se encaixa

O Flash é a variante menor da família

O irmão maior é o V4 Pro, e a diferença de porte é grande:

Item V4 Flash V4 Pro
Parâmetros totais 284B 1,6T
Ativos por token ~13B ~49B
Entrada (por 1M de tokens) US$ 0,14 US$ 0,435
Saída (por 1M de tokens) US$ 0,28 US$ 0,87

Na conta redonda, o Pro custa cerca de 3 vezes o Flash nos dois lados da fatura

Agora se liga num detalhe que a própria DeepSeek publicou junto da 0731: em algumas provas de código e terminal, o Flash atualizado aparece na frente do preview do Pro

Benchmark V4 Flash 0731 V4 Pro (preview)
Terminal Bench 2.1 82,7 72,1
NL2Repo 54,2 38,5
Cybergym 76,7 52,7
DeepSWE 54,4 12,8

Tome cuidado com a leitura desses números: são do próprio fabricante, comparando a build nova contra um preview do irmão maior

Isso não é medição independente, é material de anúncio

O critério de escolha, em uma linha: se a tarefa é volume, repetição e agente rodando em loop, o Flash é o encaixe natural; se a tarefa exige o teto de capacidade num problema difícil e único, o Pro entra

Em quais tarefas de código o perfil do V4 Flash rende

Aqui é o coração da coisa

Modelo rápido e barato não é "modelo pior", é modelo pra outro tipo de trabalho

O perfil do V4 Flash combina três coisas: custo baixo por chamada, saída rápida e um pós-treino recente focado em agentes

Onde isso costuma render:

  • Autocomplete e sugestão em fluxo: aqui latência é tudo, o tempo até o primeiro token pesa mais que sofisticação de raciocínio
  • Refactor repetitivo espalhado por muitos arquivos: renomear padrão, trocar assinatura, ajustar import, aquele trabalho braçal que multiplica chamada
  • Agentes com muitas chamadas seguidas: um agente de verdade não faz uma chamada, faz dezenas por tarefa, e é aí que o preço por token vira orçamento mensal
  • Varredura de base grande: com 1M de tokens de janela dá pra jogar um pedaço bem gordo do repositório de uma vez, em vez de picotar em vinte requisições

E onde ele NÃO compensa?

Quando o problema é difícil de verdade: bug que exige raciocínio longo, decisão de arquitetura, aquele caso em que tu prefere pagar mais e receber uma resposta só, certa

Nesses momentos, ou tu sobe o esforço de raciocínio (lembra dos 29 sem raciocínio contra 50 no esforço máximo?) ou tu vai pro Pro

A graça é justamente misturar: o barato faz o volume, o caro faz o gargalo

Como acessar o V4 Flash e o que observar no custo

Na API oficial da DeepSeek, o nome do modelo aponta pra versão mais recente:

model = "deepseek-v4-flash"

Os pesos são abertos e distribuídos sob licença MIT, no repositório deepseek-ai/DeepSeek-V4-Flash-0731 do Hugging Face

Fora da API oficial, o modelo também tem página no OpenRouter, no DeepInfra, no Ollama e no LM Studio

Se a tua ideia é rodar o DeepSeek na sua máquina, o card oficial já dá o ponto de partida: temperature = 1.0 e top_p = 1.0

E pro modo de raciocínio Think Max, a recomendação é contexto de pelo menos 384 mil tokens

Detalhe que morde: se tu configurar Think Max com janela curta, o modo simplesmente não tem espaço pra fazer o que promete

O ponto de atenção no preço

A tabela oficial hoje é preço único: US$ 0,14 por 1M de entrada e US$ 0,28 por 1M de saída

Mas a DeepSeek anunciou uma política de tarifa em horário de pico que dobraria os valores, das 9h às 12h e das 14h às 18h no horário de Pequim

Até 2 de agosto de 2026 ela não estava em vigor e a tabela seguia com valor único

Se o teu agente roda em loop dentro dessas faixas, vale deixar isso no radar antes de fechar orçamento

Vale usar o V4 Flash?

Depende do que tu precisa, e essa é a resposta honesta

Pra quem quer o perfil "muitas chamadas, custo baixo, contexto grande", ele é uma opção óbvia de testar: preço de entrada bem abaixo do Pro, janela de 1M, pesos abertos sob MIT e um pós-treino recente mirando agente e código

Pra quem precisa do teto de capacidade num problema espinhoso, o caminho é o Pro ou outro modelo

Os limites, sem enfeite:

  • a build 0731 é a versão corrente que o nome deepseek-v4-flash entrega, mas está em beta público na API, então trate como algo que ainda pode mudar
  • os placares de código citados aqui (Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE) são do próprio fabricante
  • não tem teste próprio neste post, então trate tudo acima como especificação e anúncio, não como veredito de bancada

Conclusão

O V4 Flash não é a versão fraquinha da família, é a versão feita pra outro tipo de tarefa: repetição, volume e agente rodando sem parar

O próximo passo prático é simples: pega uma tarefa repetitiva e de baixo risco no teu fluxo, um refactor chato, uma varredura de arquivos, e roda nele primeiro

Mede custo e latência no TEU cenário antes de mexer no modelo principal, porque benchmark de fabricante não paga a tua fatura

E fica de olho se aquela tarifa de pico entra em vigor, que ela muda a conta na hora 😀

até o próximo post!

Perguntas frequentes

O DeepSeek V4 Flash é gratuito?

Os pesos são abertos, sob licença MIT, e podem ser baixados de graça no Hugging Face. Já o uso pela API oficial é pago: US$ 0,14 por 1 milhão de tokens de entrada e US$ 0,28 por 1 milhão de tokens de saída.

Dá para rodar o DeepSeek V4 Flash na minha própria máquina?

Sim, os pesos oficiais estão no repositório deepseek-ai/DeepSeek-V4-Flash-0731 no Hugging Face, sob licença MIT. O card recomenda temperature 1.0 e top_p 1.0, e pelo menos 384 mil tokens de contexto pra usar o modo Think Max.

Qual o limite de tokens de saída do DeepSeek V4 Flash?

O teto é de 131.072 tokens por resposta, dentro de uma janela de contexto de 1 milhão de tokens. Isso dá pra jogar um trecho grande de código numa chamada só, sem picotar em várias requisições.

O DeepSeek V4 Flash funciona com o Codex?

A partir da build 0731, o modelo passou a suportar nativamente o formato da Responses API e foi adaptado pra uso com o Codex. Isso não fazia parte do preview anterior.

Como chamar o DeepSeek V4 Flash na API oficial?

Basta usar o nome do modelo deepseek-v4-flash, que a DeepSeek mantém apontando sempre pra versão mais recente (hoje a build 0731, em beta público na API). Não precisa fixar a data da build no código.

O preço do DeepSeek V4 Flash pode dobrar em horário de pico?

A DeepSeek anunciou uma tarifa de pico que dobraria os valores em certos horários de Pequim, mas essa política ainda não está em vigor. A tabela oficial segue com preço único, US$ 0,14 de entrada e US$ 0,28 de saída por 1 milhão de tokens.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares