DeepSeek V4.1 Flash: o que muda em relação ao V4 Flash?

comparação da arquitetura do DeepSeek V4.1 Flash com o V4 Flash
Resposta rápida

O DeepSeek V4.1 Flash virou lançamento oficial na API em 10/09/2026, com compreensão visual multimodal nativa e arquitetura nova (Causal Encoder-Decoder de 40 camadas), diferente do MoE esparso do V4 Flash. São 552B de backbone com 8B ativos no prefill e 16B no decode, contra 284B totais e 13B ativos do V4-Flash-0731. Para chamar a versão mais recente, o nome do modelo é deepseek-flash. Os nomes deepseek-v4-flash e deepseek-v4-flash-vision-exp foram aposentados e seguem roteados por compatibilidade, e a partir das 04:00 UTC de 14/09/2026 o deepseek-v4-pro também cai no V4.1 Flash.

Fala aí, beleza? A DeepSeek acabou de tirar o V4.1 Flash do beta e colocar ele como lançamento oficial na API, com compreensão visual multimodal nativa, no dia 10/09/2026

E aqui mora a treta: agora tem uma pilha de nomes de modelo diferentes respondendo, e alguns deles apontam pro MESMO lugar

Ou seja, dois devs podem estar jurando que usam "o Flash da DeepSeek" e estarem falando de coisas bem diferentes, ou pior, achando que usam coisas diferentes quando na real caem no mesmo modelo

Bora destrinchar isso?

Como a linha Flash chegou até aqui

A confusão não nasceu ontem, ela tem uma linha do tempo bem curta e bem apertada

  • 31/07/2026: sai o DeepSeek-V4-Flash-0731, versão oficial do V4 Flash, substituindo o preview, com capacidades agênticas bem ampliadas
  • 08/09/2026: abre um beta de acesso limitado do V4.1 Flash, sob o nome deepseek-v4.1-flash-expires-on-0910, com janela de cerca de dois dias e limite de 20 requisições simultâneas por conta
  • 10/09/2026: o V4.1 Flash vira lançamento oficial na API e substitui esse beta
Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 116 aulas
  • 4 projetos
  • 9h 23min

Repara no nome do beta: ele já vinha com data de validade cravada no próprio nome, expires-on-0910

Isso é uma sinalização honesta da DeepSeek, mas também é exatamente o tipo de coisa que fica esquecida num .env de projeto e quebra depois

E olha, esse embaraço de versão dentro da mesma família não é exclusividade da DeepSeek, é praticamente o esporte favorito de quem lança modelo "Flash": quem acompanhou a virada do Gemini 3.7 Flash já viu esse filme

V4.1 Flash x V4 Flash: comparação ponto a ponto

Aqui só entra dado com fonte, beleza? Onde não existe número equivalente publicado pro V4 Flash, a célula fica vazia mesmo, sem chute

Item V4.1 Flash V4 Flash (0731)
Arquitetura Causal Encoder-Decoder (CED): Transformer de 40 camadas, sendo encoder causal de 20 camadas seguido de decoder de 20 camadas MoE esparso
Parâmetros 552B de backbone (MoE multimodal), ativando 8B por token no prefill e 16B no decode 284B totais, com 13B ativos
KV cache global 890 bytes por token
Contexto 1M de tokens (padrão) 1.310.720 tokens
Saída máxima 384K tokens até 393.216 tokens de completion
Multimodal nativo: processa imagem e texto e gera texto de forma autorregressiva vinha pelo modelo separado V4 Flash Vision Exp
Pré-treino do zero em corpus multimodal de 45T tokens, sparse attention treinada em sequência de 64K e contexto estendido para 1M em 34T tokens não publicado nas fontes usadas aqui
Pesos abertos repositório deepseek-ai/DeepSeek-V4.1-Flash no Hugging Face, licença MIT, com caminhos via vLLM, SGLang e Transformers não coberto aqui

Duas coisas saltam dessa tabela

A primeira é que o V4.1 Flash é MUITO maior no backbone (552B contra 284B) e ao mesmo tempo ativa MENOS por token no prefill (8B contra 13B)

A segunda é o KV cache global em 890 bytes por token

A própria DeepSeek descreve esse valor como cerca de um quarto do que o V4 Flash usava, mas repara: a comparação é dela, e o número base do V4 Flash não aparece publicado pra gente refazer a conta

Por isso a célula ficou vazia ali em cima, do jeito que combinamos

"E por que isso importa?" o KV cache é o que segura o contexto vivo durante a geração, então quanto menor o custo por token guardado, mais barato e mais leve fica trabalhar com prompt gigante

Um detalhe honesto: o número de 284B/13B do V4 Flash vem de agregador de dados, não da página oficial do modelo

O que muda na prática para quem já chama a API

O impacto mais direto é uma linha de código: trocar o nome do modelo para deepseek-flash pra chamar a versão mais recente do V4.1 Flash

{
  "model": "deepseek-flash",
  "messages": [
    { "role": "user", "content": "olá" }
  ]
}

Os nomes deepseek-v4-flash e deepseek-v4-flash-vision-exp foram aposentados e estão temporariamente roteados para o V4.1 Flash

Isso é camada de compatibilidade, não é garantia de permanência

A doc fala em roteamento temporário e não publicou prazo pra esses dois, então tratar como estável é apostar sem informação

Agora o prazo que TEM data marcada: a partir das 04:00 UTC de 14/09/2026, todas as requisições a deepseek-v4-pro passam a ser roteadas para o V4.1 Flash, e cobradas às tarifas do V4.1 Flash

Se o teu projeto foi um dos que fizeram a migração da OpenAI pro V4 Pro, é esse trecho de configuração que precisa de revisão antes da data

A justificativa da própria DeepSeek pra aposentadoria é que o V4.1 Flash supera o V4 Pro em performance, custo, velocidade e tempo total de execução

Vale registrar que isso é afirmação do fabricante, não benchmark independente

E o preço?

Junto com o lançamento, os preços da API foram reduzidos, e a nova tabela entrou em vigor às 04:00 UTC de 10/09/2026

A estrutura oficial de horário funciona assim:

  • Pico: 01:00 às 04:00 UTC e 06:00 às 10:00 UTC, de segunda a sexta
  • Fora de pico: todo o resto, com tarifa equivalente à METADE do preço de pico

Pra quem roda batch de madrugada ou fim de semana, isso sozinho já é meio caminho de economia

Sobre os valores por token, um veículo terceiro reportou as seguintes tarifas fora de pico do V4.1 Flash: US$ 0,003 por milhão de tokens de input em cache, US$ 0,15 por milhão de tokens de input sem cache e US$ 0,60 por milhão de tokens de output

Não vou colar aqui os números de horário de pico porque não consegui ler os valores direto na página oficial de pricing, e chutar preço é o tipo de coisa que te faz estourar orçamento

Como confirmar qual versão você está usando na documentação oficial

Passo a passo curto, só com o que dá pra verificar

  1. Confira o nome de modelo que a tua requisição está enviando de verdade, não o que você acha que ela envia, e troque para deepseek-flash quando quiser a versão mais recente do V4.1 Flash

O erro comum aqui: procurar no README do projeto em vez de olhar o valor real que sai na chamada, geralmente escondido num arquivo de config ou variável de ambiente

  1. Cheque se o nome usado é um dos aposentados, ou seja, deepseek-v4-flash e deepseek-v4-flash-vision-exp, que hoje estão roteados por compatibilidade

O erro comum aqui: supor que nome antigo significa modelo antigo

Não significa: a requisição responde normalmente, e você segue achando que está no V4 Flash enquanto o V4.1 Flash é quem está atendendo

  1. Abra o changelog oficial da API em api-docs.deepseek.com/updates, onde cada release tem página própria de notícia, como news260910 para o V4.1 Flash e news260424 para o V4 Preview

O erro comum aqui: tratar o roteamento como permanente

A doc diz temporário, e temporário sem prazo publicado é justamente o que estoura sem aviso

  1. Pra rodar local, vá no repositório deepseek-ai/DeepSeek-V4.1-Flash no Hugging Face, com pesos abertos sob licença MIT e caminhos de execução via vLLM, SGLang e Transformers

O erro comum aqui: continuar apontando pro nome do beta, deepseek-v4.1-flash-expires-on-0910, que foi substituído pelo lançamento oficial de 10/09/2026 e não é mais caminho válido de acesso

Não vou inventar comando de instalação nem requisito de hardware pro modo local, porque isso eu não consegui confirmar em fonte oficial

Se alguém garantir que roda numa máquina X, desconfia até ver a spec publicada 🙂

Quem precisa agir agora e quem pode esperar

Dá pra separar por perfil, e a urgência muda bastante entre eles

Quem chama deepseek-v4-pro tem prazo: 04:00 UTC de 14/09/2026

Depois disso o tráfego vai pro V4.1 Flash e a cobrança segue as tarifas do V4.1 Flash, então revisar antes é o mínimo

Quem usava o V4 Flash Vision Exp pode simplificar a arquitetura: a capacidade visual agora é nativa no mesmo modelo, sem precisar de uma variante separada só pra imagem

Quem depende de contexto muito longo precisa fazer conta antes de migrar

O V4.1 Flash tem contexto padrão de 1M de tokens e saída máxima de 384K, enquanto o V4 Flash 0731 aparece com 1.310.720 tokens de contexto e até 393.216 de completion

Ou seja: o número máximo CAIU nos dois lados

Se teu pipeline empurra prompt no limite, isso não é detalhe de tabela, é risco de quebrar em produção

Quem otimiza custo pode brincar bastante: junta a janela fora de pico (metade do preço) com o KV cache global de 890 bytes por token e o cenário fica bem convidativo pra carga pesada agendada

Conclusão

O resumo é simples e vale colar na parede: V4 Flash e V4.1 Flash NÃO são o mesmo modelo, mesmo quando o nome antigo continua respondendo bonitinho

Arquitetura diferente, contagem de parâmetros diferente, multimodal nativo em vez de variante separada, KV cache global menor

O próximo passo é bem objetivo

Fixa deepseek-flash nas tuas chamadas, revisa todo código que ainda usa deepseek-v4-pro antes de 14/09/2026 e acompanha o changelog oficial em api-docs.deepseek.com/updates/, porque essa linha aqui está andando rápido demais pra confiar na memória

Até o próximo post! 😀

Perguntas frequentes

Qual é o nome de modelo certo para chamar o DeepSeek V4.1 Flash na API hoje?

É deepseek-flash. Esse nome aponta pra versão mais recente do V4.1 Flash, lançada oficialmente em 10/09/2026. Vale checar isso direto na requisição, não só no README do projeto.

Ainda dá pra usar deepseek-v4-flash ou deepseek-v4-flash-vision-exp na API?

Dá, mas os dois nomes foram aposentados e estão roteados temporariamente para o V4.1 Flash. A documentação não publicou prazo de fim pra esse roteamento, então tratar isso como permanente é arriscado. O caminho mais seguro é já migrar pro nome deepseek-flash.

O DeepSeek V4 Pro vai parar de funcionar?

A partir das 04:00 UTC de 14/09/2026, toda requisição a deepseek-v4-pro passa a ser roteada pro V4.1 Flash. A cobrança também muda: passa a valer a tarifa do V4.1 Flash, não a do V4 Pro. A DeepSeek justifica a aposentadoria dizendo que o V4.1 Flash supera o V4 Pro em performance, custo, velocidade e tempo total de execução.

O DeepSeek V4.1 Flash tem pesos abertos pra rodar localmente?

Sim, os pesos estão publicados no Hugging Face, no repositório deepseek-ai/DeepSeek-V4.1-Flash, sob licença MIT. Há caminhos de execução documentados via vLLM, SGLang e Transformers.

Quanto custa usar o DeepSeek V4.1 Flash fora do horário de pico?

Um veículo terceiro reportou US$ 0,003 por milhão de tokens de input em cache, US$ 0,15 por milhão de tokens de input sem cache e US$ 0,60 por milhão de tokens de output, fora de pico. O horário fora de pico é todo o período que não cai nas janelas de pico (01:00 às 04:00 UTC e 06:00 às 10:00 UTC, de segunda a sexta), com tarifa igual à metade do preço de pico. Os valores de horário de pico em si não entraram aqui porque não foi possível confirmá-los direto na página oficial de pricing.

Qual a diferença de janela de contexto entre o V4.1 Flash e o V4 Flash?

O V4.1 Flash tem contexto padrão de 1M de tokens e saída máxima de 384K tokens. O V4 Flash 0731, usado como base de comparação, trabalha com 1.310.720 tokens de contexto e até 393.216 tokens de completion. Ou seja, os números são próximos, sem um salto brusco de janela entre as duas versões.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares