DeepSeek Coder: para que serve o modelo de código da DeepSeek?

DeepSeek Coder, modelo de código aberto da DeepSeek para programação
Resposta rápida

DeepSeek Coder é a linha de modelos abertos da DeepSeek treinada especificamente para programação: a primeira geração vai de 1,3B a 33B de parâmetros, com versão base e instruct, treinada do zero em 2 trilhões de tokens de código e 87 linguagens. O Coder-V2 ampliou tudo isso (contexto de 128K, 338 linguagens, arquitetura MoE). Só que em 05/09/2024 a DeepSeek fundiu o Coder-V2 com o modelo de chat no V2.5, e o nome virou apelido de compatibilidade na API. Hoje ele serve principalmente para quem quer rodar código localmente com pesos abertos

Fala aí, beleza? Se você pesquisou DeepSeek Coder esperando encontrar o modelo de código da vez, prepara o coração: esse nome mudou de lugar

Existiu (e ainda existe, em pesos abertos pra baixar) uma linha inteira da DeepSeek treinada só pra programação, separada do modelo de chat

Só que ela foi fundida no modelo geral lá em 2024, e o nome sobreviveu como apelido na API

Neste post eu te conto pra que essa linha serve de verdade, o que ela tem de diferente, e o veredito honesto de quando ainda faz sentido chamar um modelo especializado em código =)

Onde o Coder fica dentro da família DeepSeek

A história começa com o DeepSeek-Coder original: um conjunto de modelos abertos que vai de 1,3B a 33B de parâmetros, com versão base e versão instruct pra cada tamanho

E aqui tá o ponto que separa ele de um modelo geral: esses modelos foram treinados do zero em um corpus majoritariamente de código, 2 trilhões de tokens cobrindo 87 linguagens de programação

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Não é um modelo de conversa que aprendeu programação de raspão, é o contrário

Depois veio o DeepSeek-Coder-V2, e a mudança de arquitetura foi grande: Mixture-of-Experts em duas escalas, uma de 16B total com 2,4B ativos por token, e outra de 236B total com 21B ativos

Que raio é MoE? É aquele desenho em que o modelo tem um monte de "especialistas" internos, mas só uma fração deles é acionada por token

Se você já mexeu com carregamento sob demanda em qualquer sistema, o espírito é o mesmo: o modelo inteiro é gigante, o pedaço que roda a cada passo é pequeno

Outra diferença do V2: ele não foi treinado do zero

Partiu de um checkpoint intermediário do DeepSeek-V2 e recebeu mais 6 trilhões de tokens de pré-treino adicional

O salto de capacidade veio junto: contexto de 16K pra 128K, e cobertura de linguagens de 87 pra 338

Aí chegamos no fato que explica a sua busca

Em 05/09/2024 a DeepSeek anunciou o V2.5, que fundiu o DeepSeek-V2-0628 com o DeepSeek-Coder-V2-0724 em um modelo unificado

Por compatibilidade, a API seguiu aceitando tanto deepseek-coder quanto deepseek-chat, os dois apontando pro mesmo modelo unificado

Ou seja: o nome virou apelido, não produto

E a geração atual seguiu nesse caminho de modelo único

O DeepSeek V4 Preview saiu em 24/04/2026, com deepseek-v4-pro (1,6T total, 49B ativos) e deepseek-v4-flash (284B total, 13B ativos), contexto de 1 milhão de tokens, licença MIT e pesos publicados no Hugging Face

Não existe anúncio oficial de um Coder V3 ou V4 autônomo

DeepSeek Coder, Coder-V2 e a geração atual: o que muda

Botando lado a lado fica bem mais fácil de enxergar o movimento da família:

Característica DeepSeek-Coder (1ª geração) DeepSeek-Coder-V2 Geração atual (V4 Preview)
Tamanhos 1,3B a 33B, base e instruct 16B total (2,4B ativos) e 236B total (21B ativos) v4-pro 1,6T total (49B ativos) e v4-flash 284B total (13B ativos)
Janela de contexto 16K 128K 1 milhão de tokens
Linguagens cobertas 87 338 não divulgado
Origem do treino do zero, 2 trilhões de tokens majoritariamente de código checkpoint intermediário do DeepSeek-V2 + 6 trilhões de tokens não divulgado
Pesos e licença abertos, no repositório e no Hugging Face abertos, licença com uso comercial permitido abertos no Hugging Face, licença MIT

Repara no que a tabela conta: a especialização em código foi ficando cada vez menos um modelo à parte e cada vez mais uma capacidade dentro do modelo principal

A primeira geração nasceu de código puro, a segunda já nasceu de um modelo geral, e a atual nem tem linha Coder separada

Em quais trabalhos de programação um modelo de código faz diferença

Beleza, mas se a linha foi fundida, pra que serve um modelo de código hoje? Se liga nos cenários onde a especialização ainda entrega algo específico

Completar trecho ENTRE código já existente:

Esse é o mais subestimado da lista

O DeepSeek-Coder original foi treinado com a tarefa de preenchimento no meio, o famoso fill-in-the-middle

E o que isso muda na prática? Um modelo comum de chat é bom em continuar a partir do fim do que você mandou

O fill-in-the-middle é outra coisa: ele completa o buraco entre um trecho de cima e um trecho de baixo que já existem

É exatamente o formato do dia a dia de quem programa, porque quase nunca você tá escrevendo no fim do arquivo vazio

Autocompletar dentro do editor:

Que é a consequência direta do item anterior

Autocomplete de editor é fill-in-the-middle o tempo todo, com contexto acima e abaixo do cursor

Um modelo com esse treino explícito nasceu pra esse trabalho, não foi adaptado depois

Base de código em linguagem menos comum:

O Coder-V2 cobre 338 linguagens

Se o teu projeto vive em algo fora do trio JavaScript, Python e Java, cobertura ampla deixa de ser detalhe de release note e vira requisito

Rodar local, sem mandar código pra fora:

Os pesos do Coder-V2 são abertos e a licença permite uso comercial

Pra empresa que não pode enviar código proprietário pra API de terceiro, isso resolve um problema que preço nenhum resolve

E os números? A DeepSeek reportou no paper do Coder-V2 os scores de 90,2% em HumanEval, 76,2% em MBPP e 43,4% em LiveCodeBench

Importante deixar claro: esses são os números do próprio paper dela, publicados em 2024, não posição em ranking vivo de hoje

Benchmark auto-reportado serve pra dar ordem de grandeza, não pra encerrar discussão

O nome deepseek-coder na API: o que mudou

Aqui é onde muita gente se enrola, então vamos por partes

Depois do V2.5, o nome deepseek-coder continuou aceito na API só por compatibilidade, apontando pro modelo unificado

Quem tinha código antigo chamando aquele nome não quebrou de um dia pro outro, mas também não tava mais falando com um modelo de código separado

Depois disso, a DeepSeek anunciou a aposentadoria dos nomes legados

O comunicado diz que deepseek-chat e deepseek-reasoner ficam inacessíveis após 24/07/2026, às 15:59 UTC

Na transição, esses dois nomes apontavam pro modo sem raciocínio e pro modo de raciocínio do deepseek-v4-flash

Se você quiser entender melhor o que é o modelo rápido da família V4, tem post dedicado aqui no blog

E o preço?

O valor listado do V4-Flash antes do reajuste é de US$ 0,14 por 1 milhão de tokens de entrada e US$ 0,28 por 1 milhão de tokens de saída

Tome cuidado com esse número, porque ele tem prazo de validade: em 06/08/2026 a DeepSeek avisou que vai aumentar "significativamente" o preço da API e introduzir tarifa de pico

A tarifa de pico pega dias úteis das 9h às 12h e das 14h às 18h, horário de Pequim

Percentual e data de vigência? Não foram divulgados

Então se o teu orçamento tá calculado no valor antigo, refaz a conta antes de escalar volume

Vale trocar por um modelo de código ou o modelo geral já resolve?

Veredito em duas frentes, sem enrolação

Se você usa API: não tem o que trocar

A linha Coder foi fundida no modelo geral e o nome virou apelido de compatibilidade

Não existe um endpoint mágico de "modo programador" esperando você descobrir, e escolher entre deepseek-coder e deepseek-chat na API do V2.5 em diante nunca foi escolher entre dois modelos diferentes

O caminho é o modelo geral atual mesmo, e vale a pena olhar com calma se ele dá conta das tuas tarefas de programação antes de trocar qualquer coisa no teu setup

Se você quer rodar local: aí sim a família Coder ainda tem função

Pesos abertos, uso comercial permitido, fill-in-the-middle treinado explicitamente e cobertura ampla de linguagens

Pra autocomplete dentro do editor rodando na tua máquina, sem código saindo da rede, é um baita caso de uso

Só que aqui vem o balde de água fria: o Coder-V2 de 236B em BF16 pede 8 GPUs de 80GB pra inferência

Isso é infraestrutura de datacenter, não é o teu notebook nem o PC da Nasa que você montou

A variante Lite de 16B (com 2,4B ativos por token) é a que realmente cabe em hardware modesto, e é por ela que qualquer teste sério de auto-hospedagem deveria começar

Pra continuar por dentro do cenário de modelos abertos chineses, esse vídeo do canal é sobre o lançamento do Kimi K3, outro nome grande dessa turma

Conclusão

Recapitulando pra fechar: o DeepSeek Coder hoje é mais história de família do que produto separado

A primeira geração nasceu treinada do zero em código (1,3B a 33B, 2 trilhões de tokens, 87 linguagens, fill-in-the-middle, contexto de 16K)

O Coder-V2 virou MoE, esticou pra 128K e 338 linguagens partindo de um checkpoint do V2

E aí veio a fusão no V2.5, que encerrou a linha como coisa separada e transformou deepseek-coder em apelido de compatibilidade

O próximo passo depende do teu caso:

  1. Quer rodar local? O código tá no repositório deepseek-ai/DeepSeek-Coder e os pesos em huggingface.co/deepseek-ai, incluindo o DeepSeek-Coder-V2-Lite-Instruct, que é o tamanho amigável pra máquina de dev
  2. Usa a API? Confere qual nome de modelo o teu código tá chamando antes do prazo de 24/07/2026, porque os nomes legados foram anunciados como inacessíveis depois disso
  3. Vai escalar volume? Considera o aumento de preço anunciado em 06/08/2026 e a tarifa de pico no horário comercial de Pequim antes de fechar orçamento

É isso, espero que tenha ficado claro por que a busca por "DeepSeek Coder" te leva pra um lugar diferente do esperado

Até o próximo post! 😀

Perguntas frequentes

DeepSeek Coder ainda existe como modelo separado em 2026?

Não. A linha foi fundida ao modelo de chat no DeepSeek-V2.5, lançado em 05/09/2024, que uniu o DeepSeek-V2-0628 com o DeepSeek-Coder-V2-0724 em um único modelo. O nome deepseek-coder sobrou na API só como apelido de compatibilidade apontando pro modelo unificado. Hoje a geração atual é o DeepSeek V4 Preview, e não existe um Coder V3 ou V4 anunciado à parte.

Dá pra rodar o DeepSeek-Coder-V2 na própria máquina?

Depende da variante. A versão de 236B em BF16 exige infraestrutura de datacenter, com necessidade de 8 GPUs de 80GB. Já a variante Lite, de 16B total com 2,4B ativos por token, é a que cabe em hardware modesto, e os pesos dela (DeepSeek-Coder-V2-Lite-Instruct) estão publicados no Hugging Face.

Qual a diferença entre usar deepseek-coder e deepseek-chat na API da DeepSeek?

Depois da fusão de setembro de 2024, nenhuma na prática: os dois nomes passaram a apontar pro mesmo modelo unificado, mantidos só por compatibilidade com quem já tinha código chamando o nome antigo. Não existe mais um modelo de código separado respondendo por trás de deepseek-coder. Vale lembrar que essa compatibilidade tem fim: a DeepSeek anunciou que os nomes legados deepseek-chat e deepseek-reasoner ficam inacessíveis após 24/07/2026, às 15:59 UTC, então quem ainda chama nome antigo precisa atualizar a chamada.

DeepSeek Coder é open source e pode usar em projeto comercial?

Sim. Os pesos do DeepSeek-Coder-V2 são abertos, publicados em huggingface.co/deepseek-ai, sob licença que permite uso comercial. O código da família também está disponível em github.com/deepseek-ai/DeepSeek-Coder, pra quem quer inspecionar ou hospedar por conta própria.

Um modelo tipo DeepSeek Coder faz diferença real no autocomplete do editor?

Faz, porque o DeepSeek-Coder original foi treinado com a tarefa de fill-in-the-middle, que completa um trecho entre código que já existe acima e abaixo do cursor. Um modelo de chat comum é otimizado pra continuar a partir do fim do texto, não pra preencher um buraco no meio. É exatamente o formato que o autocomplete de editor usa o tempo todo.

Quanto custa usar a API da DeepSeek hoje, já que o Coder virou parte do modelo unificado?

O preço listado do DeepSeek-V4-Flash, que hoje concentra o que antes era a linha Coder, é de US$ 0,14 por 1 milhão de tokens de entrada e US$ 0,28 por 1 milhão de tokens de saída. Vale ficar de olho: em 06/08/2026 a DeepSeek avisou que vai aumentar esse preço de forma significativa e introduzir tarifa de pico em horário comercial de Pequim, sem divulgar ainda percentual nem data exata de vigência.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares