DeepSeek Coder: para que serve o modelo de código da DeepSeek?

DeepSeek Coder é a linha de modelos abertos da DeepSeek treinada especificamente para programação: a primeira geração vai de 1,3B a 33B de parâmetros, com versão base e instruct, treinada do zero em 2 trilhões de tokens de código e 87 linguagens. O Coder-V2 ampliou tudo isso (contexto de 128K, 338 linguagens, arquitetura MoE). Só que em 05/09/2024 a DeepSeek fundiu o Coder-V2 com o modelo de chat no V2.5, e o nome virou apelido de compatibilidade na API. Hoje ele serve principalmente para quem quer rodar código localmente com pesos abertos
Fala aí, beleza? Se você pesquisou DeepSeek Coder esperando encontrar o modelo de código da vez, prepara o coração: esse nome mudou de lugar
Existiu (e ainda existe, em pesos abertos pra baixar) uma linha inteira da DeepSeek treinada só pra programação, separada do modelo de chat
Só que ela foi fundida no modelo geral lá em 2024, e o nome sobreviveu como apelido na API
Neste post eu te conto pra que essa linha serve de verdade, o que ela tem de diferente, e o veredito honesto de quando ainda faz sentido chamar um modelo especializado em código =)
Onde o Coder fica dentro da família DeepSeek
A história começa com o DeepSeek-Coder original: um conjunto de modelos abertos que vai de 1,3B a 33B de parâmetros, com versão base e versão instruct pra cada tamanho
E aqui tá o ponto que separa ele de um modelo geral: esses modelos foram treinados do zero em um corpus majoritariamente de código, 2 trilhões de tokens cobrindo 87 linguagens de programação
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Não é um modelo de conversa que aprendeu programação de raspão, é o contrário
Depois veio o DeepSeek-Coder-V2, e a mudança de arquitetura foi grande: Mixture-of-Experts em duas escalas, uma de 16B total com 2,4B ativos por token, e outra de 236B total com 21B ativos
Que raio é MoE? É aquele desenho em que o modelo tem um monte de "especialistas" internos, mas só uma fração deles é acionada por token
Se você já mexeu com carregamento sob demanda em qualquer sistema, o espírito é o mesmo: o modelo inteiro é gigante, o pedaço que roda a cada passo é pequeno
Outra diferença do V2: ele não foi treinado do zero
Partiu de um checkpoint intermediário do DeepSeek-V2 e recebeu mais 6 trilhões de tokens de pré-treino adicional
O salto de capacidade veio junto: contexto de 16K pra 128K, e cobertura de linguagens de 87 pra 338
Aí chegamos no fato que explica a sua busca
Em 05/09/2024 a DeepSeek anunciou o V2.5, que fundiu o DeepSeek-V2-0628 com o DeepSeek-Coder-V2-0724 em um modelo unificado
Por compatibilidade, a API seguiu aceitando tanto deepseek-coder quanto deepseek-chat, os dois apontando pro mesmo modelo unificado
Ou seja: o nome virou apelido, não produto
E a geração atual seguiu nesse caminho de modelo único
O DeepSeek V4 Preview saiu em 24/04/2026, com deepseek-v4-pro (1,6T total, 49B ativos) e deepseek-v4-flash (284B total, 13B ativos), contexto de 1 milhão de tokens, licença MIT e pesos publicados no Hugging Face
Não existe anúncio oficial de um Coder V3 ou V4 autônomo
DeepSeek Coder, Coder-V2 e a geração atual: o que muda
Botando lado a lado fica bem mais fácil de enxergar o movimento da família:
| Característica | DeepSeek-Coder (1ª geração) | DeepSeek-Coder-V2 | Geração atual (V4 Preview) |
|---|---|---|---|
| Tamanhos | 1,3B a 33B, base e instruct | 16B total (2,4B ativos) e 236B total (21B ativos) | v4-pro 1,6T total (49B ativos) e v4-flash 284B total (13B ativos) |
| Janela de contexto | 16K | 128K | 1 milhão de tokens |
| Linguagens cobertas | 87 | 338 | não divulgado |
| Origem do treino | do zero, 2 trilhões de tokens majoritariamente de código | checkpoint intermediário do DeepSeek-V2 + 6 trilhões de tokens | não divulgado |
| Pesos e licença | abertos, no repositório e no Hugging Face | abertos, licença com uso comercial permitido | abertos no Hugging Face, licença MIT |
Repara no que a tabela conta: a especialização em código foi ficando cada vez menos um modelo à parte e cada vez mais uma capacidade dentro do modelo principal
A primeira geração nasceu de código puro, a segunda já nasceu de um modelo geral, e a atual nem tem linha Coder separada
Em quais trabalhos de programação um modelo de código faz diferença
Beleza, mas se a linha foi fundida, pra que serve um modelo de código hoje? Se liga nos cenários onde a especialização ainda entrega algo específico
Completar trecho ENTRE código já existente:
Esse é o mais subestimado da lista
O DeepSeek-Coder original foi treinado com a tarefa de preenchimento no meio, o famoso fill-in-the-middle
E o que isso muda na prática? Um modelo comum de chat é bom em continuar a partir do fim do que você mandou
O fill-in-the-middle é outra coisa: ele completa o buraco entre um trecho de cima e um trecho de baixo que já existem
É exatamente o formato do dia a dia de quem programa, porque quase nunca você tá escrevendo no fim do arquivo vazio
Autocompletar dentro do editor:
Que é a consequência direta do item anterior
Autocomplete de editor é fill-in-the-middle o tempo todo, com contexto acima e abaixo do cursor
Um modelo com esse treino explícito nasceu pra esse trabalho, não foi adaptado depois
Base de código em linguagem menos comum:
O Coder-V2 cobre 338 linguagens
Se o teu projeto vive em algo fora do trio JavaScript, Python e Java, cobertura ampla deixa de ser detalhe de release note e vira requisito
Rodar local, sem mandar código pra fora:
Os pesos do Coder-V2 são abertos e a licença permite uso comercial
Pra empresa que não pode enviar código proprietário pra API de terceiro, isso resolve um problema que preço nenhum resolve
E os números? A DeepSeek reportou no paper do Coder-V2 os scores de 90,2% em HumanEval, 76,2% em MBPP e 43,4% em LiveCodeBench
Importante deixar claro: esses são os números do próprio paper dela, publicados em 2024, não posição em ranking vivo de hoje
Benchmark auto-reportado serve pra dar ordem de grandeza, não pra encerrar discussão
O nome deepseek-coder na API: o que mudou
Aqui é onde muita gente se enrola, então vamos por partes
Depois do V2.5, o nome deepseek-coder continuou aceito na API só por compatibilidade, apontando pro modelo unificado
Quem tinha código antigo chamando aquele nome não quebrou de um dia pro outro, mas também não tava mais falando com um modelo de código separado
Depois disso, a DeepSeek anunciou a aposentadoria dos nomes legados
O comunicado diz que deepseek-chat e deepseek-reasoner ficam inacessíveis após 24/07/2026, às 15:59 UTC
Na transição, esses dois nomes apontavam pro modo sem raciocínio e pro modo de raciocínio do deepseek-v4-flash
Se você quiser entender melhor o que é o modelo rápido da família V4, tem post dedicado aqui no blog
E o preço?
O valor listado do V4-Flash antes do reajuste é de US$ 0,14 por 1 milhão de tokens de entrada e US$ 0,28 por 1 milhão de tokens de saída
Tome cuidado com esse número, porque ele tem prazo de validade: em 06/08/2026 a DeepSeek avisou que vai aumentar "significativamente" o preço da API e introduzir tarifa de pico
A tarifa de pico pega dias úteis das 9h às 12h e das 14h às 18h, horário de Pequim
Percentual e data de vigência? Não foram divulgados
Então se o teu orçamento tá calculado no valor antigo, refaz a conta antes de escalar volume
Vale trocar por um modelo de código ou o modelo geral já resolve?
Veredito em duas frentes, sem enrolação
Se você usa API: não tem o que trocar
A linha Coder foi fundida no modelo geral e o nome virou apelido de compatibilidade
Não existe um endpoint mágico de "modo programador" esperando você descobrir, e escolher entre deepseek-coder e deepseek-chat na API do V2.5 em diante nunca foi escolher entre dois modelos diferentes
O caminho é o modelo geral atual mesmo, e vale a pena olhar com calma se ele dá conta das tuas tarefas de programação antes de trocar qualquer coisa no teu setup
Se você quer rodar local: aí sim a família Coder ainda tem função
Pesos abertos, uso comercial permitido, fill-in-the-middle treinado explicitamente e cobertura ampla de linguagens
Pra autocomplete dentro do editor rodando na tua máquina, sem código saindo da rede, é um baita caso de uso
Só que aqui vem o balde de água fria: o Coder-V2 de 236B em BF16 pede 8 GPUs de 80GB pra inferência
Isso é infraestrutura de datacenter, não é o teu notebook nem o PC da Nasa que você montou
A variante Lite de 16B (com 2,4B ativos por token) é a que realmente cabe em hardware modesto, e é por ela que qualquer teste sério de auto-hospedagem deveria começar
Pra continuar por dentro do cenário de modelos abertos chineses, esse vídeo do canal é sobre o lançamento do Kimi K3, outro nome grande dessa turma
Conclusão
Recapitulando pra fechar: o DeepSeek Coder hoje é mais história de família do que produto separado
A primeira geração nasceu treinada do zero em código (1,3B a 33B, 2 trilhões de tokens, 87 linguagens, fill-in-the-middle, contexto de 16K)
O Coder-V2 virou MoE, esticou pra 128K e 338 linguagens partindo de um checkpoint do V2
E aí veio a fusão no V2.5, que encerrou a linha como coisa separada e transformou deepseek-coder em apelido de compatibilidade
O próximo passo depende do teu caso:
- Quer rodar local? O código tá no repositório
deepseek-ai/DeepSeek-Codere os pesos emhuggingface.co/deepseek-ai, incluindo oDeepSeek-Coder-V2-Lite-Instruct, que é o tamanho amigável pra máquina de dev - Usa a API? Confere qual nome de modelo o teu código tá chamando antes do prazo de 24/07/2026, porque os nomes legados foram anunciados como inacessíveis depois disso
- Vai escalar volume? Considera o aumento de preço anunciado em 06/08/2026 e a tarifa de pico no horário comercial de Pequim antes de fechar orçamento
É isso, espero que tenha ficado claro por que a busca por "DeepSeek Coder" te leva pra um lugar diferente do esperado
Até o próximo post! 😀
Perguntas frequentes
DeepSeek Coder ainda existe como modelo separado em 2026?
Não. A linha foi fundida ao modelo de chat no DeepSeek-V2.5, lançado em 05/09/2024, que uniu o DeepSeek-V2-0628 com o DeepSeek-Coder-V2-0724 em um único modelo. O nome deepseek-coder sobrou na API só como apelido de compatibilidade apontando pro modelo unificado. Hoje a geração atual é o DeepSeek V4 Preview, e não existe um Coder V3 ou V4 anunciado à parte.
Dá pra rodar o DeepSeek-Coder-V2 na própria máquina?
Depende da variante. A versão de 236B em BF16 exige infraestrutura de datacenter, com necessidade de 8 GPUs de 80GB. Já a variante Lite, de 16B total com 2,4B ativos por token, é a que cabe em hardware modesto, e os pesos dela (DeepSeek-Coder-V2-Lite-Instruct) estão publicados no Hugging Face.
Qual a diferença entre usar deepseek-coder e deepseek-chat na API da DeepSeek?
Depois da fusão de setembro de 2024, nenhuma na prática: os dois nomes passaram a apontar pro mesmo modelo unificado, mantidos só por compatibilidade com quem já tinha código chamando o nome antigo. Não existe mais um modelo de código separado respondendo por trás de deepseek-coder. Vale lembrar que essa compatibilidade tem fim: a DeepSeek anunciou que os nomes legados deepseek-chat e deepseek-reasoner ficam inacessíveis após 24/07/2026, às 15:59 UTC, então quem ainda chama nome antigo precisa atualizar a chamada.
DeepSeek Coder é open source e pode usar em projeto comercial?
Sim. Os pesos do DeepSeek-Coder-V2 são abertos, publicados em huggingface.co/deepseek-ai, sob licença que permite uso comercial. O código da família também está disponível em github.com/deepseek-ai/DeepSeek-Coder, pra quem quer inspecionar ou hospedar por conta própria.
Um modelo tipo DeepSeek Coder faz diferença real no autocomplete do editor?
Faz, porque o DeepSeek-Coder original foi treinado com a tarefa de fill-in-the-middle, que completa um trecho entre código que já existe acima e abaixo do cursor. Um modelo de chat comum é otimizado pra continuar a partir do fim do texto, não pra preencher um buraco no meio. É exatamente o formato que o autocomplete de editor usa o tempo todo.
Quanto custa usar a API da DeepSeek hoje, já que o Coder virou parte do modelo unificado?
O preço listado do DeepSeek-V4-Flash, que hoje concentra o que antes era a linha Coder, é de US$ 0,14 por 1 milhão de tokens de entrada e US$ 0,28 por 1 milhão de tokens de saída. Vale ficar de olho: em 06/08/2026 a DeepSeek avisou que vai aumentar esse preço de forma significativa e introduzir tarifa de pico em horário comercial de Pequim, sem divulgar ainda percentual nem data exata de vigência.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como rodar o DeepSeek Harness com npx e abrir o Web UI no navegador
Aprenda a rodar o DeepSeek Harness npx e abrir o Web UI em http://127.0.0.1:3080 automaticamente no navegador, direto do terminal com Node.js instalado.
DeepSeek V4 Pro: o que é e quando compensa usar em vez do V4 Flash?
DeepSeek V4 Pro tem 1,6 tri de parâmetros e janela de 1 milhão de tokens. Entenda o preço, o desempenho e quando vale mais a pena que o V4 Flash.

DeepSeek V4.1 Flash: o que muda em relação ao V4 Flash?
DeepSeek V4.1 Flash chegou na API: nova arquitetura, visão multimodal nativa e mudanças nos parâmetros ativos. Veja o que muda em relação ao V4 Flash.
