O DeepSeek cria imagens? O que cada modelo da família faz de verdade

A pergunta "o DeepSeek cria imagens?" tem duas respostas, e as duas são verdadeiras. No chat e no app oficiais, não: a linha principal é de modelos de linguagem, texto entra e texto sai, e a tabela de compatibilidade da API marca imagem e documento como não suportados. Fora do chat, sim: a DeepSeek publicou o Janus-Pro, modelo multimodal de pesos abertos lançado em 27 de janeiro de 2025, que gera imagem em 384×384 e roda por auto-hospedagem. Já o DeepSeek-VL2 entende imagem, mas não desenha nenhuma
Fala aí, beleza? Você digita "me faz uma imagem de um gato astronauta" no DeepSeek e leva uma recusa na cara
Aí bate a dúvida: será que tem um botão escondido, um modelo certo, um jeito de destravar isso?
A real é que a DeepSeek não é UM modelo, é uma família com escopos bem diferentes
Tem modelo de texto, tem modelo que LÊ imagem e tem (sim!) um modelo que gera imagem
Só que eles não moram no mesmo lugar, e é aí que quase todo mundo se perde
O que o chat e o app oficiais fazem (e o que não fazem):
O produto de consumidor da DeepSeek (o app e o chat.deepseek.com) é de linguagem
Texto entra, texto sai
Pedir uma imagem ali resulta em recusa, e não é bug nem prompt errado: é escopo do produto mesmo
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
"Mas eu consigo mandar arquivo pra ele!"
Consegue, e essa é justamente a parte que confunde
O aplicativo oferece upload de arquivo com extração de texto, ou seja, ele puxa o CONTEÚDO ESCRITO do que você enviou
Já na API, a tabela de compatibilidade marca conteúdo de imagem, documento e container_upload como não suportado
Então anota essa: mandar arquivo pra extrair texto ≠ enxergar imagem, e nenhum dos dois é gerar imagem 🙂
Se você caiu aqui procurando um endpoint oficial de imagem na API de chat, pode parar a busca: não existe
A família DeepSeek modelo a modelo: o que cada um faz
Botei numa tabela pra ficar difícil de errar:
| Modelo | O que faz | Gera imagem? | Onde roda |
|---|---|---|---|
deepseek-v4-pro |
Texto, 1,6T de parâmetros totais e 49B ativos, 1M de contexto, modos Thinking e Non-Thinking | Não | API oficial da DeepSeek |
deepseek-v4-flash |
Texto, 284B totais e 13B ativos, 1M de contexto, modos Thinking e Non-Thinking | Não | API oficial da DeepSeek |
| DeepSeek-VL2 (Tiny, Small e VL2) | Entendimento visual: pergunta sobre imagem, OCR, documento, tabela, gráfico e grounding visual | Não, só ENTENDE | Fora do chat oficial (a API de chat não aceita conteúdo de imagem) |
| Janus-Pro | Multimodal unificado: entende E gera imagem, em 384×384 | Sim | Auto-hospedado, com pesos abertos |
Cada linha aí responde sozinha a pergunta "o modelo X gera imagem?"
E olha que curioso: a única linha com "sim" é a única que NÃO está no chat oficial
Janus-Pro: o único modelo da DeepSeek que gera imagem
O Janus-Pro é um modelo multimodal unificado, ou seja, entendimento e geração no mesmo modelo
A versão 7B foi lançada em 27 de janeiro de 2025, com pesos abertos
A base declarada da série Janus-Pro são os modelos DeepSeek-LLM-1.5b-base e DeepSeek-LLM-7b-base
Código e pesos vivem no repositório oficial da série Janus e na organização deepseek-ai do Hugging Face, em huggingface.co/deepseek-ai/Janus-Pro-7B
O repositório é público, não está arquivado, e tem atividade registrada em março de 2026
Agora a parte honesta, porque post que só elogia é propaganda disfarçada
O Janus-Pro gera em resolução FIXA de 384×384 pixels
E o uso é por auto-hospedagem: quem quiser rodar precisa executar os pesos abertos por conta própria, já que não existe geração pela API oficial de chat
Traduzindo: não é "abrir o site e digitar", é subir o modelo você mesmo
Sobre qualidade, o relatório de lançamento do próprio modelo aponta vantagem nos benchmarks GenEval e DPG-Bench sobre o DALL-E 3 e o Stable Diffusion
Repare que eu falei "o relatório do próprio modelo"
Benchmark de casa é ponto de partida, não veredito, então trate como o que é: uma comparação declarada por quem lançou
DeepSeek-VL2 entende imagem, mas não desenha
Essa é a confusão que mais aparece
O DeepSeek-VL2 é uma série de modelos visão-linguagem com arquitetura Mixture-of-Experts, voltada a ENTENDIMENTO multimodal
As tarefas dele são: responder perguntas sobre uma imagem, OCR, entendimento de documento, tabela e gráfico e grounding visual
São três variantes (Tiny, Small e VL2) com 1,0B, 2,8B e 4,5B de parâmetros ativados
No OCRBench, ele pontua 834
Quer a analogia? É a diferença entre um cara que LÊ um livro muito bem e um cara que ESCREVE o livro
Os dois trabalham com o mesmo objeto, mas a mão que faz é outra
Ler uma imagem não é criar uma imagem, e nenhum número de OCR vai transformar o VL2 em gerador 😀
E o deepseek-reasoner e o coder? O que mudou nos nomes de modelo
Se você seguiu tutorial antigo, provavelmente escreveu deepseek-chat, deepseek-reasoner ou deepseek-coder em algum lugar
Esses nomes mudaram de status, e vale saber onde cada um foi parar
Os nomes deepseek-chat e deepseek-reasoner foram marcados para desativação total após 24 de julho de 2026, às 15:59 UTC
No período de transição, eles apontavam para os modos non-thinking e thinking do deepseek-v4-flash
Já o deepseek-coder foi descontinuado como modelo próprio em setembro de 2024, quando o DeepSeek V2 Chat e o DeepSeek Coder V2 foram fundidos no DeepSeek-V2.5
Ou seja: não tem mais um modelo separado "de código", o código foi pra dentro da linha principal
A linha atual da API são os modelos V4, lançados e abertos em 24 de abril de 2026 no DeepSeek-V4 Preview: deepseek-v4-pro e deepseek-v4-flash
Os dois suportam 1 milhão de tokens de contexto e os modos Thinking e Non-Thinking
E a migração é das simples: mantém a mesma base_url e troca só o campo model
# antes
model="deepseek-chat"
# depois
model="deepseek-v4-flash"
Tome cuidado com um detalhe: nenhum desses nomes novos muda a história da imagem
Trocar deepseek-chat por deepseek-v4-pro te dá mais contexto e mais modo de raciocínio, não te dá um pixel a mais
Qual modelo DeepSeek usar para cada objetivo
Bora fechar isso em modo "escolhe pelo que você quer fazer"
- Quero escrever, resumir ou programar com contexto longo: linha V4 na API oficial,
deepseek-v4-prooudeepseek-v4-flash, com 1M de contexto e os dois modos. É também o caminho quando você quer plugar o modelo numa automação e disparar chamadas a partir de um webhook no n8n - Quero jogar código junto e ver a IA montar coisa: mesma linha V4, porque o antigo
deepseek-coderjá foi fundido na principal desde a época do V2.5. E se a sua expectativa é "a IA entrega o projeto inteiro pronto", vale calibrar antes com o que acontece ao criar um site inteiro com IA - Quero LER o conteúdo de uma imagem ou documento: aí o assunto é entendimento visual, terreno do DeepSeek-VL2 (OCR, tabela, gráfico, grounding). No app oficial, o que você tem é upload de arquivo com extração de texto, e na API o conteúdo de imagem aparece como não suportado
- Quero MESMO gerar uma imagem: Janus-Pro, e por auto-hospedagem. Aqui é onde muita gente desiste no meio, porque não é clicar em botão: é rodar os pesos abertos por conta própria e aceitar os 384×384 fixos
O erro mais comum dessa lista é o item 4 virar item 1 na cabeça do leitor
A pessoa entra no chat, tenta, tenta de novo com "prompt melhor", e o modelo continua dizendo não
Não é você, é o escopo 😛
Conclusão
A resposta pra "o DeepSeek cria imagens?" depende inteiramente de ONDE você está procurando
No chat e no app oficiais, não: a linha principal é de linguagem, texto entra e texto sai
Fora do chat, sim: o Janus-Pro existe, tem pesos abertos, saiu em 27 de janeiro de 2025 na versão 7B e é o caminho de geração da casa
Próximo passo prático, escolhendo o seu lado:
Se você quer texto, código e contexto grande, vai de linha V4 (deepseek-v4-pro ou deepseek-v4-flash) e lembra que os nomes legados estão marcados pra sair
Se você quer imagem de verdade, o caminho é o repositório do Janus, com as duas ressalvas na mesa desde já: auto-hospedagem e resolução fixa de 384×384
Saber onde cada modelo mora economiza um tempo absurdo de busca por um botão que nunca existiu…
até o próximo post!
Perguntas frequentes
Dá pra gerar imagem pelo app oficial do DeepSeek no celular?
Não. O app e o chat.deepseek.com são de linguagem, texto entra e texto sai, e pedir uma imagem ali resulta em recusa. O app até aceita upload de arquivo, mas só extrai o texto do conteúdo, não gera nada visual.
Qual é a resolução das imagens geradas pelo Janus-Pro?
O Janus-Pro gera em resolução fixa de 384×384 pixels. É o único modelo da família DeepSeek com capacidade de geração de imagem, mas essa geração roda fora do chat oficial.
O Janus-Pro tem pesos abertos?
Tem. O Janus-Pro-7B tem pesos abertos e código disponível no repositório oficial deepseek-ai/Janus no GitHub e na organização deepseek-ai no Hugging Face. Só que pesos abertos não é o mesmo que "usar de graça num site": o uso é por auto-hospedagem, você roda os pesos por conta própria na sua máquina ou servidor, porque não existe endpoint oficial de imagem na API de chat da DeepSeek.
O modelo deepseek-chat ainda serve para gerar imagem?
Não, deepseek-chat nunca gerou imagem, é um nome legado de modelo de texto. Ele foi marcado para desativação total após 24 de julho de 2026, às 15:59 UTC, e no período de transição apontava para o modo non-thinking do deepseek-v4-flash.
O DeepSeek-VL2 consegue ler PDF, tabela ou gráfico?
Sim, esse é justamente o forte dele: entendimento de documento, tabela, gráfico, OCR e grounding visual, com pontuação de 834 no OCRBench. Só que entender imagem é diferente de criar imagem, e o VL2 não faz geração.
Existe uma API oficial da DeepSeek para gerar imagens?
Não existe. A geração de imagem só acontece via Janus-Pro, que é auto-hospedado com pesos abertos, sem endpoint oficial de imagem na API de chat da DeepSeek. A linha de API atual, deepseek-v4-pro e deepseek-v4-flash, é de texto, com 1 milhão de tokens de contexto e modos Thinking e Non-Thinking.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
