O DeepSeek cria imagens? O que cada modelo da família faz de verdade

DeepSeek cria imagens: comparação entre o chat de texto e o modelo Janus-Pro
Resposta rápida

A pergunta "o DeepSeek cria imagens?" tem duas respostas, e as duas são verdadeiras. No chat e no app oficiais, não: a linha principal é de modelos de linguagem, texto entra e texto sai, e a tabela de compatibilidade da API marca imagem e documento como não suportados. Fora do chat, sim: a DeepSeek publicou o Janus-Pro, modelo multimodal de pesos abertos lançado em 27 de janeiro de 2025, que gera imagem em 384×384 e roda por auto-hospedagem. Já o DeepSeek-VL2 entende imagem, mas não desenha nenhuma

Fala aí, beleza? Você digita "me faz uma imagem de um gato astronauta" no DeepSeek e leva uma recusa na cara

Aí bate a dúvida: será que tem um botão escondido, um modelo certo, um jeito de destravar isso?

A real é que a DeepSeek não é UM modelo, é uma família com escopos bem diferentes

Tem modelo de texto, tem modelo que LÊ imagem e tem (sim!) um modelo que gera imagem

Só que eles não moram no mesmo lugar, e é aí que quase todo mundo se perde

O que o chat e o app oficiais fazem (e o que não fazem):

O produto de consumidor da DeepSeek (o app e o chat.deepseek.com) é de linguagem

Texto entra, texto sai

Pedir uma imagem ali resulta em recusa, e não é bug nem prompt errado: é escopo do produto mesmo

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

"Mas eu consigo mandar arquivo pra ele!"

Consegue, e essa é justamente a parte que confunde

O aplicativo oferece upload de arquivo com extração de texto, ou seja, ele puxa o CONTEÚDO ESCRITO do que você enviou

Já na API, a tabela de compatibilidade marca conteúdo de imagem, documento e container_upload como não suportado

Então anota essa: mandar arquivo pra extrair texto ≠ enxergar imagem, e nenhum dos dois é gerar imagem 🙂

Se você caiu aqui procurando um endpoint oficial de imagem na API de chat, pode parar a busca: não existe

A família DeepSeek modelo a modelo: o que cada um faz

Botei numa tabela pra ficar difícil de errar:

Modelo O que faz Gera imagem? Onde roda
deepseek-v4-pro Texto, 1,6T de parâmetros totais e 49B ativos, 1M de contexto, modos Thinking e Non-Thinking Não API oficial da DeepSeek
deepseek-v4-flash Texto, 284B totais e 13B ativos, 1M de contexto, modos Thinking e Non-Thinking Não API oficial da DeepSeek
DeepSeek-VL2 (Tiny, Small e VL2) Entendimento visual: pergunta sobre imagem, OCR, documento, tabela, gráfico e grounding visual Não, só ENTENDE Fora do chat oficial (a API de chat não aceita conteúdo de imagem)
Janus-Pro Multimodal unificado: entende E gera imagem, em 384×384 Sim Auto-hospedado, com pesos abertos

Cada linha aí responde sozinha a pergunta "o modelo X gera imagem?"

E olha que curioso: a única linha com "sim" é a única que NÃO está no chat oficial

Janus-Pro: o único modelo da DeepSeek que gera imagem

O Janus-Pro é um modelo multimodal unificado, ou seja, entendimento e geração no mesmo modelo

A versão 7B foi lançada em 27 de janeiro de 2025, com pesos abertos

A base declarada da série Janus-Pro são os modelos DeepSeek-LLM-1.5b-base e DeepSeek-LLM-7b-base

Código e pesos vivem no repositório oficial da série Janus e na organização deepseek-ai do Hugging Face, em huggingface.co/deepseek-ai/Janus-Pro-7B

O repositório é público, não está arquivado, e tem atividade registrada em março de 2026

Agora a parte honesta, porque post que só elogia é propaganda disfarçada

O Janus-Pro gera em resolução FIXA de 384×384 pixels

E o uso é por auto-hospedagem: quem quiser rodar precisa executar os pesos abertos por conta própria, já que não existe geração pela API oficial de chat

Traduzindo: não é "abrir o site e digitar", é subir o modelo você mesmo

Sobre qualidade, o relatório de lançamento do próprio modelo aponta vantagem nos benchmarks GenEval e DPG-Bench sobre o DALL-E 3 e o Stable Diffusion

Repare que eu falei "o relatório do próprio modelo"

Benchmark de casa é ponto de partida, não veredito, então trate como o que é: uma comparação declarada por quem lançou

DeepSeek-VL2 entende imagem, mas não desenha

Essa é a confusão que mais aparece

O DeepSeek-VL2 é uma série de modelos visão-linguagem com arquitetura Mixture-of-Experts, voltada a ENTENDIMENTO multimodal

As tarefas dele são: responder perguntas sobre uma imagem, OCR, entendimento de documento, tabela e gráfico e grounding visual

São três variantes (Tiny, Small e VL2) com 1,0B, 2,8B e 4,5B de parâmetros ativados

No OCRBench, ele pontua 834

Quer a analogia? É a diferença entre um cara que LÊ um livro muito bem e um cara que ESCREVE o livro

Os dois trabalham com o mesmo objeto, mas a mão que faz é outra

Ler uma imagem não é criar uma imagem, e nenhum número de OCR vai transformar o VL2 em gerador 😀

E o deepseek-reasoner e o coder? O que mudou nos nomes de modelo

Se você seguiu tutorial antigo, provavelmente escreveu deepseek-chat, deepseek-reasoner ou deepseek-coder em algum lugar

Esses nomes mudaram de status, e vale saber onde cada um foi parar

Os nomes deepseek-chat e deepseek-reasoner foram marcados para desativação total após 24 de julho de 2026, às 15:59 UTC

No período de transição, eles apontavam para os modos non-thinking e thinking do deepseek-v4-flash

Já o deepseek-coder foi descontinuado como modelo próprio em setembro de 2024, quando o DeepSeek V2 Chat e o DeepSeek Coder V2 foram fundidos no DeepSeek-V2.5

Ou seja: não tem mais um modelo separado "de código", o código foi pra dentro da linha principal

A linha atual da API são os modelos V4, lançados e abertos em 24 de abril de 2026 no DeepSeek-V4 Preview: deepseek-v4-pro e deepseek-v4-flash

Os dois suportam 1 milhão de tokens de contexto e os modos Thinking e Non-Thinking

E a migração é das simples: mantém a mesma base_url e troca só o campo model

# antes
model="deepseek-chat"

# depois
model="deepseek-v4-flash"

Tome cuidado com um detalhe: nenhum desses nomes novos muda a história da imagem

Trocar deepseek-chat por deepseek-v4-pro te dá mais contexto e mais modo de raciocínio, não te dá um pixel a mais

Qual modelo DeepSeek usar para cada objetivo

Bora fechar isso em modo "escolhe pelo que você quer fazer"

  1. Quero escrever, resumir ou programar com contexto longo: linha V4 na API oficial, deepseek-v4-pro ou deepseek-v4-flash, com 1M de contexto e os dois modos. É também o caminho quando você quer plugar o modelo numa automação e disparar chamadas a partir de um webhook no n8n
  2. Quero jogar código junto e ver a IA montar coisa: mesma linha V4, porque o antigo deepseek-coder já foi fundido na principal desde a época do V2.5. E se a sua expectativa é "a IA entrega o projeto inteiro pronto", vale calibrar antes com o que acontece ao criar um site inteiro com IA
  3. Quero LER o conteúdo de uma imagem ou documento: aí o assunto é entendimento visual, terreno do DeepSeek-VL2 (OCR, tabela, gráfico, grounding). No app oficial, o que você tem é upload de arquivo com extração de texto, e na API o conteúdo de imagem aparece como não suportado
  4. Quero MESMO gerar uma imagem: Janus-Pro, e por auto-hospedagem. Aqui é onde muita gente desiste no meio, porque não é clicar em botão: é rodar os pesos abertos por conta própria e aceitar os 384×384 fixos

O erro mais comum dessa lista é o item 4 virar item 1 na cabeça do leitor

A pessoa entra no chat, tenta, tenta de novo com "prompt melhor", e o modelo continua dizendo não

Não é você, é o escopo 😛

Conclusão

A resposta pra "o DeepSeek cria imagens?" depende inteiramente de ONDE você está procurando

No chat e no app oficiais, não: a linha principal é de linguagem, texto entra e texto sai

Fora do chat, sim: o Janus-Pro existe, tem pesos abertos, saiu em 27 de janeiro de 2025 na versão 7B e é o caminho de geração da casa

Próximo passo prático, escolhendo o seu lado:

Se você quer texto, código e contexto grande, vai de linha V4 (deepseek-v4-pro ou deepseek-v4-flash) e lembra que os nomes legados estão marcados pra sair

Se você quer imagem de verdade, o caminho é o repositório do Janus, com as duas ressalvas na mesa desde já: auto-hospedagem e resolução fixa de 384×384

Saber onde cada modelo mora economiza um tempo absurdo de busca por um botão que nunca existiu…

até o próximo post!

Perguntas frequentes

Dá pra gerar imagem pelo app oficial do DeepSeek no celular?

Não. O app e o chat.deepseek.com são de linguagem, texto entra e texto sai, e pedir uma imagem ali resulta em recusa. O app até aceita upload de arquivo, mas só extrai o texto do conteúdo, não gera nada visual.

Qual é a resolução das imagens geradas pelo Janus-Pro?

O Janus-Pro gera em resolução fixa de 384×384 pixels. É o único modelo da família DeepSeek com capacidade de geração de imagem, mas essa geração roda fora do chat oficial.

O Janus-Pro tem pesos abertos?

Tem. O Janus-Pro-7B tem pesos abertos e código disponível no repositório oficial deepseek-ai/Janus no GitHub e na organização deepseek-ai no Hugging Face. Só que pesos abertos não é o mesmo que "usar de graça num site": o uso é por auto-hospedagem, você roda os pesos por conta própria na sua máquina ou servidor, porque não existe endpoint oficial de imagem na API de chat da DeepSeek.

O modelo deepseek-chat ainda serve para gerar imagem?

Não, deepseek-chat nunca gerou imagem, é um nome legado de modelo de texto. Ele foi marcado para desativação total após 24 de julho de 2026, às 15:59 UTC, e no período de transição apontava para o modo non-thinking do deepseek-v4-flash.

O DeepSeek-VL2 consegue ler PDF, tabela ou gráfico?

Sim, esse é justamente o forte dele: entendimento de documento, tabela, gráfico, OCR e grounding visual, com pontuação de 834 no OCRBench. Só que entender imagem é diferente de criar imagem, e o VL2 não faz geração.

Existe uma API oficial da DeepSeek para gerar imagens?

Não existe. A geração de imagem só acontece via Janus-Pro, que é auto-hospedado com pesos abertos, sem endpoint oficial de imagem na API de chat da DeepSeek. A linha de API atual, deepseek-v4-pro e deepseek-v4-flash, é de texto, com 1 milhão de tokens de contexto e modos Thinking e Non-Thinking.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares