DeepSeek R1 ou V3: qual modelo usar em cada tipo de tarefa (e o que mudou em 2026)

comparação entre DeepSeek R1 e V3 para escolher o modelo certo em cada tarefa
Resposta rápida

O DeepSeek R1 é o modelo de raciocínio treinado com aprendizado por reforço (GRPO) em cima do DeepSeek-V3-Base: ele produz a cadeia de pensamento antes de responder, enquanto o V3 responde direto. Na prática isso vira uma regra de roteamento: modelo direto como padrão, raciocínio só na fatia dura (matemática, algoritmos, análise em várias etapas), porque só ali a profundidade paga o custo e a latência. Em 2026 a escolha mudou de lugar: a API oficial lista apenas deepseek-v4-flash e deepseek-v4-pro, e pensar virou parâmetro (thinking), não nome de modelo

Fala aí, beleza? Se você abriu a tela do DeepSeek e ficou naquele impasse entre R1 e V3 sem saber qual dos dois resolve o seu problema, a boa notícia é que a linha entre eles é bem clara

O R1 é o modelo de raciocínio construído em cima do V3: mesma família, comportamento diferente na hora de responder

E a escolha entre um e outro não é questão de gosto, muda por TIPO de tarefa

Só que tem um detalhe que muda o jogo: o cenário de acesso virou de ponta cabeça em 2026, e boa parte do que você lê por aí sobre "escolher entre R1 e V3" já não descreve a API oficial de hoje

Bora destrinchar isso?

O que é o DeepSeek R1 e como ele nasce do V3

O DeepSeek R1 é um modelo de raciocínio treinado com aprendizado por reforço tendo o DeepSeek-V3-Base como modelo base, usando GRPO como framework de RL

Ou seja, a receita é literalmente: pega o V3-Base, aplica RL em cima

O objetivo declarado no artigo original era incentivar raciocínio SEM dados supervisionados, o que é a parte insana da história

Não é "mostramos milhares de soluções passo a passo pra ele copiar o formato", é deixar o reforço puxar o comportamento sozinho

Essa pesquisa, mostrando que a capacidade de raciocínio pode ser incentivada por aprendizado por reforço puro, sem demonstrações anotadas por humanos, foi publicada na Nature com o título DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

LLM em revista científica revisada por pares não é coisa que acontece todo dia, né? 🙂

E a arquitetura?

O R1 usa Mixture-of-Experts com 671 bilhões de parâmetros totais e 37 bilhões ativados por token

Se você nunca mexeu com MoE, a analogia de aproximação é simples: pense num escritório com muita gente contratada, mas só um punhado de especialistas entra na sala pra cada pergunta

O modelo é gigante no papel, e bem mais econômico no momento em que roda

Nos resultados do próprio artigo, o R1 marcou 79,8% no AIME 2024 (pass@1) e 97,3% no MATH-500

Matemática dura é justamente onde esse tipo de modelo brilha, guarda essa informação que ela volta lá embaixo

Outra parte muito massa: o repositório de código e os pesos do R1 estão sob licença MIT, com uso comercial, modificações e destilação permitidos

Pesos abertos de verdade, no Hugging Face

E tem as versões destiladas, baseadas nas séries Qwen2.5 e Llama3, em 1.5B, 7B, 8B, 14B, 32B e 70B

Tradução: dá pra rodar coisa da família em máquina que não seja um PC da Nasa, escolhendo o tamanho que cabe no seu hardware

Depois do lançamento ainda saiu uma atualização, o DeepSeek-R1-0528, publicada como repositório próprio

R1 e V3 lado a lado: o que muda de verdade

A diferença que TE ATINGE no dia a dia é uma só: o R1 não responde de imediato

Ele primeiro produz a cadeia de raciocínio e só depois começa a emitir a resposta

O V3 responde direto, sem esse preâmbulo

Parece detalhe, mas é o que define latência, custo por resposta e pra que serve cada um

Eixo DeepSeek R1 DeepSeek V3
Como responde Produz a cadeia de raciocínio antes da resposta Responde direto
Origem Aprendizado por reforço (GRPO) sobre o DeepSeek-V3-Base Modelo base da família
Efeito prático Mais tokens gerados por resposta, logo mais tempo de espera e mais custo Resposta mais rápida e mais barata por chamada
Arquitetura MoE, 671B totais / 37B ativos por token Base do R1
Onde ainda pega hoje Fora da API oficial, por exemplo no OpenRouter Fora da API oficial

E os preços fora da casa oficial, já que ali eles não estão mais

O deepseek/deepseek-r1 no OpenRouter sai a US$ 0,70 por milhão de tokens de entrada e US$ 2,50 por milhão de saída, com janela de 163.840 tokens e saída máxima de 16.000 tokens

Já o R1-0528 fica em US$ 0,50 de entrada e US$ 2,15 de saída por milhão, com saída máxima de 32.768 tokens

Repara que a saída custa bem mais que a entrada, e que o modelo de raciocínio gera MAIS saída por natureza

É aí que a conta escala sem você perceber

Quando abrir o raciocínio e quando o modelo direto basta

A régua que se repete nas comparações é sempre a mesma: usar o modelo direto como padrão e reservar o raciocínio para a fatia dura da carga, porque só nela a profundidade compensa custo e latência

Na prática, fica assim

Vale ligar o raciocínio:

  • problema matemático de várias etapas, onde errar o meio derruba o fim
  • prova ou desenho de algoritmo, com invariante e caso de borda pra sustentar
  • depuração com várias hipóteses concorrentes ("ou é o cache, ou é a migration, ou é o fuso")
  • análise em etapas, quando a conclusão depende de encadear coisas que o texto não entrega prontas

Esses casos têm um traço em comum: o resultado MUDA se o modelo pensar antes

Não vale ligar:

  • redação, reescrita e ajuste de tom
  • extração de campos de um texto ou de um JSON
  • resumo
  • resposta de suporte com base em um documento
  • qualquer chamada de alto volume, tipo classificar milhares de itens

Aqui a cadeia de raciocínio não melhora nada, só faz você pagar tokens de saída e esperar mais

É o dev sênior mais caro do time revisando a vírgula de um e-mail, sabe? haha

A regra de bolso que eu uso pra decidir: se você mesmo resolveria a tarefa de cabeça, sem rascunho, o modo direto basta

Se você precisaria de papel e caneta, aí sim liga o raciocínio

Veredito: qual usar como padrão

Direto por padrão, raciocínio como exceção deliberada

Não é meio termo por covardia, é o que a estrutura de custo manda: modelo de raciocínio gera mais saída, e saída é o token caro na tabela de qualquer provedor

Ligue o pensamento quando a profundidade muda o RESULTADO, não quando ela só deixa a resposta mais bonita

E o R1 clássico, ainda faz sentido pra quem?

Faz muito sentido se o que te interessa são os pesos abertos sob licença MIT: rodar local, adaptar, destilar, usar comercialmente sem depender de endpoint de ninguém

Os destilados de 1.5B até 70B existem exatamente pra esse público

Já se o seu caso é chamar uma API e seguir a vida, o R1 clássico deixou de ser o caminho natural, e o motivo é o próximo bloco

O que mudou em 2026: R1 e V3 saíram da API oficial

A linha do tempo é curta e vale decorar

Em agosto de 2025 a DeepSeek lançou o V3.1, primeiro modelo híbrido da casa, que suporta modo pensante e não pensante na mesma arquitetura e passou a atender a API oficial no lugar de V3 e R1

Foi ali que a ideia de escolher entre pensar e não pensar deixou de ser "escolher outro modelo"

Depois veio o DeepSeek-V3.2, anunciado no changelog da API

E hoje a lista oficial de modelos da API DeepSeek contém apenas deepseek-v4-flash e deepseek-v4-pro

Mais importante ainda: os nomes legados deepseek-chat e deepseek-reasoner foram desativados em 24/07/2026 às 15:59 UTC e deixaram de resolver na API oficial

Tome cuidado! Se o seu código ainda manda esses nomes, ele não está "usando o modelo antigo", ele está dando erro

O mapeamento da migração é direto:

  • o antigo deepseek-chat corresponde ao modo NÃO pensante do deepseek-v4-flash
  • o antigo deepseek-reasoner corresponde ao modo pensante do MESMO modelo

Os números da geração V4: o Pro tem 1,6 trilhão de parâmetros totais com 49 bilhões ativos, e o Flash tem 284 bilhões totais com 13 bilhões ativos

Os dois suportam janela de contexto de 1 milhão de tokens e até 384 mil tokens de saída, além dos modos pensante e não pensante

Os preços atuais da API oficial:

Modelo Entrada (cache miss) Entrada (cache hit) Saída
deepseek-v4-flash US$ 0,14 / 1M US$ 0,0028 / 1M US$ 0,28 / 1M
deepseek-v4-pro US$ 0,435 / 1M não informado na tabela US$ 0,87 / 1M

A diferença de cache hit pra cache miss no Flash é absurda, então vale muito estruturar o prompt pra reaproveitar prefixo

Se a dúvida agora virou outra, tipo quando o V4 Pro compensa no lugar do Flash, esse é um papo separado

Como ligar e desligar o raciocínio na API DeepSeek hoje

O ponto que muda a cabeça: raciocínio virou parâmetro de requisição, não um nome de modelo separado

Segue o passo a passo do que está documentado

  1. Troque o nome do modelo pelo deepseek-v4-flash ou deepseek-v4-pro

O erro comum deste passo: insistir em deepseek-chat ou deepseek-reasoner porque "sempre funcionou". Esses aliases já não resolvem, e o sintoma é erro na chamada, não resposta pior

  1. Passe o campo thinking com enabled ou disabled

No SDK da OpenAI, ele vai dentro de extra_body, porque é um campo que o SDK não conhece nativamente:

resposta = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Prove que a soma dos n primeiros ímpares é n^2"}],
    extra_body={"thinking": {"type": "enabled"}},
)

Pra desligar, mesma coisa com {"type": "disabled"}

O erro comum deste passo: jogar thinking solto no corpo da chamada pelo SDK da OpenAI e o campo simplesmente não chegar

  1. Leia a cadeia de raciocínio no campo reasoning_content, que volta no MESMO nível do content
msg = resposta.choices[0].message
print(msg.reasoning_content)  # o pensamento
print(msg.content)            # a resposta final

O erro comum deste passo: mostrar o reasoning_content pro usuário final achando que é a resposta. É o rascunho, não o entregável

  1. Ajuste o reasoning_effort se precisar de mais ou menos profundidade

O padrão é high. Os níveis medium e xhigh são mapeados para high, e o deepseek-v4-pro aceita por ora apenas high e max

O erro comum deste passo: mandar medium esperando economizar e receber exatamente o mesmo comportamento de high

  1. Tire temperature, top_p, presence_penalty e frequency_penalty das chamadas em modo pensante

O erro comum deste passo (e é o mais traiçoeiro): esses parâmetros NÃO geram erro no thinking mode, eles são simplesmente ignorados. Você fica ali mexendo em temperatura, achando que está calibrando criatividade, e não muda nada. Já vi gente perder tarde inteira nesse tipo de coisa 😛

A documentação do modo pensante é a referência pra conferir cada um desses campos

Conclusão

Recapitulando o essencial: o DeepSeek R1 é raciocínio via reforço em cima do V3-Base, ele pensa antes de responder, e o V3 responde direto

A decisão continua a mesma de sempre: direto por padrão, raciocínio só na fatia dura da carga

O que mudou é ONDE essa decisão mora

Ela não é mais "qual modelo eu abro", é um parâmetro na requisição, com thinking ligado ou desligado no mesmo deepseek-v4-flash

Próximo passo concreto, e faça o teste antes de fixar qualquer padrão no seu projeto: pegue UMA tarefa real do seu backlog, rode ela duas vezes no deepseek-v4-flash, uma com thinking enabled e outra com disabled

Compara três coisas: qualidade do resultado, tempo até a resposta e tokens de saída consumidos

Se a versão pensante não mudou o resultado, você acabou de descobrir que aquele fluxo inteiro pode rodar no modo direto

E isso, multiplicado por volume, é dinheiro de verdade…

até o próximo post!

Perguntas frequentes

O DeepSeek R1 ainda está disponível na API oficial da DeepSeek?

Não. A lista oficial de modelos da API hoje contém apenas deepseek-v4-flash e deepseek-v4-pro, e os nomes legados deepseek-chat e deepseek-reasoner foram desativados em 24/07/2026 às 15:59 UTC. Quem quer o comportamento do R1 hoje usa o modo pensante do deepseek-v4-flash; pra rodar o R1 original, o caminho é fora da API oficial, como no OpenRouter.

Qual é a diferença entre o DeepSeek R1 e o DeepSeek R1-0528?

O R1-0528 é uma atualização posterior do R1, publicada como repositório próprio no Hugging Face. No OpenRouter os preços mudam: o R1 original sai a US$ 0,70 de entrada e US$ 2,50 de saída por milhão de tokens com saída máxima de 16.000 tokens, enquanto o R1-0528 fica em US$ 0,50 de entrada e US$ 2,15 de saída, com saída máxima de 32.768 tokens.

Dá para rodar o DeepSeek R1 localmente em vez de usar a API?

Sim, existem versões destiladas do R1 baseadas nas séries Qwen2.5 e Llama3, nos tamanhos 1.5B, 7B, 8B, 14B, 32B e 70B. O repositório e os pesos estão sob licença MIT, com uso comercial, modificações e destilação permitidos, então dá pra escolher o tamanho que cabe no seu hardware.

Como ativar o raciocínio no DeepSeek V4 pela API?

O raciocínio virou parâmetro de requisição, não mais um modelo separado: você chama o deepseek-v4-flash ou o deepseek-v4-pro e passa o campo thinking com enabled ou disabled, como mostra o passo a passo do post. No modo pensante, a cadeia de raciocínio volta no campo reasoning_content, no mesmo nível do content.

O que é o reasoning_effort e qual o padrão dele no DeepSeek V4?

É o parâmetro que controla o esforço de raciocínio, com padrão high. No deepseek-v4-flash, os valores medium e xhigh são mapeados para high, então na prática o comportamento não muda; o deepseek-v4-pro por ora aceita apenas high e max.

Quanto custa usar o DeepSeek R1 fora da API oficial?

No OpenRouter, o deepseek/deepseek-r1 sai a US$ 0,70 por milhão de tokens de entrada e US$ 2,50 por milhão de saída, com janela de 163.840 tokens. Como o modelo de raciocínio gera bem mais tokens de saída que um modelo direto, é esse lado da conta que mais pesa no custo final.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares