Rodar o modelo na sua máquina: o que muda entre DeepSeek e Claude Code?

diferença entre rodar modelo local com DeepSeek e usar o Claude Code
Resposta rápida

Rodar modelo local e usar o Claude Code são coisas diferentes: o DeepSeek V4 é um modelo com pesos abertos sob licença MIT no Hugging Face, e o Claude Code é o cliente de linha de comando da Anthropic, que conversa no formato da Anthropic Messages API. Dá pra apontar a CLI pra um servidor na sua máquina (Ollama a partir da v0.14.0, LM Studio a partir da 0.4.1) com as variáveis ANTHROPIC_BASE_URL e ANTHROPIC_AUTH_TOKEN, só que a Anthropic diz na doc que não suporta rotear o Claude Code para modelos não-Claude. Hospedar resolve dado e previsibilidade, não resolve o fluxo de trabalho

Fala aí, beleza? A promessa de "rodar o modelo na minha máquina, sem depender de ninguém" voltou com força agora que o DeepSeek V4 saiu com pesos abertos

E aí vem a pergunta que eu vejo direto: "então eu troco o Claude Code pelo DeepSeek local?"

Calma que tem um mal-entendido no meio disso, e ele é grande

DeepSeek V4 é um MODELO

Claude Code é uma FERRAMENTA

São duas categorias diferentes, e confundir as duas é o que faz a galera achar que baixar peso resolve o fluxo de trabalho inteiro

Neste post eu separo as duas coisas, mostro o que muda de verdade quando você hospeda o modelo, e o passo a passo (com o que tá documentado) pra apontar o Claude Code pra um servidor rodando no seu computador

Bora?

O que é cada coisa: modelo com pesos abertos e cliente de linha de comando

Antes de comparar, tem que saber o que tá na mesa

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

O DeepSeek V4 é o modelo:

O DeepSeek V4 foi publicado com pesos abertos sob licença MIT no Hugging Face, com uso comercial permitido

Ou seja: você baixa o arquivo dos pesos e hospeda por conta própria, se tiver máquina pra isso

O lançamento de 24/04/2026 foi um preview

A variante V4-Pro só virou versão estável em 13/08/2026, com o checkpoint V4-Pro-0813

O Claude Code é o cliente:

O Claude Code é a ferramenta de linha de comando da Anthropic, e ele se comunica pelo formato da Anthropic Messages API

Repara na palavra: FORMATO

O Claude Code não é o cérebro, ele é o corpo: quem lê teus arquivos, roda comando, edita código e coordena as ferramentas

O cérebro chega por uma chamada de rede, num formato que ele entende

Se você já mexeu com NPM ou composer, é a mesma sensação de separar a ferramenta do pacote que ela instala: uma coisa é o gerenciador, outra é o conteúdo que ele puxa

E os pesos do Claude?

Não existem publicamente

A Anthropic nunca publicou os pesos dos modelos Claude, que seguem licença proprietária

Então "rodar o Claude na minha máquina" não é uma opção que exista hoje, ponto

O que existe é rodar OUTRO modelo na sua máquina e fazer o Claude Code falar com ele… o que é uma história bem diferente, e a gente chega lá

DeepSeek V4 x Claude Code: a comparação lado a lado

Comparar modelo com ferramenta é meio esquisito, eu sei

Mas é exatamente essa a confusão que o post veio resolver, então vamos botar lado a lado pra ficar visual

Critério DeepSeek V4 Claude Code
Natureza Modelo de linguagem Cliente CLI da Anthropic
Licença e pesos Pesos abertos sob licença MIT no Hugging Face, uso comercial permitido Modelos Claude são proprietários, sem pesos abertos publicados
Tamanhos V4-Pro: 1,6 trilhão de parâmetros totais e 49 bilhões ativos por token. V4-Flash: 284 bilhões totais e 13 bilhões ativos Não se aplica (é ferramenta, não modelo)
Janela de contexto 1 milhão de tokens nas duas variantes Depende do modelo por trás
Onde roda V4-Pro é classe servidor. V4-Flash é a variante pensada para deploy local Fala pelo formato da Anthropic Messages API
Provedores suportados Hospedagem própria ou API do DeepSeek API Anthropic direta, Amazon Bedrock, Google Cloud e Microsoft Foundry
Custo pela API Cobrança por faixa de horário desde 16/08/2026 às 16:00 UTC, com tarifa fora de pico 50% menor Conforme o provedor escolhido

Sobre a cobrança por faixa: o horário de pico da API do DeepSeek é 01:00 às 04:00 e 06:00 às 10:00 UTC

Todo o resto conta como fora de pico, com a tarifa 50% menor

Se teu trabalho pesado cai fora dessas janelas, isso muda a conta sozinho

Quando hospedar o modelo compensa e quando não muda nada

Agora a parte honesta

Hospedar resolve umas dores REAIS, e não resolve outras que a galera acha que resolve

Compensa quando:

  • Dado não pode sair da máquina. Cliente com contrato, código proprietário, base sensível. É o cenário mais legítimo de todos
  • Você quer previsibilidade. Sem medidor rodando por token, o custo vira hardware e energia, e não fatura variável
  • Você quer mexer nos pesos. Licença MIT com uso comercial permitido abre fine-tune, quantização, experimento seu
  • Você quer entender o que tá acontecendo. Rodar na sua máquina é a melhor aula de "o que esse negócio realmente faz"

Se a tua motivação é privacidade, vale ler antes como funciona o treino com conversas, porque às vezes a dor real já tem resposta sem precisar montar servidor

Não muda nada quando:

Aqui mora o "PC da Nasa"

A variante V4-Pro (1,6 trilhão de parâmetros totais) é classe servidor: inviável em placa de consumidor mesmo quantizado

A V4-Flash (284 bilhões totais, 13 bilhões ativos) é a variante pensada para deploy local

E tem o ponto mais importante do post: hospedar o modelo te entrega o modelo

Só isso

Não te entrega o agente, nem as ferramentas, nem o loop de edição de arquivo, nem o fluxo de trabalho da CLI

É como comprar o motor achando que veio o carro

Se você já brincou com modelo aberto rodando na própria máquina, sabe bem essa diferença entre "o modelo responde" e "o agente trabalha"

Como apontar o Claude Code para um modelo rodando na sua máquina

Bora ver na prática?

O truque todo é aquele detalhe lá do começo: o Claude Code fala o formato da Anthropic Messages API

Então qualquer servidor local que exponha esse mesmo formato vira um destino possível

  1. Escolha a ferramenta que expõe o formato da Anthropic. O Ollama passou a oferecer compatibilidade com a Anthropic Messages API a partir da v0.14.0, anunciada em 16/01/2026. O LM Studio expõe um endpoint /v1/messages compatível desde a versão 0.4.1, com suporte a streaming SSE e a tool use
  1. Se for de Ollama, aponte a CLI pro servidor local. A configuração documentada é feita por duas variáveis de ambiente:
export ANTHROPIC_BASE_URL=http://localhost:11434
export ANTHROPIC_AUTH_TOKEN=ollama
  1. Escolha um modelo com contexto suficiente pro Ollama. A recomendação da documentação é modelo com pelo menos 32K tokens de contexto. O erro comum deste passo: subir um modelo com janela curtinha e achar que a ferramenta tá bugada. Não tá, é o contexto estourando
  1. Se for de LM Studio, suba o servidor primeiro. Com a porta explícita:
lms server start --port 1234
  1. Aponte a CLI pro endereço do LM Studio. Mesmas duas variáveis, valores diferentes:
export ANTHROPIC_BASE_URL=http://localhost:1234
export ANTHROPIC_AUTH_TOKEN=lmstudio
  1. Respeite o piso de contexto do LM Studio. A recomendação é começar com pelo menos 25K tokens de contexto e aumentar pra melhorar o resultado, porque o Claude Code consome MUITO contexto. O erro comum deste passo é o mesmo do anterior, e por isso as duas ferramentas avisam a mesma coisa: janela curta demais e a sessão vira um festival de comportamento estranho
  1. Confira pra onde a sessão tá apontando. Dentro do Claude Code:
/status

O /status mostra provedor, base URL e proxy da sessão

O erro comum deste passo é não rodar ele

Sério: metade da confusão de "não funcionou" é variável exportada num terminal e Claude Code aberto em outro, então a sessão continua indo pro lugar de sempre

Checar antes de teorizar economiza uma tarde 🙂

O que hospedar o modelo não resolve no seu fluxo de trabalho

Aqui é onde eu preciso ser bem direto com você

A configuração acima funciona tecnicamente, mas ela mora FORA do caminho suportado

Os provedores oficialmente suportados pelo Claude Code são: API da Anthropic direta, Amazon Bedrock, plataforma do Google Cloud e Microsoft Foundry

E a própria Anthropic declara na documentação de gateways que não endossa, não mantém nem audita gateways de terceiros, e que não suporta rotear o Claude Code para modelos que não sejam Claude

O que isso significa na prática?

Que quando algo quebrar, o problema é teu

Sem canal de suporte, sem garantia de que a próxima versão da CLI vai continuar se comportando igual, sem ninguém auditando a ponta que você plugou

E some a isso a conta de verdade: o V4-Pro exige hardware classe servidor, o que joga o custo pra dentro do CapEx em vez do consumo

A alternativa sem montar servidor é a API do DeepSeek, que desde 16/08/2026 cobra por faixa de horário, com fora de pico 50% mais barato

Ou seja: existe um meio-termo entre "pago por token no caminho suportado" e "monto minha própria infra"

Não é binário como o hype vende

Veredito: quem deve rodar local e quem deve continuar na API

Sem enrolação, por perfil

Você tem restrição real de dados, ou já tem hardware de servidor, e quer pesos abertos: DeepSeek V4 faz muito sentido. Pra máquina local, a variante da vez é a Flash, porque a Pro é inviável em placa de consumidor mesmo quantizado

Você quer o fluxo do Claude Code funcionando de boa, sem sustos: fica no caminho suportado, que é API Anthropic, Amazon Bedrock, Google Cloud ou Microsoft Foundry. É pra isso que a ferramenta foi feita e é isso que tem suporte

Você quer experimentar Claude Code + modelo local: trate como EXPERIMENTO consciente, não como substituição do teu daily driver. A configuração tá documentada pelo Ollama e pelo LM Studio, mas a Anthropic diz na doc que não suporta esse roteamento. Sabendo disso, brinca à vontade

O que eu não vou fazer é jurar que o resultado do modelo local vai ser equivalente

Não tenho material próprio pra afirmar isso, e chutar qualidade por achismo é exatamente o tipo de coisa que enche a internet de post inútil

Conclusão

Recapitulando o essencial:

DeepSeek V4 é modelo (pesos abertos, licença MIT, Hugging Face, V4-Pro em GA desde 13/08/2026)

Claude Code é ferramenta (cliente CLI que fala o formato da Anthropic Messages API)

Hospedar o primeiro não te dá o segundo, e é por isso que "rodar modelo local" resolve dado e previsibilidade, mas não resolve fluxo de trabalho sozinho

O próximo passo é bem barato: abre o Claude Code e roda /status pra ver pra onde a tua sessão aponta hoje

Depois olha teu hardware com honestidade e decide o experimento pela variante Flash, que é a pensada pra local

Essa é a ordem certa: entender a distinção, medir a máquina, aí experimentar

até o próximo post! =)

Perguntas frequentes

Dá pra rodar o Claude Code contra um modelo local sem passar pela API da Anthropic?

Tecnicamente sim, apontando o ANTHROPIC_BASE_URL e o ANTHROPIC_AUTH_TOKEN pro servidor que você subiu na sua máquina. Mas isso não é um caminho endossado: a Anthropic não dá suporte, não mantém nem audita esse tipo de roteamento pra modelos que não são Claude.

Qual variante do DeepSeek V4 dá pra rodar em casa, sem servidor?

A V4-Flash, com 284 bilhões de parâmetros totais e 13 bilhões ativos por token, é a variante pensada pra deploy local. Já a V4-Pro, com 1,6 trilhão de parâmetros totais, é classe servidor e inviável em placa de consumidor mesmo quantizada.

Quanto de contexto preciso configurar pro Claude Code funcionar com um modelo local?

Depende de qual servidor você usa. O Ollama recomenda pelo menos 32K tokens de contexto, enquanto o LM Studio sugere começar com no mínimo 25K e subir a partir daí pra melhores resultados.

Como eu confirmo que o Claude Code está mesmo conversando com o servidor local, e não com a Anthropic?

Roda o comando /status dentro do Claude Code. Ele mostra o provedor, a base URL e o proxy que a sessão está usando naquele momento.

Posso usar os pesos do DeepSeek V4 num produto comercial?

Sim, os pesos foram publicados sob licença MIT no Hugging Face, e essa licença permite uso comercial. Isso vale pra download e hospedagem própria do modelo, não pro Claude Code, que continua sendo só o cliente que fala com ele.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares