OpenClaw com Ollama: dá para rodar o agente com modelo local em vez de API paga?

OpenClaw com Ollama rodando modelo local em vez de API paga
Resposta rápida

Sim, dá pra rodar o OpenClaw com Ollama: o Ollama é provider oficial do agente e o comando ollama launch openclaw instala e configura tudo em um passo. A questão real é se compensa. No local você zera o custo por token e mantém o dado na máquina, mas a doc do OpenClaw fala em 2 ou mais Mac Studios topo de linha (ou rig equivalente) pra um loop de agente confortável, contra 1 vCPU e 1 GB de RAM apontando pra nuvem. Some contexto de 64k no mínimo e tool call que às vezes vem só como texto: a conta muda de lugar, não some.

Fala aí, beleza? Quem já colocou um agente de IA pra trabalhar sozinho de verdade conhece a sensação: o agente roda feliz, e a fatura por token roda junto com ele

Aí vem a pergunta óbvia: e se o modelo rodasse aqui na minha máquina, sem passar o cartão?

O OpenClaw é um agente de IA open source e self-hosted, licença MIT, repositório openclaw/openclaw, que roda na sua própria máquina e conecta apps de mensagem (WhatsApp, Telegram, Slack, Discord, iMessage) a modelos de IA, executando ações como shell, navegador, e-mail, calendário e arquivos

Segundo o próprio repositório oficial no GitHub, ele foi criado por Peter Steinberger e já se chamou Clawdbot e depois Moltbot antes do nome atual

Do outro lado da mesa tem o Ollama: MIT também, gratuito pra baixar e usar, rodando modelos abertos localmente em macOS, Linux e Windows

E os dois conversam oficialmente: o Ollama é um provider documentado do OpenClaw, com página de integração nas duas documentações

Ou seja, a pergunta "dá pra fazer?" é sim, e é chata de tão sim

A pergunta que interessa é outra: essa troca compensa pra você?

Bora destrinchar isso…

OpenClaw com modelo local (Ollama) x OpenClaw com API na nuvem:

Coloquei lado a lado só o que dá pra checar na documentação das duas ferramentas, sem chute de benchmark

Formação Agentes de IA
Formação Recomendada

Formação Agentes de IA

Domine a criação de Agentes de IA e Venda para Empresas

  • 402 aulas
  • 32 projetos
  • 38h 19min

Um aviso antes da tabela, porque isso confunde muita gente: quando eu falo "modelo de API na nuvem" aqui, é qualquer provedor de API que você aponte o agente pra ele, seja qual for

O Ollama Cloud, que aparece mais pra frente no post, é outra coisa: é o serviço pago do próprio ecossistema Ollama, com planos e limites próprios

O que pesa na decisãoModelo local via OllamaModelo de API na nuvem (qualquer provedor)
Custo por tokenNão existe cobrança por token: o Ollama é gratuito pra baixar e usarVocê paga por uso, e a conta acompanha o quanto o agente trabalha
Requisito de máquinaA doc do OpenClaw diz que a meta pra um loop de agente confortável é 2 ou mais Mac Studios topo de linha, ou um rig de GPU equivalenteMínimo absoluto de 1 vCPU e 1 GB de RAM, com 2 GB ou mais recomendado pra múltiplos canais, automação de navegador ou ferramentas de mídia
Máquina modestaUma GPU única de 24 GB só dá conta de prompts mais leves, e com latência mais altaNão muda nada: o peso está do outro lado
Privacidade e filtrosO modelo local não passa pelos filtros do provedor, então o controle (e a responsabilidade) é todo seuVocê ganha os filtros do provedor no caminho
Janela de contextoA doc do Ollama recomenda pelo menos 64k tokens ao usar modelo local com OpenClaw, porque o agente exige contexto grandeVocê escolhe o modelo pela janela que ele já entrega
Preflight de contextoO OpenClaw avisa abaixo de 20% da janela detectada (piso de 8k) e bloqueia de vez abaixo de 10% (piso de 4k)Mesma régua, só que sobra folga mais fácil
Tool callingAlguns modelos locais emitem texto que só PARECE chamada de ferramenta (JSON, XML ou estilo ReAct): o OpenClaw deixa como texto e registra um avisoMenos exposto a esse tipo de incompatibilidade de parser
Prompt injectionCheckpoints pequenos ou muito quantizados aumentam o risco, por isso a orientação é rodar a maior variante que você conseguir hospedarA doc recomenda escolher o modelo mais forte da geração mais recente disponível no seu stack

Repara numa coisa: em nenhuma linha o custo simplesmente desaparece

Ele muda de endereço, vai da fatura pro hardware, pra latência e pro seu tempo de configuração

Em que tipo de tarefa a troca compensa (e em qual não)

Essa é a parte que quase ninguém fala, então vamos separar direitinho

Onde o modelo local faz MUITO sentido:

  • Dado que não pode sair da máquina: se o conteúdo é sensível, o local resolve o problema na raiz, porque nada sobe
  • Agente estreito e repetitivo: a própria doc do OpenClaw recomenda manter agentes estreitos com modelo local, e tarefa estreita é justamente onde modelo aberto se comporta melhor
  • Prompts leves: se o teu caso é uma GPU única de 24 GB, é exatamente esse o cenário que a doc diz que ela aguenta
  • Quem já tem rig parado: se a máquina já existe e está ociosa, o cálculo de custo fica bem diferente de quem precisaria comprar tudo agora

Onde eu não me iludiria:

  • Loop longo de agente com muitas ferramentas: é justamente o cenário que faz a doc falar em 2 ou mais Mac Studios topo de linha ou rig equivalente
  • Tarefa que depende de tool calling estruturado confiável: se o modelo devolve algo que parece chamada de ferramenta mas não é invocação estruturada, o OpenClaw deixa aquilo como texto e loga um warning, e teu fluxo simplesmente não acontece
  • Uma GPU de 24 GB com o agente ligado o dia inteiro: latência mais alta em prompts leves não vira produtividade, vira espera

E tem um detalhe de segurança que não é frescura: modelo local não passa pelos filtros do provedor

A orientação da doc é clara: rode sempre a maior variante full-size que der pra hospedar, mantenha o agente estreito e ative compaction pra limitar o raio de dano de um prompt injection

Se você for de modelo pequeno mesmo assim, aí liga sandbox e allowlist estrita de ferramentas

Bot com acesso a shell, navegador e arquivos rodando modelo mini sem guardrails (limites) é pedir pra apanhar 😅

Como ligar o OpenClaw no Ollama

A melhor notícia dessa integração é que o caminho curto é curto de verdade

  1. Instale o Ollama na tua máquina (macOS, Linux ou Windows, gratuito pra baixar e usar)
  1. Rode o comando de um passo, que instala e configura o OpenClaw de uma vez:
ollama launch openclaw

Se o OpenClaw não estiver no sistema, o Ollama detecta e propõe a instalação

Segundo a documentação do Ollama, esse launch configura o provider, instala o daemon do gateway, define o modelo escolhido como primário e ainda ativa a busca web do Ollama embutida no OpenClaw

  1. Escolha o modelo direto no comando, se você já sabe qual quer (troque nome-do-modelo pelo nome real):
ollama launch openclaw --model nome-do-modelo
  1. Use o modo sem interação pra Docker, CI/CD ou scripts, com a flag --yes:
ollama launch openclaw --model kimi-k2.5:cloud --yes

O erro comum deste passo: usar --yes sozinho

A flag exige --model, então sem informar o modelo o teu script não vai pra frente

  1. Prefere o caminho manual? A doc do OpenClaw documenta o fluxo puxando o modelo e apontando o agente pra ele:
ollama pull llama3.3

E na configuração do agente:

agents.defaults.model.primary: "ollama/llama3.3"

O erro comum deste passo: subir um modelo local com janela de contexto apertada

A recomendação da doc do Ollama é pelo menos 64k tokens pra usar modelo local com OpenClaw, porque o agente é faminto por contexto

  1. Descubra os nomes exatos dos modelos em vez de chutar:
ollama list
openclaw models list --provider ollama

O erro comum deste passo: escrever o nome do modelo de cabeça e ficar caçando fantasma na configuração

  1. Se você vem do nome antigo, relaxa: ollama launch clawdbot continua funcionando como alias e executa o OpenClaw do mesmo jeito

Tem ainda o caminho alternativo que a própria doc do OpenClaw chama de menor atrito pra começar com modelo local: usar LM Studio ou Ollama e rodar o onboarding

openclaw onboard

O que costuma quebrar no setup local (e como prevenir)

Aqui vão três dores clássicas de setup local, cada uma com causa e saída

Sintoma: o agente "responde" um JSON, um XML ou um texto estilo ReAct em vez de executar a ferramenta

Causa: alguns modelos locais emitem texto que só parece chamada de ferramenta, sem ser invocação estruturada

Isso é incompatibilidade de modelo ou de provider, não é execução de ferramenta

Solução: o parser e o chat template do servidor precisam suportar tool calls

O OpenClaw, nesse caso, deixa o conteúdo como texto e registra um aviso, então o warning é a tua pista

Dá também pra sobrescrever o tool_choice padrão (que é auto) por modelo

Sintoma: a requisição é bloqueada por contexto

Causa: o OpenClaw aplica um preflight de janela de contexto derivado da janela detectada do modelo

Abaixo de 20% ele avisa (com piso de 8k) e abaixo de 10% ele bloqueia de vez (com piso de 4k)

Solução: é exatamente por isso que a recomendação é de 64k tokens no mínimo pra modelo local

Contexto curto num agente não é economia, é bloqueio garantido

Sintoma: o modelo não aparece sozinho na lista

Causa: a autodescoberta do OpenClaw roda em http://127.0.0.1:11434 quando existe OLLAMA_API_KEY definido e nenhum provider customizado

Ela é desligada se você definir um array de models explícito, ou um provider customizado com baseUrl fora do loopback

Solução: entenda a convenção da chave antes de sair colando valor

Um OLLAMA_API_KEY puro é tratado como convenção do Ollama Cloud e, por padrão, não é enviado pra hosts locais ou self-hosted

Pra providers OpenAI-compatíveis locais, aceita-se um marcador não secreto como apiKey: "ollama-local" quando a baseUrl resolve pra loopback ou pra LAN privada

E a prevenção que vale pros três casos é a mesma receita da doc: modelo full-size, agente estreito, compaction ligado, mais sandbox e allowlist estrita se o modelo for pequeno

O meio-termo: Ollama Cloud e outros runtimes locais

"Matheus, e quem não tem PC da Nasa?"

Tem saída, e ela está dentro do mesmo ecossistema

Só reforçando a diferença que citei lá em cima: o Ollama Cloud é o serviço pago do Ollama, não é o "provedor de API genérico" da tabela comparativa

No setup do provider Ollama dá pra escolher entre três modos: Cloud + Local, Cloud only ou Local only

O Ollama Cloud inclusive tem página de provider própria na documentação do OpenClaw

Os planos verificados hoje:

  • Free: US$ 0, incluso com a conta Ollama
  • Pro: US$ 20/mês ou US$ 200/ano, com 3 modelos cloud simultâneos e 50x mais uso
  • Team: US$ 25 por assento/mês, com mínimo de 5 assentos (US$ 125/mês)
  • Max: novas assinaturas pausadas enquanto a empresa adiciona capacidade, e quem já assina mantém plano, limites e preço

E aqui vai um detalhe que confunde muita gente: os limites do Ollama Cloud não são um número fixo de tokens

São limites de uso por sessão, que zeram a cada 5 horas, e limites semanais, que zeram a cada 7 dias

Eles variam conforme o modelo e conforme os tokens de entrada, entrada em cache e saída

Se a tua ideia é hospedar o agente fora da tua máquina apontando pra modelos na nuvem, lembra que o requisito de máquina despenca: 1 vCPU e 1 GB de RAM é o mínimo absoluto, com 2 GB ou mais recomendado pra múltiplos canais, automação de navegador ou ferramentas de mídia

É um cenário bem confortável pra quem já tem o hábito de rodar agentes de IA numa VPS

E se você quiser local sem ser via Ollama, o OpenClaw aceita outros runtimes, desde que exponham endpoint no padrão OpenAI: MLX (mlx_lm.server), vLLM, SGLang, LiteLLM, OAI-proxy ou qualquer gateway com /v1/chat/completions

Vale a pena trocar a API paga pelo modelo local no OpenClaw?

Vou ser direto, sem ficar em cima do muro

Se você tem hardware de sobra e trabalha com dado sensível: vale, e vale muito

O dado não sai da máquina, o custo por token some e você segue com um agente open source, self-hosted, do começo ao fim

Se a tua motivação é só fugir da fatura e a tua máquina é uma GPU de 24 GB: aí muda de figura

Pela própria doc do OpenClaw, esse hardware serve pra prompts mais leves e com latência mais alta

Você não elimina o custo, você troca dinheiro por espera e por risco de tool call inconsistente

E se for pra montar o melhor stack local possível, a doc do OpenClaw aponta LM Studio com um modelo grande em versão completa (Qwen, DeepSeek ou Llama)

Quem nunca mexeu com isso, vale entender antes como rodar modelos abertos localmente e só depois plugar o agente por cima

A régua final é a mesma da FAQ do OpenClaw: escolha o modelo mais forte e de geração mais recente disponível no teu stack de provider

Não é frescura de qualidade só: modelo mais forte também significa menor risco de prompt injection

Conclusão

A resposta honesta pro título é: dá pra rodar, e o custo não some, ele só troca de forma

Ele vira hardware, vira latência e vira trabalho de configuração

Pra quem tem máquina e dado sensível, essa troca é ótima

Pra quem só quer fugir do medidor com uma GPU modesta, ela costuma sair mais cara em tempo do que parecia no papel

O próximo passo é barato e resolve a dúvida sem teoria: roda ollama launch openclaw, testa num agente ESTREITO, com um modelo full-size e janela de pelo menos 64k, e compara o mesmo agente apontado pra nuvem

Aí a decisão para de ser achismo e vira comparação 😀

Me conta nos comentários qual setup tu tá rodando aí: local, cloud ou os dois no mesmo provider?

Até o próximo post!

Perguntas frequentes

Rodar o OpenClaw com Ollama tem algum custo?

O Ollama é MIT License, gratuito pra baixar e usar, então rodar modelo local não gera cobrança por token. O que existe de pago dentro do mesmo ecossistema é o Ollama Cloud (que é o serviço do próprio Ollama, não um provedor de API qualquer): ele tem plano Free incluso na conta e plano Pro por US$ 20 por mês (ou US$ 200 por ano), com 3 modelos cloud simultâneos e 50x mais uso

Como escolher qual modelo local o OpenClaw vai usar no Ollama?

Os nomes exatos dos modelos disponíveis saem de ollama list ou de openclaw models list --provider ollama. Depois é só apontar o modelo primário na configuração do agente, algo como agents.defaults.model.primary: "ollama/llama3.3", depois de rodar ollama pull llama3.3

Qual janela de contexto o modelo local precisa ter pra funcionar bem no OpenClaw?

A documentação do Ollama recomenda pelo menos 64k tokens ao usar modelo local com OpenClaw, porque o agente exige contexto grande. O próprio OpenClaw ainda aplica um preflight: aviso abaixo de 20% da janela detectada (piso de 8k) e bloqueio duro abaixo de 10% (piso de 4k)

O comando ollama launch clawdbot ainda funciona depois da mudança de nome?

Funciona sim. O alias antigo ollama launch clawdbot continua executando o OpenClaw normalmente. Segundo o repositório oficial no GitHub, o projeto passou por Clawdbot e depois Moltbot antes do nome atual, e foi criado por Peter Steinberger

Dá pra usar outro runtime local além do Ollama com o OpenClaw?

Dá. Além do Ollama, o OpenClaw aceita MLX (mlx_lm.server), vLLM, SGLang, LiteLLM, OAI-proxy ou qualquer gateway que exponha endpoint no padrão OpenAI em /v1/chat/completions

Vale a pena assinar o Ollama Cloud em vez de rodar 100% local?

Depende do quanto tua máquina aguenta. Vale lembrar que o Ollama Cloud é a alternativa paga dentro do próprio ecossistema do Ollama, coisa diferente de apontar o agente pra API de outro provedor. Ele tem plano Free incluso na conta e Pro a US$ 20 por mês. Tem também o plano Team, cobrado por assento a US$ 25 com mínimo de 5 assentos (US$ 125 por mês), e o plano Max, que está com novas assinaturas pausadas enquanto assinantes atuais mantêm plano, limites e preço



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares