OpenClaw com Ollama: dá para rodar o agente com modelo local em vez de API paga?

Sim, dá pra rodar o OpenClaw com Ollama: o Ollama é provider oficial do agente e o comando ollama launch openclaw instala e configura tudo em um passo. A questão real é se compensa. No local você zera o custo por token e mantém o dado na máquina, mas a doc do OpenClaw fala em 2 ou mais Mac Studios topo de linha (ou rig equivalente) pra um loop de agente confortável, contra 1 vCPU e 1 GB de RAM apontando pra nuvem. Some contexto de 64k no mínimo e tool call que às vezes vem só como texto: a conta muda de lugar, não some.
Fala aí, beleza? Quem já colocou um agente de IA pra trabalhar sozinho de verdade conhece a sensação: o agente roda feliz, e a fatura por token roda junto com ele
Aí vem a pergunta óbvia: e se o modelo rodasse aqui na minha máquina, sem passar o cartão?
O OpenClaw é um agente de IA open source e self-hosted, licença MIT, repositório openclaw/openclaw, que roda na sua própria máquina e conecta apps de mensagem (WhatsApp, Telegram, Slack, Discord, iMessage) a modelos de IA, executando ações como shell, navegador, e-mail, calendário e arquivos
Segundo o próprio repositório oficial no GitHub, ele foi criado por Peter Steinberger e já se chamou Clawdbot e depois Moltbot antes do nome atual
Do outro lado da mesa tem o Ollama: MIT também, gratuito pra baixar e usar, rodando modelos abertos localmente em macOS, Linux e Windows
E os dois conversam oficialmente: o Ollama é um provider documentado do OpenClaw, com página de integração nas duas documentações
Ou seja, a pergunta "dá pra fazer?" é sim, e é chata de tão sim
A pergunta que interessa é outra: essa troca compensa pra você?
Bora destrinchar isso…
OpenClaw com modelo local (Ollama) x OpenClaw com API na nuvem:
Coloquei lado a lado só o que dá pra checar na documentação das duas ferramentas, sem chute de benchmark
Formação Agentes de IA
Domine a criação de Agentes de IA e Venda para Empresas
- 402 aulas
- 32 projetos
- 38h 19min
Um aviso antes da tabela, porque isso confunde muita gente: quando eu falo "modelo de API na nuvem" aqui, é qualquer provedor de API que você aponte o agente pra ele, seja qual for
O Ollama Cloud, que aparece mais pra frente no post, é outra coisa: é o serviço pago do próprio ecossistema Ollama, com planos e limites próprios
| O que pesa na decisão | Modelo local via Ollama | Modelo de API na nuvem (qualquer provedor) |
|---|---|---|
| Custo por token | Não existe cobrança por token: o Ollama é gratuito pra baixar e usar | Você paga por uso, e a conta acompanha o quanto o agente trabalha |
| Requisito de máquina | A doc do OpenClaw diz que a meta pra um loop de agente confortável é 2 ou mais Mac Studios topo de linha, ou um rig de GPU equivalente | Mínimo absoluto de 1 vCPU e 1 GB de RAM, com 2 GB ou mais recomendado pra múltiplos canais, automação de navegador ou ferramentas de mídia |
| Máquina modesta | Uma GPU única de 24 GB só dá conta de prompts mais leves, e com latência mais alta | Não muda nada: o peso está do outro lado |
| Privacidade e filtros | O modelo local não passa pelos filtros do provedor, então o controle (e a responsabilidade) é todo seu | Você ganha os filtros do provedor no caminho |
| Janela de contexto | A doc do Ollama recomenda pelo menos 64k tokens ao usar modelo local com OpenClaw, porque o agente exige contexto grande | Você escolhe o modelo pela janela que ele já entrega |
| Preflight de contexto | O OpenClaw avisa abaixo de 20% da janela detectada (piso de 8k) e bloqueia de vez abaixo de 10% (piso de 4k) | Mesma régua, só que sobra folga mais fácil |
| Tool calling | Alguns modelos locais emitem texto que só PARECE chamada de ferramenta (JSON, XML ou estilo ReAct): o OpenClaw deixa como texto e registra um aviso | Menos exposto a esse tipo de incompatibilidade de parser |
| Prompt injection | Checkpoints pequenos ou muito quantizados aumentam o risco, por isso a orientação é rodar a maior variante que você conseguir hospedar | A doc recomenda escolher o modelo mais forte da geração mais recente disponível no seu stack |
Repara numa coisa: em nenhuma linha o custo simplesmente desaparece
Ele muda de endereço, vai da fatura pro hardware, pra latência e pro seu tempo de configuração
Em que tipo de tarefa a troca compensa (e em qual não)
Essa é a parte que quase ninguém fala, então vamos separar direitinho
Onde o modelo local faz MUITO sentido:
- Dado que não pode sair da máquina: se o conteúdo é sensível, o local resolve o problema na raiz, porque nada sobe
- Agente estreito e repetitivo: a própria doc do OpenClaw recomenda manter agentes estreitos com modelo local, e tarefa estreita é justamente onde modelo aberto se comporta melhor
- Prompts leves: se o teu caso é uma GPU única de 24 GB, é exatamente esse o cenário que a doc diz que ela aguenta
- Quem já tem rig parado: se a máquina já existe e está ociosa, o cálculo de custo fica bem diferente de quem precisaria comprar tudo agora
Onde eu não me iludiria:
- Loop longo de agente com muitas ferramentas: é justamente o cenário que faz a doc falar em 2 ou mais Mac Studios topo de linha ou rig equivalente
- Tarefa que depende de tool calling estruturado confiável: se o modelo devolve algo que parece chamada de ferramenta mas não é invocação estruturada, o OpenClaw deixa aquilo como texto e loga um warning, e teu fluxo simplesmente não acontece
- Uma GPU de 24 GB com o agente ligado o dia inteiro: latência mais alta em prompts leves não vira produtividade, vira espera
E tem um detalhe de segurança que não é frescura: modelo local não passa pelos filtros do provedor
A orientação da doc é clara: rode sempre a maior variante full-size que der pra hospedar, mantenha o agente estreito e ative compaction pra limitar o raio de dano de um prompt injection
Se você for de modelo pequeno mesmo assim, aí liga sandbox e allowlist estrita de ferramentas
Bot com acesso a shell, navegador e arquivos rodando modelo mini sem guardrails (limites) é pedir pra apanhar 😅
Como ligar o OpenClaw no Ollama
A melhor notícia dessa integração é que o caminho curto é curto de verdade
- Instale o Ollama na tua máquina (macOS, Linux ou Windows, gratuito pra baixar e usar)
- Rode o comando de um passo, que instala e configura o OpenClaw de uma vez:
ollama launch openclawSe o OpenClaw não estiver no sistema, o Ollama detecta e propõe a instalação
Segundo a documentação do Ollama, esse launch configura o provider, instala o daemon do gateway, define o modelo escolhido como primário e ainda ativa a busca web do Ollama embutida no OpenClaw
- Escolha o modelo direto no comando, se você já sabe qual quer (troque
nome-do-modelopelo nome real):
ollama launch openclaw --model nome-do-modelo- Use o modo sem interação pra Docker, CI/CD ou scripts, com a flag
--yes:
ollama launch openclaw --model kimi-k2.5:cloud --yesO erro comum deste passo: usar --yes sozinho
A flag exige --model, então sem informar o modelo o teu script não vai pra frente
- Prefere o caminho manual? A doc do OpenClaw documenta o fluxo puxando o modelo e apontando o agente pra ele:
ollama pull llama3.3E na configuração do agente:
agents.defaults.model.primary: "ollama/llama3.3"O erro comum deste passo: subir um modelo local com janela de contexto apertada
A recomendação da doc do Ollama é pelo menos 64k tokens pra usar modelo local com OpenClaw, porque o agente é faminto por contexto
- Descubra os nomes exatos dos modelos em vez de chutar:
ollama list
openclaw models list --provider ollamaO erro comum deste passo: escrever o nome do modelo de cabeça e ficar caçando fantasma na configuração
- Se você vem do nome antigo, relaxa:
ollama launch clawdbotcontinua funcionando como alias e executa o OpenClaw do mesmo jeito
Tem ainda o caminho alternativo que a própria doc do OpenClaw chama de menor atrito pra começar com modelo local: usar LM Studio ou Ollama e rodar o onboarding
openclaw onboardO que costuma quebrar no setup local (e como prevenir)
Aqui vão três dores clássicas de setup local, cada uma com causa e saída
Sintoma: o agente "responde" um JSON, um XML ou um texto estilo ReAct em vez de executar a ferramenta
Causa: alguns modelos locais emitem texto que só parece chamada de ferramenta, sem ser invocação estruturada
Isso é incompatibilidade de modelo ou de provider, não é execução de ferramenta
Solução: o parser e o chat template do servidor precisam suportar tool calls
O OpenClaw, nesse caso, deixa o conteúdo como texto e registra um aviso, então o warning é a tua pista
Dá também pra sobrescrever o tool_choice padrão (que é auto) por modelo
Sintoma: a requisição é bloqueada por contexto
Causa: o OpenClaw aplica um preflight de janela de contexto derivado da janela detectada do modelo
Abaixo de 20% ele avisa (com piso de 8k) e abaixo de 10% ele bloqueia de vez (com piso de 4k)
Solução: é exatamente por isso que a recomendação é de 64k tokens no mínimo pra modelo local
Contexto curto num agente não é economia, é bloqueio garantido
Sintoma: o modelo não aparece sozinho na lista
Causa: a autodescoberta do OpenClaw roda em http://127.0.0.1:11434 quando existe OLLAMA_API_KEY definido e nenhum provider customizado
Ela é desligada se você definir um array de models explícito, ou um provider customizado com baseUrl fora do loopback
Solução: entenda a convenção da chave antes de sair colando valor
Um OLLAMA_API_KEY puro é tratado como convenção do Ollama Cloud e, por padrão, não é enviado pra hosts locais ou self-hosted
Pra providers OpenAI-compatíveis locais, aceita-se um marcador não secreto como apiKey: "ollama-local" quando a baseUrl resolve pra loopback ou pra LAN privada
E a prevenção que vale pros três casos é a mesma receita da doc: modelo full-size, agente estreito, compaction ligado, mais sandbox e allowlist estrita se o modelo for pequeno
O meio-termo: Ollama Cloud e outros runtimes locais
"Matheus, e quem não tem PC da Nasa?"
Tem saída, e ela está dentro do mesmo ecossistema
Só reforçando a diferença que citei lá em cima: o Ollama Cloud é o serviço pago do Ollama, não é o "provedor de API genérico" da tabela comparativa
No setup do provider Ollama dá pra escolher entre três modos: Cloud + Local, Cloud only ou Local only
O Ollama Cloud inclusive tem página de provider própria na documentação do OpenClaw
Os planos verificados hoje:
- Free: US$ 0, incluso com a conta Ollama
- Pro: US$ 20/mês ou US$ 200/ano, com 3 modelos cloud simultâneos e 50x mais uso
- Team: US$ 25 por assento/mês, com mínimo de 5 assentos (US$ 125/mês)
- Max: novas assinaturas pausadas enquanto a empresa adiciona capacidade, e quem já assina mantém plano, limites e preço
E aqui vai um detalhe que confunde muita gente: os limites do Ollama Cloud não são um número fixo de tokens
São limites de uso por sessão, que zeram a cada 5 horas, e limites semanais, que zeram a cada 7 dias
Eles variam conforme o modelo e conforme os tokens de entrada, entrada em cache e saída
Se a tua ideia é hospedar o agente fora da tua máquina apontando pra modelos na nuvem, lembra que o requisito de máquina despenca: 1 vCPU e 1 GB de RAM é o mínimo absoluto, com 2 GB ou mais recomendado pra múltiplos canais, automação de navegador ou ferramentas de mídia
É um cenário bem confortável pra quem já tem o hábito de rodar agentes de IA numa VPS
E se você quiser local sem ser via Ollama, o OpenClaw aceita outros runtimes, desde que exponham endpoint no padrão OpenAI: MLX (mlx_lm.server), vLLM, SGLang, LiteLLM, OAI-proxy ou qualquer gateway com /v1/chat/completions
Vale a pena trocar a API paga pelo modelo local no OpenClaw?
Vou ser direto, sem ficar em cima do muro
Se você tem hardware de sobra e trabalha com dado sensível: vale, e vale muito
O dado não sai da máquina, o custo por token some e você segue com um agente open source, self-hosted, do começo ao fim
Se a tua motivação é só fugir da fatura e a tua máquina é uma GPU de 24 GB: aí muda de figura
Pela própria doc do OpenClaw, esse hardware serve pra prompts mais leves e com latência mais alta
Você não elimina o custo, você troca dinheiro por espera e por risco de tool call inconsistente
E se for pra montar o melhor stack local possível, a doc do OpenClaw aponta LM Studio com um modelo grande em versão completa (Qwen, DeepSeek ou Llama)
Quem nunca mexeu com isso, vale entender antes como rodar modelos abertos localmente e só depois plugar o agente por cima
A régua final é a mesma da FAQ do OpenClaw: escolha o modelo mais forte e de geração mais recente disponível no teu stack de provider
Não é frescura de qualidade só: modelo mais forte também significa menor risco de prompt injection
Conclusão
A resposta honesta pro título é: dá pra rodar, e o custo não some, ele só troca de forma
Ele vira hardware, vira latência e vira trabalho de configuração
Pra quem tem máquina e dado sensível, essa troca é ótima
Pra quem só quer fugir do medidor com uma GPU modesta, ela costuma sair mais cara em tempo do que parecia no papel
O próximo passo é barato e resolve a dúvida sem teoria: roda ollama launch openclaw, testa num agente ESTREITO, com um modelo full-size e janela de pelo menos 64k, e compara o mesmo agente apontado pra nuvem
Aí a decisão para de ser achismo e vira comparação 😀
Me conta nos comentários qual setup tu tá rodando aí: local, cloud ou os dois no mesmo provider?
Até o próximo post!
Perguntas frequentes
Rodar o OpenClaw com Ollama tem algum custo?
O Ollama é MIT License, gratuito pra baixar e usar, então rodar modelo local não gera cobrança por token. O que existe de pago dentro do mesmo ecossistema é o Ollama Cloud (que é o serviço do próprio Ollama, não um provedor de API qualquer): ele tem plano Free incluso na conta e plano Pro por US$ 20 por mês (ou US$ 200 por ano), com 3 modelos cloud simultâneos e 50x mais uso
Como escolher qual modelo local o OpenClaw vai usar no Ollama?
Os nomes exatos dos modelos disponíveis saem de ollama list ou de openclaw models list --provider ollama. Depois é só apontar o modelo primário na configuração do agente, algo como agents.defaults.model.primary: "ollama/llama3.3", depois de rodar ollama pull llama3.3
Qual janela de contexto o modelo local precisa ter pra funcionar bem no OpenClaw?
A documentação do Ollama recomenda pelo menos 64k tokens ao usar modelo local com OpenClaw, porque o agente exige contexto grande. O próprio OpenClaw ainda aplica um preflight: aviso abaixo de 20% da janela detectada (piso de 8k) e bloqueio duro abaixo de 10% (piso de 4k)
O comando ollama launch clawdbot ainda funciona depois da mudança de nome?
Funciona sim. O alias antigo ollama launch clawdbot continua executando o OpenClaw normalmente. Segundo o repositório oficial no GitHub, o projeto passou por Clawdbot e depois Moltbot antes do nome atual, e foi criado por Peter Steinberger
Dá pra usar outro runtime local além do Ollama com o OpenClaw?
Dá. Além do Ollama, o OpenClaw aceita MLX (mlx_lm.server), vLLM, SGLang, LiteLLM, OAI-proxy ou qualquer gateway que exponha endpoint no padrão OpenAI em /v1/chat/completions
Vale a pena assinar o Ollama Cloud em vez de rodar 100% local?
Depende do quanto tua máquina aguenta. Vale lembrar que o Ollama Cloud é a alternativa paga dentro do próprio ecossistema do Ollama, coisa diferente de apontar o agente pra API de outro provedor. Ele tem plano Free incluso na conta e Pro a US$ 20 por mês. Tem também o plano Team, cobrado por assento a US$ 25 com mínimo de 5 assentos (US$ 125 por mês), e o plano Max, que está com novas assinaturas pausadas enquanto assinantes atuais mantêm plano, limites e preço
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

As diferenças de var, let e const

Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]

ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]
