Hermes Agent com Ollama vale a pena? O que muda quando o modelo roda na sua máquina

Hermes Agent com Ollama tira a chave de API e a assinatura da conta, mas cobra em hardware. O agente é gratuito e open source (licença MIT) nos dois caminhos, então o que muda mesmo é o provedor de inferência: local não manda dado pra fora, nuvem via Nous Portal cobre mais de 300 modelos com um login só. O ponto duro é contexto: o Hermes exige no mínimo 64.000 tokens, e isso se ajusta no servidor do Ollama (OLLAMA_CONTEXT_LENGTH ou Modelfile), nunca pela chamada da API. E modelo pequeno ainda erra chamada de ferramenta
Um agente completo rodando na sua máquina, sem chave de API, sem assinatura e sem um byte do seu código saindo dali
Soa bom demais, né? 🙂
Aí vem a parte que quase ninguém fala: o Hermes Agent é gratuito e open source sob licença MIT, no repositório oficial NousResearch/hermes-agent (que hoje acumula 222,6 mil stars)
Ou seja: o software não custa nada nem no caminho local nem no caminho nuvem
O que muda entre um e outro é o provedor de inferência, e tudo que vem junto com ele: privacidade, latência, ferramentas disponíveis e confiabilidade na hora de chamar tool
Então esse post compara caminhos e te ajuda a decidir
Como o Hermes Agent conversa com um modelo local
Antes do "qual é melhor", o mecanismo
Porque é ele que faz a comparação existir
O Hermes fala com qualquer endpoint compatível com a API da OpenAI pelo caminho de provider customizado (provider: "custom")
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Os apelidos ollama, vllm e llamacpp mapeiam todos pra esse mesmo custom
Se você já mexeu com qualquer client que aceita "OpenAI-compatible base URL", é exatamente a mesma ideia: o agente não sabe (e não liga) se do outro lado tem uma GPU na nuvem ou o seu notebook suando
Pra apontar o Hermes pro Ollama, a base_url precisa terminar em /v1, assim: http://localhost:11434/v1
Por que o /v1? Porque a API compatível com OpenAI do Ollama vive em /v1/chat/completions
Esquecer isso é o clássico "não conecta e não sei por quê"
O provider e a base_url ficam persistidos em ~/.hermes/config.yaml, nas chaves model.default, model.provider e model.base_url
Isso sobrevive a reinício, então tu configura uma vez e segue a vida
E tem um detalhe massa: ao voltar pra um provedor embutido, a base_url antiga é limpa sozinha
Outro atalho bom: /model custom sem nome de modelo consulta o endpoint /models do servidor local e seleciona sozinho quando há exatamente um modelo carregado
E o caminho de nuvem, como é?
Bem mais curto, pra ser honesto
A instalação oficial é um script único que resolve dependências (Python, Node.js, ripgrep, ffmpeg), clone do repositório, ambiente virtual e o comando global hermes:
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
E depois um comando só faz login, define a Nous como provedora e liga o gateway de ferramentas:
hermes setup --portal
E isso custa quanto? Conta gratuita do Nous já usa o Portal pra inferência, então dá pra sair rodando sem pagar nada
O que fica atrás da assinatura é o Tool Gateway (busca web, geração de imagem, TTS e navegador em nuvem), e a assinatura única é o que cobre mais de 300 modelos junto com essas ferramentas, sem chaves de API extras
A credencial fica em disco no ~/.hermes/auth.json como refresh token, e o Hermes gera JWTs de vida curta a cada requisição
Guarda essa diferença de esforço, ela pesa na decisão lá na frente
Modelo local via Ollama x API na nuvem: o que muda de verdade
| Eixo | Modelo local via Ollama | API na nuvem (Nous Portal) | Leitura rápida |
|---|---|---|---|
| Custo do agente | Gratuito (MIT) | Gratuito (MIT) | O Hermes nunca é a conta, o provedor de inferência é |
| Custo de uso | Sem chave de API e sem assinatura | Conta gratuita usa o Portal pra inferência; a assinatura única cobre mais de 300 modelos e o Tool Gateway | Local troca mensalidade por hardware seu |
| Privacidade | Nenhum dado sai da máquina | Dado vai pro provedor | Se tem NDA no meio, o eixo decide sozinho |
| Latência | Payload fixo (system prompt + schemas de todas as ferramentas) em toda chamada, prefill domina o 1º turno em CPU ou pouca VRAM | Prefill roda no hardware do provedor | Silêncio longo no começo é esperado no local |
| Ferramentas gerenciadas | Fora do escopo | Tool Gateway: busca web, geração de imagem, TTS e navegador em nuvem | Tool Gateway é plano pago, conta free do Nous cobre só inferência |
| Confiabilidade de tool-use | Registrado na issue #523 que system prompt extenso + dezenas de schemas sobrecarrega modelo pequeno | Modelos grandes lidam melhor com o payload | É o modo de falha mais comum no uso local |
O que sua máquina precisa aguentar antes de apontar o Hermes para o Ollama
Essa é A seção do caminho local
O Hermes exige no mínimo 64.000 tokens de contexto pra trabalho agentivo com ferramentas
Janela menor que isso é rejeitada na inicialização, porque o system prompt, os schemas das ferramentas e o estado da conversa precisam de espaço pra caber
E aqui mora a maior fonte de confusão da integração inteira: o tamanho de contexto NÃO pode ser definido pela API compatível com OpenAI
Nada de mandar isso no /v1/chat/completions
Tem que ser configurado no servidor Ollama, via variável de ambiente OLLAMA_CONTEXT_LENGTH no ambiente do servidor, ou via Modelfile
Qual é o padrão do Ollama hoje?
A partir da versão 0.15.5 o Ollama define o contexto padrão conforme a VRAM detectada:
- menos de 24 GiB de VRAM: 4.096 tokens
- entre 24 e 48 GiB: 32.768 tokens
- 48 GiB ou mais: 262.144 tokens
Faz a conta com o mínimo de 64.000 que o Hermes pede
Quem tem menos de 24 GiB começa MUITO abaixo do necessário, e é por isso que tanta gente esbarra no erro logo de cara
A conta de memória que ninguém faz
A RAM exigida pelo Ollama escala com OLLAMA_NUM_PARALLEL * OLLAMA_CONTEXT_LENGTH
Ou seja: subir o contexto pra 64.000 com paralelismo alto multiplica o problema em vez de resolver
No Mac a orientação oficial é direta: com 8 GB, usar KV cache q4_0 e um modelo menor que ainda caiba no mínimo de 64K
Com 16 GB dá pra trabalhar confortavelmente com 128K de contexto
Tome cuidado aqui: dimensionar contexto e modelo é decisão de ANTES, não de depois que o agente já engasgou
Os três tropeços mais comuns do Hermes com modelo local
1. O agente fica minutos em silêncio no primeiro turno
Causa: o Hermes envia um payload fixo em toda chamada (system prompt mais os schemas de todas as ferramentas ativas) antes do conteúdo da conversa
Em máquina só com CPU ou pouca VRAM, a fase de prefill domina o primeiro turno
O que fazer: esperar 🙂
Sério, isso é comportamento esperado e está documentado, não é travamento
Se for insuportável, o caminho é hardware ou nuvem, não ficar matando o processo
2. O Hermes recusa iniciar por contexto insuficiente
Causa: a janela padrão do Ollama está abaixo do mínimo de 64.000 tokens (olha a tabela de VRAM da seção anterior)
O que fazer: ajustar server-side, com OLLAMA_CONTEXT_LENGTH no ambiente do servidor ou via Modelfile
O erro comum aqui: tentar resolver na chamada da API
Não funciona, e é justamente a maior fonte de confusão dessa integração
3. O modelo erra ou simplesmente ignora chamadas de ferramenta
Causa: está registrado na issue #523 do repositório oficial que o system prompt extenso somado aos schemas de dezenas de ferramentas sobrecarrega modelos pequenos
E que a confiabilidade em chamada de ferramentas é o modo de falha mais comum no uso local
O que fazer: subir de modelo, não de expectativa
Esse é o tropeço que mais frustra, porque o agente até responde bonito, só que não EXECUTA
Quem já passou por isso tentando rodar o OpenClaw com modelo local vai reconhecer o padrão na hora: o gargalo raramente é o texto, é o tool-use
Quando o modelo local ganha e quando a nuvem ganha
Bora aos cenários, que é onde a decisão acontece de verdade
Local ganha quando:
- tu mexe com código sob NDA ou dado sensível: rodar com modelo local significa nenhuma chave de API, nenhuma assinatura e nenhum dado saindo da máquina
- o uso é intenso e contínuo, e tu tem VRAM sobrando pra bancar os 64K de contexto sem chorar
- tu já tem um servidor local no ar pra outras coisas e quer aproveitar o mesmo endpoint, do mesmo jeito que rola quando se resolve usar o OpenCode com modelo local
Nuvem ganha quando:
- a tarefa é longa e usa muitas ferramentas (o payload fixo pesa em cada chamada)
- é teu primeiro contato com o agente e tu quer entender a ferramenta antes de brigar com Modelfile
- a máquina é modesta e cai na faixa de menos de 24 GiB de VRAM
- tu precisa de busca web, geração de imagem, TTS ou navegador em nuvem: isso é Tool Gateway, recurso de plano pago, e conta gratuita do Nous usa o Portal só pra inferência
Esse último ponto elimina o caminho local pra esse recorte específico, não tem jeito
Agora, uma coisa importante: o agente funciona igual nos dois modos
Comandos no terminal, edição de arquivos, navegação e delegação seguem funcionando com modelo local exatamente como funcionam com provedor de nuvem
O que muda é a experiência ao redor, não a lista de capacidades do agente
Veredito: local via Ollama é escolha de hardware e de privacidade, não de economia mágica
Se tu chegou aqui procurando "como não pagar", a resposta é chata: o Hermes já não cobra nada em nenhum dos dois caminhos
O que o local faz é trocar conta de provedor por exigência de máquina
O mínimo de 64.000 tokens de contexto, a RAM escalando por paralelismo vezes contexto, o prefill lento no primeiro turno em CPU, e o risco real de tool-use falhar com modelo pequeno (issue #523)
Isso não é pouco
Recomendo o caminho local pra quem tem restrição de privacidade de verdade ou hardware que já dá conta do contexto exigido
Recomendo o Portal pra quem quer o agente funcionando hoje, com Tool Gateway junto, sem virar sysadmin de servidor de inferência
E tem um sinalzinho de que a experiência local ainda está amadurecendo: existe issue aberta no repositório oficial (a #38975, "Desktop UI: add full custom OpenAI-compatible provider setup") pedindo configuração completa de provedor compatível com OpenAI direto na interface do app desktop
Enquanto isso não chega, o caminho local passa por arquivo de configuração mesmo
Conclusão
Resumindo sem enrolação: Hermes Agent com Ollama não é sobre economizar software, é sobre onde teus dados ficam e o quanto tua máquina aguenta
O agente é o mesmo dos dois lados, o preço vem do provedor de inferência e o custo escondido do local é hardware
Próximo passo, e é bem prático: confere a VRAM que tu tem contra a tabela de padrões do Ollama 0.15.5, decide se dá pra chegar nos 64.000 tokens configurando o servidor, e SÓ ENTÃO escolhe entre apontar o provider custom pro http://localhost:11434/v1 ou seguir pelo Portal
Nessa ordem tu evita descobrir o problema depois de meia hora de download
E aí, qual caminho tu escolheu? Conta aí nos comentários…
Até o próximo post!
Perguntas frequentes
Preciso pagar alguma coisa pra usar o Hermes Agent com Ollama?
Não. O Hermes Agent é gratuito e open source sob licença MIT, e rodando com Ollama local não existe chave de API nem assinatura envolvida. O único custo é o hardware que já está na sua máquina, e nenhum dado sai dela.
Dá pra configurar o contexto do Ollama direto pela API compatível com OpenAI que o Hermes usa?
Não, e essa é a maior fonte de confusão da integração. O tamanho de contexto tem que ser definido no servidor Ollama, via variável de ambiente OLLAMA_CONTEXT_LENGTH ou Modelfile, nunca pela chamada em /v1/chat/completions.
Qual o contexto mínimo que o Ollama precisa ter pra rodar o Hermes Agent sem erro na inicialização?
O Hermes exige no mínimo 64.000 tokens de contexto para trabalho agentivo com ferramentas. Janela menor que isso é rejeitada de cara, porque o system prompt, os schemas das ferramentas e o estado da conversa precisam desse espaço.
Por que o Hermes Agent fica minutos sem responder no primeiro turno quando uso modelo local?
O Hermes envia um payload fixo em toda chamada, com o system prompt mais os schemas de todas as ferramentas ativas, antes mesmo do conteúdo da conversa. Em máquina só com CPU ou com pouca VRAM, essa fase de prefill domina o primeiro turno, e o silêncio é comportamento esperado, não travamento.
Quanto de memória preciso pra rodar o Hermes Agent local com Ollama num Mac?
Com 8 GB, a orientação é usar KV cache q4_0 e um modelo menor que ainda caiba no mínimo de 64K de contexto. Com 16 GB já dá pra trabalhar confortavelmente com 128K, mas vale lembrar que a RAM exigida escala por OLLAMA_NUM_PARALLEL vezes OLLAMA_CONTEXT_LENGTH.
O Hermes Agent local via Ollama tem as mesmas ferramentas do caminho em nuvem pelo Nous Portal?
Não. O Tool Gateway, com busca web, geração de imagem, TTS e navegador em nuvem, é recurso de assinatura paga do Nous Portal e fica fora do escopo do caminho local. Conta gratuita do Nous usa o Portal só pra inferência, e no Ollama local o Hermes funciona, mas sem esse conjunto de ferramentas gerenciadas.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]
