Hermes Agent com Ollama vale a pena? O que muda quando o modelo roda na sua máquina

Hermes Agent com Ollama rodando um modelo de IA local no computador
Resposta rápida

Hermes Agent com Ollama tira a chave de API e a assinatura da conta, mas cobra em hardware. O agente é gratuito e open source (licença MIT) nos dois caminhos, então o que muda mesmo é o provedor de inferência: local não manda dado pra fora, nuvem via Nous Portal cobre mais de 300 modelos com um login só. O ponto duro é contexto: o Hermes exige no mínimo 64.000 tokens, e isso se ajusta no servidor do Ollama (OLLAMA_CONTEXT_LENGTH ou Modelfile), nunca pela chamada da API. E modelo pequeno ainda erra chamada de ferramenta

Um agente completo rodando na sua máquina, sem chave de API, sem assinatura e sem um byte do seu código saindo dali

Soa bom demais, né? 🙂

Aí vem a parte que quase ninguém fala: o Hermes Agent é gratuito e open source sob licença MIT, no repositório oficial NousResearch/hermes-agent (que hoje acumula 222,6 mil stars)

Ou seja: o software não custa nada nem no caminho local nem no caminho nuvem

O que muda entre um e outro é o provedor de inferência, e tudo que vem junto com ele: privacidade, latência, ferramentas disponíveis e confiabilidade na hora de chamar tool

Então esse post compara caminhos e te ajuda a decidir

Como o Hermes Agent conversa com um modelo local

Antes do "qual é melhor", o mecanismo

Porque é ele que faz a comparação existir

O Hermes fala com qualquer endpoint compatível com a API da OpenAI pelo caminho de provider customizado (provider: "custom")

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Os apelidos ollama, vllm e llamacpp mapeiam todos pra esse mesmo custom

Se você já mexeu com qualquer client que aceita "OpenAI-compatible base URL", é exatamente a mesma ideia: o agente não sabe (e não liga) se do outro lado tem uma GPU na nuvem ou o seu notebook suando

Pra apontar o Hermes pro Ollama, a base_url precisa terminar em /v1, assim: http://localhost:11434/v1

Por que o /v1? Porque a API compatível com OpenAI do Ollama vive em /v1/chat/completions

Esquecer isso é o clássico "não conecta e não sei por quê"

O provider e a base_url ficam persistidos em ~/.hermes/config.yaml, nas chaves model.default, model.provider e model.base_url

Isso sobrevive a reinício, então tu configura uma vez e segue a vida

E tem um detalhe massa: ao voltar pra um provedor embutido, a base_url antiga é limpa sozinha

Outro atalho bom: /model custom sem nome de modelo consulta o endpoint /models do servidor local e seleciona sozinho quando há exatamente um modelo carregado

E o caminho de nuvem, como é?

Bem mais curto, pra ser honesto

A instalação oficial é um script único que resolve dependências (Python, Node.js, ripgrep, ffmpeg), clone do repositório, ambiente virtual e o comando global hermes:

curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash

E depois um comando só faz login, define a Nous como provedora e liga o gateway de ferramentas:

hermes setup --portal

E isso custa quanto? Conta gratuita do Nous já usa o Portal pra inferência, então dá pra sair rodando sem pagar nada

O que fica atrás da assinatura é o Tool Gateway (busca web, geração de imagem, TTS e navegador em nuvem), e a assinatura única é o que cobre mais de 300 modelos junto com essas ferramentas, sem chaves de API extras

A credencial fica em disco no ~/.hermes/auth.json como refresh token, e o Hermes gera JWTs de vida curta a cada requisição

Guarda essa diferença de esforço, ela pesa na decisão lá na frente

Modelo local via Ollama x API na nuvem: o que muda de verdade

EixoModelo local via OllamaAPI na nuvem (Nous Portal)Leitura rápida
Custo do agenteGratuito (MIT)Gratuito (MIT)O Hermes nunca é a conta, o provedor de inferência é
Custo de usoSem chave de API e sem assinaturaConta gratuita usa o Portal pra inferência; a assinatura única cobre mais de 300 modelos e o Tool GatewayLocal troca mensalidade por hardware seu
PrivacidadeNenhum dado sai da máquinaDado vai pro provedorSe tem NDA no meio, o eixo decide sozinho
LatênciaPayload fixo (system prompt + schemas de todas as ferramentas) em toda chamada, prefill domina o 1º turno em CPU ou pouca VRAMPrefill roda no hardware do provedorSilêncio longo no começo é esperado no local
Ferramentas gerenciadasFora do escopoTool Gateway: busca web, geração de imagem, TTS e navegador em nuvemTool Gateway é plano pago, conta free do Nous cobre só inferência
Confiabilidade de tool-useRegistrado na issue #523 que system prompt extenso + dezenas de schemas sobrecarrega modelo pequenoModelos grandes lidam melhor com o payloadÉ o modo de falha mais comum no uso local

O que sua máquina precisa aguentar antes de apontar o Hermes para o Ollama

Essa é A seção do caminho local

O Hermes exige no mínimo 64.000 tokens de contexto pra trabalho agentivo com ferramentas

Janela menor que isso é rejeitada na inicialização, porque o system prompt, os schemas das ferramentas e o estado da conversa precisam de espaço pra caber

E aqui mora a maior fonte de confusão da integração inteira: o tamanho de contexto NÃO pode ser definido pela API compatível com OpenAI

Nada de mandar isso no /v1/chat/completions

Tem que ser configurado no servidor Ollama, via variável de ambiente OLLAMA_CONTEXT_LENGTH no ambiente do servidor, ou via Modelfile

Qual é o padrão do Ollama hoje?

A partir da versão 0.15.5 o Ollama define o contexto padrão conforme a VRAM detectada:

  • menos de 24 GiB de VRAM: 4.096 tokens
  • entre 24 e 48 GiB: 32.768 tokens
  • 48 GiB ou mais: 262.144 tokens

Faz a conta com o mínimo de 64.000 que o Hermes pede

Quem tem menos de 24 GiB começa MUITO abaixo do necessário, e é por isso que tanta gente esbarra no erro logo de cara

A conta de memória que ninguém faz

A RAM exigida pelo Ollama escala com OLLAMA_NUM_PARALLEL * OLLAMA_CONTEXT_LENGTH

Ou seja: subir o contexto pra 64.000 com paralelismo alto multiplica o problema em vez de resolver

No Mac a orientação oficial é direta: com 8 GB, usar KV cache q4_0 e um modelo menor que ainda caiba no mínimo de 64K

Com 16 GB dá pra trabalhar confortavelmente com 128K de contexto

Tome cuidado aqui: dimensionar contexto e modelo é decisão de ANTES, não de depois que o agente já engasgou

Os três tropeços mais comuns do Hermes com modelo local

1. O agente fica minutos em silêncio no primeiro turno

Causa: o Hermes envia um payload fixo em toda chamada (system prompt mais os schemas de todas as ferramentas ativas) antes do conteúdo da conversa

Em máquina só com CPU ou pouca VRAM, a fase de prefill domina o primeiro turno

O que fazer: esperar 🙂

Sério, isso é comportamento esperado e está documentado, não é travamento

Se for insuportável, o caminho é hardware ou nuvem, não ficar matando o processo

2. O Hermes recusa iniciar por contexto insuficiente

Causa: a janela padrão do Ollama está abaixo do mínimo de 64.000 tokens (olha a tabela de VRAM da seção anterior)

O que fazer: ajustar server-side, com OLLAMA_CONTEXT_LENGTH no ambiente do servidor ou via Modelfile

O erro comum aqui: tentar resolver na chamada da API

Não funciona, e é justamente a maior fonte de confusão dessa integração

3. O modelo erra ou simplesmente ignora chamadas de ferramenta

Causa: está registrado na issue #523 do repositório oficial que o system prompt extenso somado aos schemas de dezenas de ferramentas sobrecarrega modelos pequenos

E que a confiabilidade em chamada de ferramentas é o modo de falha mais comum no uso local

O que fazer: subir de modelo, não de expectativa

Esse é o tropeço que mais frustra, porque o agente até responde bonito, só que não EXECUTA

Quem já passou por isso tentando rodar o OpenClaw com modelo local vai reconhecer o padrão na hora: o gargalo raramente é o texto, é o tool-use

Quando o modelo local ganha e quando a nuvem ganha

Bora aos cenários, que é onde a decisão acontece de verdade

Local ganha quando:

  • tu mexe com código sob NDA ou dado sensível: rodar com modelo local significa nenhuma chave de API, nenhuma assinatura e nenhum dado saindo da máquina
  • o uso é intenso e contínuo, e tu tem VRAM sobrando pra bancar os 64K de contexto sem chorar
  • tu já tem um servidor local no ar pra outras coisas e quer aproveitar o mesmo endpoint, do mesmo jeito que rola quando se resolve usar o OpenCode com modelo local

Nuvem ganha quando:

  • a tarefa é longa e usa muitas ferramentas (o payload fixo pesa em cada chamada)
  • é teu primeiro contato com o agente e tu quer entender a ferramenta antes de brigar com Modelfile
  • a máquina é modesta e cai na faixa de menos de 24 GiB de VRAM
  • tu precisa de busca web, geração de imagem, TTS ou navegador em nuvem: isso é Tool Gateway, recurso de plano pago, e conta gratuita do Nous usa o Portal só pra inferência

Esse último ponto elimina o caminho local pra esse recorte específico, não tem jeito

Agora, uma coisa importante: o agente funciona igual nos dois modos

Comandos no terminal, edição de arquivos, navegação e delegação seguem funcionando com modelo local exatamente como funcionam com provedor de nuvem

O que muda é a experiência ao redor, não a lista de capacidades do agente

Veredito: local via Ollama é escolha de hardware e de privacidade, não de economia mágica

Se tu chegou aqui procurando "como não pagar", a resposta é chata: o Hermes já não cobra nada em nenhum dos dois caminhos

O que o local faz é trocar conta de provedor por exigência de máquina

O mínimo de 64.000 tokens de contexto, a RAM escalando por paralelismo vezes contexto, o prefill lento no primeiro turno em CPU, e o risco real de tool-use falhar com modelo pequeno (issue #523)

Isso não é pouco

Recomendo o caminho local pra quem tem restrição de privacidade de verdade ou hardware que já dá conta do contexto exigido

Recomendo o Portal pra quem quer o agente funcionando hoje, com Tool Gateway junto, sem virar sysadmin de servidor de inferência

E tem um sinalzinho de que a experiência local ainda está amadurecendo: existe issue aberta no repositório oficial (a #38975, "Desktop UI: add full custom OpenAI-compatible provider setup") pedindo configuração completa de provedor compatível com OpenAI direto na interface do app desktop

Enquanto isso não chega, o caminho local passa por arquivo de configuração mesmo

Conclusão

Resumindo sem enrolação: Hermes Agent com Ollama não é sobre economizar software, é sobre onde teus dados ficam e o quanto tua máquina aguenta

O agente é o mesmo dos dois lados, o preço vem do provedor de inferência e o custo escondido do local é hardware

Próximo passo, e é bem prático: confere a VRAM que tu tem contra a tabela de padrões do Ollama 0.15.5, decide se dá pra chegar nos 64.000 tokens configurando o servidor, e SÓ ENTÃO escolhe entre apontar o provider custom pro http://localhost:11434/v1 ou seguir pelo Portal

Nessa ordem tu evita descobrir o problema depois de meia hora de download

E aí, qual caminho tu escolheu? Conta aí nos comentários…

Até o próximo post!

Perguntas frequentes

Preciso pagar alguma coisa pra usar o Hermes Agent com Ollama?

Não. O Hermes Agent é gratuito e open source sob licença MIT, e rodando com Ollama local não existe chave de API nem assinatura envolvida. O único custo é o hardware que já está na sua máquina, e nenhum dado sai dela.

Dá pra configurar o contexto do Ollama direto pela API compatível com OpenAI que o Hermes usa?

Não, e essa é a maior fonte de confusão da integração. O tamanho de contexto tem que ser definido no servidor Ollama, via variável de ambiente OLLAMA_CONTEXT_LENGTH ou Modelfile, nunca pela chamada em /v1/chat/completions.

Qual o contexto mínimo que o Ollama precisa ter pra rodar o Hermes Agent sem erro na inicialização?

O Hermes exige no mínimo 64.000 tokens de contexto para trabalho agentivo com ferramentas. Janela menor que isso é rejeitada de cara, porque o system prompt, os schemas das ferramentas e o estado da conversa precisam desse espaço.

Por que o Hermes Agent fica minutos sem responder no primeiro turno quando uso modelo local?

O Hermes envia um payload fixo em toda chamada, com o system prompt mais os schemas de todas as ferramentas ativas, antes mesmo do conteúdo da conversa. Em máquina só com CPU ou com pouca VRAM, essa fase de prefill domina o primeiro turno, e o silêncio é comportamento esperado, não travamento.

Quanto de memória preciso pra rodar o Hermes Agent local com Ollama num Mac?

Com 8 GB, a orientação é usar KV cache q4_0 e um modelo menor que ainda caiba no mínimo de 64K de contexto. Com 16 GB já dá pra trabalhar confortavelmente com 128K, mas vale lembrar que a RAM exigida escala por OLLAMA_NUM_PARALLEL vezes OLLAMA_CONTEXT_LENGTH.

O Hermes Agent local via Ollama tem as mesmas ferramentas do caminho em nuvem pelo Nous Portal?

Não. O Tool Gateway, com busca web, geração de imagem, TTS e navegador em nuvem, é recurso de assinatura paga do Nous Portal e fica fora do escopo do caminho local. Conta gratuita do Nous usa o Portal só pra inferência, e no Ollama local o Hermes funciona, mas sem esse conjunto de ferramentas gerenciadas.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares