Rodar IA local com Ollama vale a pena ou é melhor pagar API? O que roda no PC comum e quando compensa cada caminho

comparação entre rodar IA local com Ollama e pagar API ou VPS na nuvem
Resposta rápida

Rodar IA local com Ollama compensa quando você já tem hardware e a tarefa é repetitiva ou o dado é sensível: o gpt-oss-20b foi projetado pra caber em 16 GB de memória, enquanto o gpt-oss-120b roda em uma única GPU de 80 GB. Faltou VRAM, dá pra descarregar parte na CPU, só que a execução fica mais lenta. API paga entra quando você precisa de modelo forte sem investir em máquina: o Sonnet 5 está com preço introdutório de US$ 2 (entrada) e US$ 10 (saída) por milhão de tokens até 31/08/2026. E sem GPU em casa, aluguel por hora na RunPod começa em US$ 0,34/h

Fala aí, beleza? Rodar IA local virou o sonho de todo dev que olhou a fatura da API e engasgou

baixa o modelo, roda na sua máquina, ninguém vê seu código, custo de token zero

aí chega a parte chata da história: o hardware 😅

Este post compara três caminhos pra você colocar carga de IA pra rodar: máquina local com o Ollama, API paga (Claude Sonnet 5, Haiku 4.5, planos da Anthropic) e infraestrutura alugada (VPS de CPU ou GPU cobrada por hora)

O texto é pra quem já mexe com self-hosted, já tem um n8n ou outro serviço rodando num servidor seu, e agora quer decidir onde a IA vai morar

E já aviso como funciona o teste de velocidade por aqui: ele é um roteiro pra você rodar na SUA máquina, porque velocidade depende do seu hardware e eu não acho legal chutar métrica que não foi medida

Ollama local x API x VPS: comparativo de custo, hardware e controle

Antes de entrar em cada rota, o mapa geral

São quatro opções na prática, e elas não competem pelo mesmo trabalho: cada uma resolve um tipo de carga

Rota Custo declarado Hardware exigido Limite de uso Onde o dado trafega
PC local com Ollama sem cobrança por token (o custo é a máquina que você já tem) GPU compatível ou offload pra CPU; gpt-oss-20b projetado pra caber em 16 GB de memória nenhum limite de fornecedor só na sua máquina, via API local em http://localhost:11434
Ollama Cloud plano Team a US$ 25 por assento/mês com mínimo de 5 assentos (US$ 125/mês); Free e Pro seguem abertos, Max com novas assinaturas pausadas nenhum limite de sessão que reinicia a cada 5 horas e limite semanal a cada 7 dias infraestrutura da ollama.com
API e planos da Anthropic Sonnet 5 a US$ 2 (entrada) e US$ 10 (saída) por milhão de tokens no preço introdutório até 31/08/2026, depois US$ 3 e US$ 15; Haiku 4.5 a US$ 1 e US$ 5; plano Pro a US$ 20/mês nos EUA nenhum janela de sessão rolante de 5 horas mais limites semanais nos planos pagos servidores da Anthropic
VPS de CPU ou GPU alugada Hetzner CX22 a € 3,79/mês e CX52 a € 32,40/mês; RunPod RTX 4090 a partir de US$ 0,34/h, A100 PCIe a partir de US$ 1,39/h, H100 PCIe a partir de US$ 2,89/h; GPU Droplets da DigitalOcean de cerca de US$ 0,76 a US$ 11,19 por GPU/hora o que você contratar o que a sua conta aguentar servidor do provedor

Detalhe que muda a conta na RunPod: o valor de US$ 0,34/h da RTX 4090 é o sob demanda, e no Secure Cloud a mesma placa começa em US$ 0,69/h

Mesma placa, preço diferente, só que em outro tipo de infra

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

O que roda mesmo num PC comum (e o que não roda)

Essa é a pergunta que trava todo mundo antes do primeiro ollama pull

A régua honesta é memória, não hype

  • gpt-oss-20b: foi projetado pra caber em 16 GB de memória
  • gpt-oss-120b: roda em uma única GPU de 80 GB

Ou seja: um notebook com 16 GB é a fronteira do que dá pra chamar de PC comum aqui, e o 120b já é papo de máquina de servidor, não de mesa

Por que o 20b cabe em tão pouca memória?

Porque os pesos não estão em precisão cheia

No gpt-oss, os pesos da mistura de especialistas (MoE) são quantizados em MXFP4, com 4,25 bits por parâmetro

e esses pesos respondem por mais de 90% do total de parâmetros do modelo

É tipo comprimir a parte gorda do arquivo e deixar o resto intacto: o modelo continua o mesmo, a representação dele na memória que encolheu

E se faltar VRAM?

Não é game over

O offload pra CPU é suportado, e o que acontece é o esperado: a execução fica mais lenta

Então a pergunta certa não é "roda?", é "roda numa velocidade que eu aguento esperar?"

Tome cuidado com uma coisa: não existe número mágico de VRAM por tamanho de modelo publicado na documentação oficial do Ollama

Aquelas regrinhas de "7B pede 8 GB, 30B pede 24 GB" que circulam por aí são estimativa de terceiro, não requisito oficial

E os outros modelos abertos?

A biblioteca do Ollama tem famílias como Kimi-K2.6, GLM-5.2, MiniMax, DeepSeek, gpt-oss, Qwen e Gemma, entre outras

Só que cada família tem variações de tamanho e a doc não publica um requisito de RAM por modelo

Assim sendo, o caminho é o chato mesmo: escolher um tamanho que caiba na memória que você tem e medir na sua máquina

O que sua máquina precisa ter antes de instalar o Ollama

Aqui é onde a maioria descobre que a festa não vai rolar, então confere ANTES de rodar comando

A documentação oficial de GPU do Ollama é bem específica:

  • NVIDIA (regra geral): compute capability 5.0 ou superior e driver 550 ou mais novo
  • NVIDIA com compute capability de 5.0 a 6.2: nessa faixa a regra geral não vale, o mínimo SOBE para driver 570 ou mais novo
  • AMD: stack de driver ROCm v7 no Linux, e ROCm v7 / HIP7 no Windows
  • Apple: usa a API Metal
  • Alternativa adicional: há suporte via Vulkan no Windows e no Linux

Ou seja, leia os dois primeiros itens juntos: o 550 é o piso de quem está acima de 6.2, e quem está de 5.0 a 6.2 precisa do 570

Repara que driver antigo é a causa número um de dor de cabeça: a placa é compatível, mas o driver não

E some isso com a régua de memória da seção anterior: 16 GB é o que o gpt-oss-20b pede pra caber

Se a sua máquina não passa nesses dois filtros (aceleração suportada e memória suficiente), pula direto pra seção de VPS e GPU por hora, porque insistir no local só vai te dar frustração

Como testar na prática: instalar o Ollama e apontar seu código para a máquina local

Bora ver na prática?

A versão estável mais recente publicada no repositório oficial é a v0.32.5

  1. Instalar no Linux com o comando oficial:
curl -fsSL https://ollama.com/install.sh | sh

O erro comum deste passo: driver de vídeo desatualizado

Se a sua NVIDIA tem compute capability de 5.0 a 6.2, o 550 da regra geral não basta: nessa faixa o mínimo passa a ser o driver 570 ou mais novo

  1. Confirmar que a API local está de pé

O Ollama expõe uma API na sua própria máquina, numa porta fixa: http://localhost:11434

Que API? Essa é a peça que faz o Ollama valer a pena pra dev: em vez de você conversar só pelo terminal, tem um endereço HTTP local pro seu código chamar

O endpoint nativo de chat é este:

curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:20b",
  "messages": [{ "role": "user", "content": "me explica o que e MoE" }]
}'

O erro comum deste passo: chamar em outra porta, ou de outra máquina achando que o endereço é o mesmo

localhost é a SUA máquina, e só ela

  1. Apontar o código que você já tem pro endpoint compatível com a OpenAI

Esse é o pulo do gato pra não reescrever aplicação: o Ollama oferece um endpoint compatível com a API da OpenAI

Você troca a base_url pra http://localhost:11434/v1 e o caminho continua sendo /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama",  # obrigatorio, mas nao e usado
)

O erro comum deste passo: deixar o api_key vazio

O campo é obrigatório mesmo que não seja usado, e a biblioteca reclama antes de sair da sua máquina

O exemplo oficial preenche com o valor ollama e pronto

  1. Rodar o teste de velocidade

O teste é simples e vale mais que qualquer média de internet: rode a mesma tarefa que você faria na API e cronometre

O número que importa é o da SUA máquina, com o seu modelo, com a sua memória, com o quanto foi pra CPU no offload

Se a resposta demora mais do que o seu fluxo aguenta, o local não é o caminho pra ESSE trabalho (mesmo que funcione lindamente pra outro)

Sem GPU em casa: quando o caminho é VPS de CPU ou GPU por hora

Agora falando com quem já tem servidor no ar

VPS de CPU resolve bem os serviços auxiliares e modelos pequenos: fila, automação, banco, o orquestrador da sua stack

Na Hetzner, o CX22 (2 vCPU, 4 GB de RAM, 40 GB de disco) sai por € 3,79/mês e o CX52 (16 vCPU, 32 GB de RAM, 320 GB de disco) por € 32,40/mês, ambos com 20 TB de tráfego e 1 IPv4

Só que CPU não faz milagre com carga pesada de inferência: pra isso é GPU

E aí entra a parte que quase ninguém olha antes de contratar, que é o MODELO DE COBRANÇA:

  • RunPod: anuncia preço por hora, mas a cobrança é por milissegundo de execução do pod
  • DigitalOcean (GPU Droplets): cobra por segundo, com mínimo de 60 segundos ou US$ 0,01, o que for maior

Por que isso importa? Porque se o seu uso é em pico (roda 4 minutos, dorme o resto do dia), cobrança granular muda a conta do mês inteiro

A faixa de preço sob demanda dos GPU Droplets vai de cerca de US$ 0,76 a US$ 11,19 por GPU/hora, conforme o hardware

Um aviso pra quem já é cliente Hetzner: houve reajuste de preços de servidores dedicados e planos de cloud em todas as localidades, em vigor desde 15 de junho de 2026, às 8h (CEST)

O reajuste vale só para novos pedidos: servidores já alugados não foram afetados, e as taxas de setup caíram na maioria dos dedicados

Ollama Cloud: o meio-termo entre o seu PC e a API

Tem uma opção que fica no meio do caminho e pouca gente considera

O próprio Ollama mantém um serviço de nuvem, o Ollama Cloud, que roda o modelo na infraestrutura da ollama.com em vez do seu hardware

A sacada é a experiência: os modelos cloud exigem login na ollama.com e são usados com os mesmos comandos dos modelos locais (pull, run, ls, cp)

Então você não aprende ferramenta nova, só troca o nome do modelo

Exemplos disponíveis nessa modalidade:

  • gpt-oss:20b-cloud
  • gpt-oss:120b-cloud
  • qwen3-coder:480b-cloud
  • deepseek-v3.1:671b-cloud

Repara no qwen3-coder:480b-cloud e no deepseek-v3.1:671b-cloud: são modelos abertos que você jamais colocaria pra rodar num PC de mesa

Os limites funcionam em duas camadas: um limite de sessão que reinicia a cada 5 horas e um limite semanal que reinicia a cada 7 dias, calculados por modelo e por tokens de entrada, entrada em cache e saída

Sobre planos: Free e Pro seguem abertos, o Pro permite comprar uso extra, novas assinaturas do Max estão pausadas e o Team custa US$ 25 por assento/mês com mínimo de 5 assentos, o que dá US$ 125/mês de piso, com cada assento adicional somando US$ 25/mês

A conta do outro lado: quanto custa deixar na API paga

Beleza, e se você simplesmente pagar e seguir a vida?

Tem duas formas bem diferentes de pagar, e misturar as duas na cabeça é o que faz a pessoa achar que "IA é cara"

Cobrança por token (API):

  • Claude Sonnet 5: preço introdutório de US$ 2 (entrada) e US$ 10 (saída) por milhão de tokens até 31 de agosto de 2026, e depois passa para US$ 3 e US$ 15
  • Claude Haiku 4.5: US$ 1 (entrada) e US$ 5 (saída) por milhão de tokens

Assinatura:

  • Plano Pro da Anthropic: US$ 20 por mês nos Estados Unidos, com cobrança em moeda local onde houver suporte
  • O Claude Code está incluído em todos os planos pagos, e o detalhe que pega muita gente: terminal e chat consomem o mesmo pool de uso

Os limites da assinatura seguem a mesma lógica de janela: sessão rolante de 5 horas, com limites semanais adicionais nos planos pagos

Nos planos Max são dois limites semanais, um geral e um só para modelos Sonnet

E a diferença entre eles é de volume: o Max 5x entrega 5 vezes mais uso por sessão e o Max 20x entrega 20 vezes mais uso por sessão, comparado ao Pro

Se a sua carga é de tarefa simples e repetitiva, escolher modelo mais barato já derruba metade da conta, e vale a mesma lógica que rolou no lançamento do Gemini 3 Flash: modelo rápido e barato pra tarefa boba, modelo caro só onde precisa

E tem dois redutores que muita gente esquece de ligar: até 90% de economia com prompt caching e 50% com processamento em lote (batch)

Antes de xingar o preço, vale checar se você está pagando o mesmo prompt de contexto mil vezes sem cache

Veredito: qual caminho compensa para o seu caso

Não existe vencedor absoluto aqui, existe encaixe

Separando por perfil:

  • Tem 16 GB e roda tarefa repetitiva com dado sensível: local, sem dúvida

O gpt-oss-20b foi projetado pra caber nessa memória e o dado não sai da máquina, já que a API vive em http://localhost:11434

  • Precisa de modelo de fronteira em código, todo dia: API ou plano pago

Aqui a comparação não é de preço, é de capacidade: você está pagando por um modelo que não roda na sua mesa

  • Uso em pico e nenhum hardware: GPU por hora, olhando a granularidade da cobrança (milissegundo na RunPod, segundo com mínimo de 60 segundos ou US$ 0,01 na DigitalOcean)
  • Quer modelo aberto grande sem comprar máquina: Ollama Cloud, de olho nos limites de sessão de 5 horas e no semanal de 7 dias

E tem uma coisa que fecha o veredito no seu caso: o teste de velocidade do passo 4

Ele depende da sua GPU, do seu driver, do modelo e de quanto foi pra CPU no offload, por isso o cronômetro é seu

É rápido de fazer, e é o que decide se o local entra ou sai da sua stack

Conclusão

No fim, a decisão de rodar IA local cabe em duas perguntas honestas

Qual é o seu volume mensal de verdade? E quanto do seu dado pode sair da sua máquina?

Com essas duas respostas na mão, o caminho quase se escolhe sozinho: volume baixo e dado sensível puxa pro local, volume alto e necessidade de modelo forte puxa pra API, e uso em pico sem hardware puxa pra GPU alugada

O próximo passo é concreto: instale o Ollama, escolha um modelo que caiba na memória que você tem, rode a sua tarefa real e cronometre

depois compare com o que a mesma tarefa custaria em token no mesmo volume

E se você já pensou em tirar isso do PC e subir num servidor seu, vale cruzar este comparativo com o que a gente já falou por aqui sobre hospedar modelo em VPS, porque a conta de infraestrutura própria entra bem nessa mesma decisão 🙂

até o próximo post!

Perguntas frequentes

Rodar IA local com Ollama tem algum custo por token?

Não. Rodando localmente não existe cobrança por token, porque o processamento acontece na sua própria máquina, através da API local em http://localhost:11434. O custo real é o hardware que você já tem (ou vai comprar), não uma fatura por uso.

Dá pra usar o Ollama com código já escrito pra API da OpenAI?

Dá sim. O Ollama tem um endpoint compatível com a API da OpenAI, então basta apontar o base_url para http://localhost:11434/v1 com o caminho /v1/chat/completions. O campo api_key continua obrigatório na chamada, mas não é usado de verdade: o exemplo oficial usa o valor ‘ollama’ só pra preencher o campo.

O Ollama Cloud precisa de GPU na minha máquina?

Não precisa, porque nesse modo o modelo roda na infraestrutura da ollama.com, e não no seu hardware. Você usa os mesmos comandos dos modelos locais (pull, run, ls, cp), só que com login na ollama.com e modelos como gpt-oss:20b-cloud, gpt-oss:120b-cloud, qwen3-coder:480b-cloud ou deepseek-v3.1:671b-cloud.

Quanto custa o plano Team do Ollama Cloud?

O plano Team sai por US$ 25 por assento/mês, com mínimo de 5 assentos, ou seja, US$ 125/mês pra começar. Cada assento extra soma mais US$ 25/mês. Os planos Free e Pro continuam abertos normalmente, mas novas assinaturas do plano Max estão pausadas.

Compensa mais alugar GPU por hora ou pagar a API da Anthropic?

Depende do volume, e os dois têm modelo de cobrança bem diferente. Na RunPod, uma RTX 4090 sai a partir de US$ 0,34/h sob demanda (US$ 0,69/h no Secure Cloud), enquanto o Claude Sonnet 5 custa US$ 2 de entrada e US$ 10 de saída por milhão de tokens no preço introdutório até 31 de agosto de 2026. Se o uso é baixo e esporádico, a API tende a pesar menos no bolso; se é carga constante e pesada, a conta por hora da GPU pode compensar.

Preciso de placa NVIDIA cara pra rodar IA local no Mac?

Não. No Mac, o Ollama usa a API Metal em vez de depender de GPU NVIDIA. A exigência de compute capability 5.0 ou superior com driver 550 ou mais novo vale só pra quem está em hardware NVIDIA, e nas placas com compute capability de 5.0 a 6.2 esse piso sobe para o driver 570 ou mais novo; quem está em Windows ou Linux sem NVIDIA/AMD ainda tem a alternativa via Vulkan.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares