Rodar IA local com Ollama vale a pena ou é melhor pagar API? O que roda no PC comum e quando compensa cada caminho

Rodar IA local com Ollama compensa quando você já tem hardware e a tarefa é repetitiva ou o dado é sensível: o gpt-oss-20b foi projetado pra caber em 16 GB de memória, enquanto o gpt-oss-120b roda em uma única GPU de 80 GB. Faltou VRAM, dá pra descarregar parte na CPU, só que a execução fica mais lenta. API paga entra quando você precisa de modelo forte sem investir em máquina: o Sonnet 5 está com preço introdutório de US$ 2 (entrada) e US$ 10 (saída) por milhão de tokens até 31/08/2026. E sem GPU em casa, aluguel por hora na RunPod começa em US$ 0,34/h
Fala aí, beleza? Rodar IA local virou o sonho de todo dev que olhou a fatura da API e engasgou
baixa o modelo, roda na sua máquina, ninguém vê seu código, custo de token zero
aí chega a parte chata da história: o hardware 😅
Este post compara três caminhos pra você colocar carga de IA pra rodar: máquina local com o Ollama, API paga (Claude Sonnet 5, Haiku 4.5, planos da Anthropic) e infraestrutura alugada (VPS de CPU ou GPU cobrada por hora)
O texto é pra quem já mexe com self-hosted, já tem um n8n ou outro serviço rodando num servidor seu, e agora quer decidir onde a IA vai morar
E já aviso como funciona o teste de velocidade por aqui: ele é um roteiro pra você rodar na SUA máquina, porque velocidade depende do seu hardware e eu não acho legal chutar métrica que não foi medida
Ollama local x API x VPS: comparativo de custo, hardware e controle
Antes de entrar em cada rota, o mapa geral
São quatro opções na prática, e elas não competem pelo mesmo trabalho: cada uma resolve um tipo de carga
| Rota | Custo declarado | Hardware exigido | Limite de uso | Onde o dado trafega |
|---|---|---|---|---|
| PC local com Ollama | sem cobrança por token (o custo é a máquina que você já tem) | GPU compatível ou offload pra CPU; gpt-oss-20b projetado pra caber em 16 GB de memória | nenhum limite de fornecedor | só na sua máquina, via API local em http://localhost:11434 |
| Ollama Cloud | plano Team a US$ 25 por assento/mês com mínimo de 5 assentos (US$ 125/mês); Free e Pro seguem abertos, Max com novas assinaturas pausadas | nenhum | limite de sessão que reinicia a cada 5 horas e limite semanal a cada 7 dias | infraestrutura da ollama.com |
| API e planos da Anthropic | Sonnet 5 a US$ 2 (entrada) e US$ 10 (saída) por milhão de tokens no preço introdutório até 31/08/2026, depois US$ 3 e US$ 15; Haiku 4.5 a US$ 1 e US$ 5; plano Pro a US$ 20/mês nos EUA | nenhum | janela de sessão rolante de 5 horas mais limites semanais nos planos pagos | servidores da Anthropic |
| VPS de CPU ou GPU alugada | Hetzner CX22 a € 3,79/mês e CX52 a € 32,40/mês; RunPod RTX 4090 a partir de US$ 0,34/h, A100 PCIe a partir de US$ 1,39/h, H100 PCIe a partir de US$ 2,89/h; GPU Droplets da DigitalOcean de cerca de US$ 0,76 a US$ 11,19 por GPU/hora | o que você contratar | o que a sua conta aguentar | servidor do provedor |
Detalhe que muda a conta na RunPod: o valor de US$ 0,34/h da RTX 4090 é o sob demanda, e no Secure Cloud a mesma placa começa em US$ 0,69/h
Mesma placa, preço diferente, só que em outro tipo de infra
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
O que roda mesmo num PC comum (e o que não roda)
Essa é a pergunta que trava todo mundo antes do primeiro ollama pull
A régua honesta é memória, não hype
- gpt-oss-20b: foi projetado pra caber em 16 GB de memória
- gpt-oss-120b: roda em uma única GPU de 80 GB
Ou seja: um notebook com 16 GB é a fronteira do que dá pra chamar de PC comum aqui, e o 120b já é papo de máquina de servidor, não de mesa
Por que o 20b cabe em tão pouca memória?
Porque os pesos não estão em precisão cheia
No gpt-oss, os pesos da mistura de especialistas (MoE) são quantizados em MXFP4, com 4,25 bits por parâmetro
e esses pesos respondem por mais de 90% do total de parâmetros do modelo
É tipo comprimir a parte gorda do arquivo e deixar o resto intacto: o modelo continua o mesmo, a representação dele na memória que encolheu
E se faltar VRAM?
Não é game over
O offload pra CPU é suportado, e o que acontece é o esperado: a execução fica mais lenta
Então a pergunta certa não é "roda?", é "roda numa velocidade que eu aguento esperar?"
Tome cuidado com uma coisa: não existe número mágico de VRAM por tamanho de modelo publicado na documentação oficial do Ollama
Aquelas regrinhas de "7B pede 8 GB, 30B pede 24 GB" que circulam por aí são estimativa de terceiro, não requisito oficial
E os outros modelos abertos?
A biblioteca do Ollama tem famílias como Kimi-K2.6, GLM-5.2, MiniMax, DeepSeek, gpt-oss, Qwen e Gemma, entre outras
Só que cada família tem variações de tamanho e a doc não publica um requisito de RAM por modelo
Assim sendo, o caminho é o chato mesmo: escolher um tamanho que caiba na memória que você tem e medir na sua máquina
O que sua máquina precisa ter antes de instalar o Ollama
Aqui é onde a maioria descobre que a festa não vai rolar, então confere ANTES de rodar comando
A documentação oficial de GPU do Ollama é bem específica:
- NVIDIA (regra geral): compute capability 5.0 ou superior e driver 550 ou mais novo
- NVIDIA com compute capability de 5.0 a 6.2: nessa faixa a regra geral não vale, o mínimo SOBE para driver 570 ou mais novo
- AMD: stack de driver ROCm v7 no Linux, e ROCm v7 / HIP7 no Windows
- Apple: usa a API Metal
- Alternativa adicional: há suporte via Vulkan no Windows e no Linux
Ou seja, leia os dois primeiros itens juntos: o 550 é o piso de quem está acima de 6.2, e quem está de 5.0 a 6.2 precisa do 570
Repara que driver antigo é a causa número um de dor de cabeça: a placa é compatível, mas o driver não
E some isso com a régua de memória da seção anterior: 16 GB é o que o gpt-oss-20b pede pra caber
Se a sua máquina não passa nesses dois filtros (aceleração suportada e memória suficiente), pula direto pra seção de VPS e GPU por hora, porque insistir no local só vai te dar frustração
Como testar na prática: instalar o Ollama e apontar seu código para a máquina local
Bora ver na prática?
A versão estável mais recente publicada no repositório oficial é a v0.32.5
- Instalar no Linux com o comando oficial:
curl -fsSL https://ollama.com/install.sh | sh
O erro comum deste passo: driver de vídeo desatualizado
Se a sua NVIDIA tem compute capability de 5.0 a 6.2, o 550 da regra geral não basta: nessa faixa o mínimo passa a ser o driver 570 ou mais novo
- Confirmar que a API local está de pé
O Ollama expõe uma API na sua própria máquina, numa porta fixa: http://localhost:11434
Que API? Essa é a peça que faz o Ollama valer a pena pra dev: em vez de você conversar só pelo terminal, tem um endereço HTTP local pro seu código chamar
O endpoint nativo de chat é este:
curl http://localhost:11434/api/chat -d '{
"model": "gpt-oss:20b",
"messages": [{ "role": "user", "content": "me explica o que e MoE" }]
}'
O erro comum deste passo: chamar em outra porta, ou de outra máquina achando que o endereço é o mesmo
localhost é a SUA máquina, e só ela
- Apontar o código que você já tem pro endpoint compatível com a OpenAI
Esse é o pulo do gato pra não reescrever aplicação: o Ollama oferece um endpoint compatível com a API da OpenAI
Você troca a base_url pra http://localhost:11434/v1 e o caminho continua sendo /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # obrigatorio, mas nao e usado
)
O erro comum deste passo: deixar o api_key vazio
O campo é obrigatório mesmo que não seja usado, e a biblioteca reclama antes de sair da sua máquina
O exemplo oficial preenche com o valor ollama e pronto
- Rodar o teste de velocidade
O teste é simples e vale mais que qualquer média de internet: rode a mesma tarefa que você faria na API e cronometre
O número que importa é o da SUA máquina, com o seu modelo, com a sua memória, com o quanto foi pra CPU no offload
Se a resposta demora mais do que o seu fluxo aguenta, o local não é o caminho pra ESSE trabalho (mesmo que funcione lindamente pra outro)
Sem GPU em casa: quando o caminho é VPS de CPU ou GPU por hora
Agora falando com quem já tem servidor no ar
VPS de CPU resolve bem os serviços auxiliares e modelos pequenos: fila, automação, banco, o orquestrador da sua stack
Na Hetzner, o CX22 (2 vCPU, 4 GB de RAM, 40 GB de disco) sai por € 3,79/mês e o CX52 (16 vCPU, 32 GB de RAM, 320 GB de disco) por € 32,40/mês, ambos com 20 TB de tráfego e 1 IPv4
Só que CPU não faz milagre com carga pesada de inferência: pra isso é GPU
E aí entra a parte que quase ninguém olha antes de contratar, que é o MODELO DE COBRANÇA:
- RunPod: anuncia preço por hora, mas a cobrança é por milissegundo de execução do pod
- DigitalOcean (GPU Droplets): cobra por segundo, com mínimo de 60 segundos ou US$ 0,01, o que for maior
Por que isso importa? Porque se o seu uso é em pico (roda 4 minutos, dorme o resto do dia), cobrança granular muda a conta do mês inteiro
A faixa de preço sob demanda dos GPU Droplets vai de cerca de US$ 0,76 a US$ 11,19 por GPU/hora, conforme o hardware
Um aviso pra quem já é cliente Hetzner: houve reajuste de preços de servidores dedicados e planos de cloud em todas as localidades, em vigor desde 15 de junho de 2026, às 8h (CEST)
O reajuste vale só para novos pedidos: servidores já alugados não foram afetados, e as taxas de setup caíram na maioria dos dedicados
Ollama Cloud: o meio-termo entre o seu PC e a API
Tem uma opção que fica no meio do caminho e pouca gente considera
O próprio Ollama mantém um serviço de nuvem, o Ollama Cloud, que roda o modelo na infraestrutura da ollama.com em vez do seu hardware
A sacada é a experiência: os modelos cloud exigem login na ollama.com e são usados com os mesmos comandos dos modelos locais (pull, run, ls, cp)
Então você não aprende ferramenta nova, só troca o nome do modelo
Exemplos disponíveis nessa modalidade:
gpt-oss:20b-cloudgpt-oss:120b-cloudqwen3-coder:480b-clouddeepseek-v3.1:671b-cloud
Repara no qwen3-coder:480b-cloud e no deepseek-v3.1:671b-cloud: são modelos abertos que você jamais colocaria pra rodar num PC de mesa
Os limites funcionam em duas camadas: um limite de sessão que reinicia a cada 5 horas e um limite semanal que reinicia a cada 7 dias, calculados por modelo e por tokens de entrada, entrada em cache e saída
Sobre planos: Free e Pro seguem abertos, o Pro permite comprar uso extra, novas assinaturas do Max estão pausadas e o Team custa US$ 25 por assento/mês com mínimo de 5 assentos, o que dá US$ 125/mês de piso, com cada assento adicional somando US$ 25/mês
A conta do outro lado: quanto custa deixar na API paga
Beleza, e se você simplesmente pagar e seguir a vida?
Tem duas formas bem diferentes de pagar, e misturar as duas na cabeça é o que faz a pessoa achar que "IA é cara"
Cobrança por token (API):
- Claude Sonnet 5: preço introdutório de US$ 2 (entrada) e US$ 10 (saída) por milhão de tokens até 31 de agosto de 2026, e depois passa para US$ 3 e US$ 15
- Claude Haiku 4.5: US$ 1 (entrada) e US$ 5 (saída) por milhão de tokens
Assinatura:
- Plano Pro da Anthropic: US$ 20 por mês nos Estados Unidos, com cobrança em moeda local onde houver suporte
- O Claude Code está incluído em todos os planos pagos, e o detalhe que pega muita gente: terminal e chat consomem o mesmo pool de uso
Os limites da assinatura seguem a mesma lógica de janela: sessão rolante de 5 horas, com limites semanais adicionais nos planos pagos
Nos planos Max são dois limites semanais, um geral e um só para modelos Sonnet
E a diferença entre eles é de volume: o Max 5x entrega 5 vezes mais uso por sessão e o Max 20x entrega 20 vezes mais uso por sessão, comparado ao Pro
Se a sua carga é de tarefa simples e repetitiva, escolher modelo mais barato já derruba metade da conta, e vale a mesma lógica que rolou no lançamento do Gemini 3 Flash: modelo rápido e barato pra tarefa boba, modelo caro só onde precisa
E tem dois redutores que muita gente esquece de ligar: até 90% de economia com prompt caching e 50% com processamento em lote (batch)
Antes de xingar o preço, vale checar se você está pagando o mesmo prompt de contexto mil vezes sem cache
Veredito: qual caminho compensa para o seu caso
Não existe vencedor absoluto aqui, existe encaixe
Separando por perfil:
- Tem 16 GB e roda tarefa repetitiva com dado sensível: local, sem dúvida
O gpt-oss-20b foi projetado pra caber nessa memória e o dado não sai da máquina, já que a API vive em http://localhost:11434
- Precisa de modelo de fronteira em código, todo dia: API ou plano pago
Aqui a comparação não é de preço, é de capacidade: você está pagando por um modelo que não roda na sua mesa
- Uso em pico e nenhum hardware: GPU por hora, olhando a granularidade da cobrança (milissegundo na RunPod, segundo com mínimo de 60 segundos ou US$ 0,01 na DigitalOcean)
- Quer modelo aberto grande sem comprar máquina: Ollama Cloud, de olho nos limites de sessão de 5 horas e no semanal de 7 dias
- Quer um assistente próprio rodando o dia inteiro: aí a conta muda de figura e vale olhar quanto custa manter um assistente de IA antes de escolher onde a inferência vai rodar
E tem uma coisa que fecha o veredito no seu caso: o teste de velocidade do passo 4
Ele depende da sua GPU, do seu driver, do modelo e de quanto foi pra CPU no offload, por isso o cronômetro é seu
É rápido de fazer, e é o que decide se o local entra ou sai da sua stack
Conclusão
No fim, a decisão de rodar IA local cabe em duas perguntas honestas
Qual é o seu volume mensal de verdade? E quanto do seu dado pode sair da sua máquina?
Com essas duas respostas na mão, o caminho quase se escolhe sozinho: volume baixo e dado sensível puxa pro local, volume alto e necessidade de modelo forte puxa pra API, e uso em pico sem hardware puxa pra GPU alugada
O próximo passo é concreto: instale o Ollama, escolha um modelo que caiba na memória que você tem, rode a sua tarefa real e cronometre
depois compare com o que a mesma tarefa custaria em token no mesmo volume
E se você já pensou em tirar isso do PC e subir num servidor seu, vale cruzar este comparativo com o que a gente já falou por aqui sobre hospedar modelo em VPS, porque a conta de infraestrutura própria entra bem nessa mesma decisão 🙂
até o próximo post!
Perguntas frequentes
Rodar IA local com Ollama tem algum custo por token?
Não. Rodando localmente não existe cobrança por token, porque o processamento acontece na sua própria máquina, através da API local em http://localhost:11434. O custo real é o hardware que você já tem (ou vai comprar), não uma fatura por uso.
Dá pra usar o Ollama com código já escrito pra API da OpenAI?
Dá sim. O Ollama tem um endpoint compatível com a API da OpenAI, então basta apontar o base_url para http://localhost:11434/v1 com o caminho /v1/chat/completions. O campo api_key continua obrigatório na chamada, mas não é usado de verdade: o exemplo oficial usa o valor ‘ollama’ só pra preencher o campo.
O Ollama Cloud precisa de GPU na minha máquina?
Não precisa, porque nesse modo o modelo roda na infraestrutura da ollama.com, e não no seu hardware. Você usa os mesmos comandos dos modelos locais (pull, run, ls, cp), só que com login na ollama.com e modelos como gpt-oss:20b-cloud, gpt-oss:120b-cloud, qwen3-coder:480b-cloud ou deepseek-v3.1:671b-cloud.
Quanto custa o plano Team do Ollama Cloud?
O plano Team sai por US$ 25 por assento/mês, com mínimo de 5 assentos, ou seja, US$ 125/mês pra começar. Cada assento extra soma mais US$ 25/mês. Os planos Free e Pro continuam abertos normalmente, mas novas assinaturas do plano Max estão pausadas.
Compensa mais alugar GPU por hora ou pagar a API da Anthropic?
Depende do volume, e os dois têm modelo de cobrança bem diferente. Na RunPod, uma RTX 4090 sai a partir de US$ 0,34/h sob demanda (US$ 0,69/h no Secure Cloud), enquanto o Claude Sonnet 5 custa US$ 2 de entrada e US$ 10 de saída por milhão de tokens no preço introdutório até 31 de agosto de 2026. Se o uso é baixo e esporádico, a API tende a pesar menos no bolso; se é carga constante e pesada, a conta por hora da GPU pode compensar.
Preciso de placa NVIDIA cara pra rodar IA local no Mac?
Não. No Mac, o Ollama usa a API Metal em vez de depender de GPU NVIDIA. A exigência de compute capability 5.0 ou superior com driver 550 ou mais novo vale só pra quem está em hardware NVIDIA, e nas placas com compute capability de 5.0 a 6.2 esse piso sobe para o driver 570 ou mais novo; quem está em Windows ou Linux sem NVIDIA/AMD ainda tem a alternativa via Vulkan.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
