Qual VPS aguenta rodar um modelo de IA local? Comparativo de RAM, GPU e preço mensal

comparativo de VPS para rodar LLM com RAM, GPU e preço mensal
Resposta rápida

Escolher um VPS para rodar LLM começa pela RAM, não pelo preço: o Ollama pede pelo menos 8 GB para modelos 7B, 16 GB para 13B e 32 GB para 33B. Sem GPU dá pra começar barato (Hostinger KVM 2 com 8 GB por R$ 42,99/mês, Contabo VPS 30 com 24 GB por 11,20 euros/mês), mas velocidade de resposta pede aceleração dedicada, e aí o salto é brutal: Hetzner GEX44 com 20 GB de VRAM por 184,00 euros/mês, Rollin Host com GPU de 20 GB por R$ 3.249/mês. Todos os números abaixo vêm de fonte verificada.

Ninguém que quer subir um modelo local pergunta de verdade "qual VPS é melhor"

A pergunta real é outra: a partir de qual configuração o modelo carrega e responde sem travar?

Esse post é um comparativo de RAM, GPU e preço mensal das opções que dá pra contratar aqui do Brasil, faixa por faixa, com o que cada uma consegue rodar

Todo número aqui vem de fonte verificada, nada de achismo

E pra você fazer a conta na moeda que preferir, o câmbio de referência do post é US$ 1 = R$ 5,12 e 1 euro = R$ 5,91, cotações de 05/08/2026

O que realmente define se o modelo roda: RAM, GPU e quantização

Antes de comparar preço, precisa entender a régua, senão você paga por um servidor que não carrega o modelo

Se você já mexeu com container, é a mesma lógica: não adianta ter CPU sobrando se a memória não comporta a imagem

Hospedagem que aguenta seu projeto crescer
Hospedagem recomendada

Hospedagem que aguenta seu projeto crescer

Hospedagem rápida, painel simples, backups automáticos e suporte 24/7 em português.

O piso de RAM por tamanho de modelo:

O Ollama documenta o mínimo recomendado por tamanho de modelo, e essa é a régua mais honesta que existe pra começar:

  • pelo menos 8 GB de RAM para modelos 7B
  • pelo menos 16 GB para 13B
  • pelo menos 32 GB para 33B

Repare que é pelo menos, e não "vai voar"

Tamanho de download é prova concreta:

A biblioteca do Ollama mostra o peso real de cada variante do Llama 3.1, e isso ajuda a visualizar espaço em disco e memória de uma vez:

  • llama3.1:8b = 4,9 GB
  • llama3.1:70b = 43 GB
  • llama3.1:405b = 243 GB

Os três com janela de contexto de 128K

Olha o 405b ali: 243 GB

Só de olhar tu já sabe que ele não cabe em quase nada que se contrata por assinatura mensal 😅

E a quantização? Por que um modelo de 20B cabe em 16 GB

Aqui entra a parte que confunde muita gente

Quantização é reduzir a precisão dos pesos do modelo pra ele ocupar menos memória, e o gpt-oss é o exemplo mais direto disso

No gpt-oss, os pesos de mixture-of-experts (mais de 90% dos parâmetros) são quantizados em MXFP4, ou seja, 4,25 bits por parâmetro, e o Ollama suporta MXFP4 nativamente

É por isso que o gpt-oss-20b roda dentro de 16 GB de memória, enquanto o gpt-oss-120b pede uma única GPU de 80 GB

E aqui vai a frase que resume tudo: RAM define se o modelo CARREGA, GPU define se ele responde rápido

São duas perguntas diferentes, e a maioria dos comparativos mistura as duas

VPS sem GPU: RAM e preço mensal das opções que dá pra contratar

Essa é a faixa de entrada, onde o modelo roda na CPU e a RAM é quem manda

PlanovCPU e RAMDiscoPreço/mêsNotas
Hostinger KVM 22 vCPU, 8 GB100 GB NVMeR$ 42,99tem localização de VPS KVM no Brasil
Hostinger KVM 88 vCPU, 32 GB400 GB NVMea partir de aprox. R$ 109,99 em contrato longo8 TB de tráfego mensal
Contabo Cloud VPS 206 vCPU, 12 GB100 GB NVMe ou 200 GB SSD6,00 eurosporta de 300 Mbit/s, tráfego ilimitado
Contabo Cloud VPS 308 vCPU, 24 GB200 GB NVMe ou 400 GB SSD11,20 eurosporta de 600 Mbit/s, tráfego ilimitado
Locawebescada de planosescada de planosde R$ 15,90 a R$ 379,90 (contratação de 24 meses)servidores no Brasil, SLA de 99,9%

Duas observações importantes antes de você abrir a calculadora

A primeira: o preço anunciado do VPS da Hostinger é o equivalente mensal de um ciclo longo pago à vista, e a renovação é significativamente maior

A segunda: a Locaweb mostra as duas colunas na cara, e o contraste é didático

O degrau de R$ 15,90/mês renova por R$ 25,90, e o de R$ 379,90/mês renova por R$ 549,90

O servidor KVM da Hostinger fica em seis países da Europa, Ásia, América do Norte e América do Sul, incluindo o Brasil, o que importa se latência for parte do seu problema

Se a sua dúvida for menos sobre modelo e mais sobre provedor, vale olhar o custo-benefício entre provedores de VPS com calma, porque suporte e renovação pesam tanto quanto a ficha técnica

Servidores com GPU: quanto custa por mês e quanta memória de vídeo vem junto

Agora a outra metade da pergunta: aceleração dedicada

Prepara o coração, porque o salto de preço é feio

ServidorGPU e VRAMCPU e RAMPreço/mês
Hetzner GEX44RTX 4000 SFF Ada, 20 GB GDDR6 ECCCore i5-13500, 64 GB DDR4, dois NVMe de 1,92 TB184,00 euros, mais taxa única de instalação de 79,00 euros, valores sem impostos
Hetzner GEX130RTX 6000 Ada, 48 GB GDDR6 ECCXeon Gold 5412U de 24 núcleos
Hetzner GEX131RTX PRO 6000 Blackwell Max-Q
Rollin Host, plano InferênciaGPU de 20 GBR$ 3.249
Rollin Host, plano ProGPU de 96 GBR$ 12.879
Magalu Cloud, instância L40SNVIDIA L40Saprox. R$ 6.310,00 rodando 24/7, cobrança em reais
RunPod, sob demandaRTX 4090 / A100 PCIepor hora, ver abaixo

A Rollin Host é servidor com GPU no Brasil e já entrega o ambiente com Ollama, vLLM e llama.cpp, com o plano Inferência indicado pelo próprio fornecedor para modelos de 7B a 13B

O número da Magalu Cloud tem base de 06/02/2026 na própria fonte, então trate como referência de ordem de grandeza, não como tabela de hoje

E se eu não quiser pagar servidor parado?

Aí entra a cobrança por hora, que é uma lógica completamente diferente

Na RunPod, a GPU sob demanda sai a partir de:

  • RTX 4090: US$ 0,34/hora
  • A100 PCIe: US$ 1,39/hora sob demanda
  • A100 PCIe no Community Cloud: US$ 1,19/hora

Com cobrança por milissegundo

Pra quem roda inferência em rajada, isso muda a conta inteira

O que cada faixa consegue rodar na prática

Agora amarrando hardware com modelo, sem prometer velocidade que não está verificada:

Faixa de 8 GB de RAM: modelos 7B, que é exatamente o piso recomendado pelo Ollama

O llama3.1:8b, com 4,9 GB de download, cabe nessa faixa

Faixa de 12 a 16 GB: aqui entram os 13B (16 GB é o piso documentado) e o gpt-oss-20b, que roda dentro de 16 GB graças ao MXFP4

Faixa de 24 a 32 GB: é onde os 33B começam a ser viáveis, já que 32 GB é o mínimo recomendado pra esse tamanho

GPU de 20 GB de VRAM: o próprio fornecedor brasileiro indica essa faixa para modelos de 7B a 13B, citando Llama 3 8B, Mistral 7B, Phi-3 e Gemma 2

Faixa de 48 a 96 GB de VRAM: aqui moram os grandes

O llama3.1:70b tem 43 GB de download, e o gpt-oss-120b roda em uma única GPU de 80 GB

É também a faixa que o plano Pro da Rollin Host ocupa, com GPU de 96 GB, indicado pelo fornecedor para modelos grandes (Llama 3 70B, Mixtral 8x22B, DeepSeek R1) e fine-tuning

E o llama3.1:405b? Com 243 GB, ele está fora de qualquer opção listada neste post

Sem meias palavras: não é o caso de "apertar um pouco", ele simplesmente não entra ali 🙂

Qual escolher em cada situação (e a conta que quase ninguém faz)

Veredito por perfil, direto:

Você só quer testar um 7B ou 8B e ver como é: VPS de CPU barato resolve

A faixa de 8 GB atende o piso do Ollama, e o custo mensal fica em dezenas de reais

Você quer rodar um 20B com folga: precisa dos 16 a 32 GB, então olhe pro Contabo VPS 30 (24 GB) ou pro Hostinger KVM 8 (32 GB)

Ainda é faixa de CPU, ainda é preço civilizado

Você precisa de resposta rápida em produção: precisa de GPU, e aí não tem jeito, o salto é brutal

Sai de dezenas de reais por mês e vai pra centenas de euros (Hetzner GEX44) ou pra alguns milhares de reais (planos brasileiros com GPU)

E agora a conta que quase ninguém faz antes de assinar:

  1. Preço promocional não é preço de renovação

A Hostinger anuncia o equivalente mensal de ciclo longo pago à vista, com renovação significativamente maior

A Locaweb é transparente e mostra as duas colunas: R$ 15,90 vira R$ 25,90, R$ 379,90 vira R$ 549,90, com contratação de 24 meses

  1. Taxa única existe e ninguém lembra dela

O Hetzner GEX44 tem 79,00 euros de instalação, que entram só no primeiro mês

  1. Preço em euro e dólar oscila, o seu boleto também

O câmbio de referência aqui é US$ 1 = R$ 5,12 e 1 euro = R$ 5,91, mas o seu custo real muda com a cotação do dia, e provedor brasileiro cobrando em reais tira essa variável da conta

  1. Servidor 24/7 x hora avulsa

Se a sua carga é intermitente (você gera algumas centenas de respostas por dia e o resto do tempo a máquina fica parada), pagar servidor com GPU o mês inteiro é queimar dinheiro

A cobrança por hora da RunPod, com faturamento por milissegundo, existe justamente pra esse cenário

Se é fluxo contínuo, o servidor fixo volta a fazer sentido

E antes de subir de plano por impulso, vale medir consumo de CPU e RAM da sua carga atual, porque muita gente troca de servidor sem saber onde o gargalo realmente está

Conclusão

A ordem certa de decisão é essa, e ela é mais simples do que parece:

  1. defina primeiro qual modelo e qual tamanho você vai rodar
  2. cheque o piso de RAM correspondente (8 GB para 7B, 16 GB para 13B, 32 GB para 33B)
  3. só então escolha a faixa de preço, decidindo se você precisa de GPU ou se CPU resolve
  4. teste com o menor plano antes de fechar contrato longo, porque contrato de 24 meses no plano errado é caro de corrigir

Se você quer o passo a passo de colocar o modelo pra rodar depois de escolher a máquina, o conteúdo sobre hospedar modelos LLM em VPS aqui do blog continua a história

E se a sua dúvida ainda é mais lá atrás, tipo "vale mais rodar local, chamar API ou subir numa VPS?", essa comparação é outro assunto e merece post próprio

Escolhe o modelo, confere a RAM, depois olha o preço

Nessa ordem 😀

Até o próximo post!

Matheus Battisti

Perguntas frequentes

Quanto de RAM preciso pra rodar o Llama 3.1 8B numa VPS?

O Ollama recomenda pelo menos 8 GB de RAM para modelos 7B, e o Llama 3.1 8B se encaixa nessa faixa (o download da variante pesa 4,9 GB, com janela de contexto de 128K). Na prática, um plano de entrada como o Hostinger KVM 2 (2 vCPU, 8 GB de RAM) já bate o piso mínimo, mas não sobra folga.

Dá pra rodar o Llama 3.1 405B numa VPS de assinatura mensal comum?

Na teoria sim, mas na prática é inviável nos planos comparados aqui. O download do llama3.1:405b sozinho pesa 243 GB, um volume de memória e disco que nenhuma VPS sem GPU desta lista atinge com folga.

Qual a diferença de hardware entre gpt-oss-20b e gpt-oss-120b?

O gpt-oss-20b roda dentro de 16 GB de memória, enquanto o gpt-oss-120b pede uma única GPU de 80 GB. Essa diferença existe porque os pesos de mixture-of-experts do gpt-oss (mais de 90% dos parâmetros) são quantizados em MXFP4, a 4,25 bits por parâmetro, e o Ollama já suporta esse formato nativamente.

Existe VPS com GPU no Brasil pra rodar modelo de IA local?

Sim, a Rollin Host tem servidor com GPU no Brasil em dois planos: o Inferência, com GPU de 20 GB por R$ 3.249/mês, indicado para modelos de 7B a 13B como Llama 3 8B, Mistral 7B, Phi-3 e Gemma 2; e o Pro, com GPU de 96 GB por R$ 12.879/mês, voltado a modelos grandes e fine-tuning. Os dois já vêm com Ollama, vLLM e llama.cpp prontos.

Compensa pagar GPU por hora em vez de assinar uma VPS com GPU fixa?

Depende de quanto tempo o modelo fica realmente em uso. Na RunPod, a RTX 4090 sob demanda sai a partir de US$ 0,34 por hora e a A100 PCIe a partir de US$ 1,39 por hora, com cobrança por milissegundo. Pra uso esporádico isso pode custar menos que um servidor fixo de centenas ou milhares de reais por mês, mas pra uso constante a assinatura tende a sair mais em conta.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares