Qual VPS aguenta rodar um modelo de IA local? Comparativo de RAM, GPU e preço mensal

Escolher um VPS para rodar LLM começa pela RAM, não pelo preço: o Ollama pede pelo menos 8 GB para modelos 7B, 16 GB para 13B e 32 GB para 33B. Sem GPU dá pra começar barato (Hostinger KVM 2 com 8 GB por R$ 42,99/mês, Contabo VPS 30 com 24 GB por 11,20 euros/mês), mas velocidade de resposta pede aceleração dedicada, e aí o salto é brutal: Hetzner GEX44 com 20 GB de VRAM por 184,00 euros/mês, Rollin Host com GPU de 20 GB por R$ 3.249/mês. Todos os números abaixo vêm de fonte verificada.
Ninguém que quer subir um modelo local pergunta de verdade "qual VPS é melhor"
A pergunta real é outra: a partir de qual configuração o modelo carrega e responde sem travar?
Esse post é um comparativo de RAM, GPU e preço mensal das opções que dá pra contratar aqui do Brasil, faixa por faixa, com o que cada uma consegue rodar
Todo número aqui vem de fonte verificada, nada de achismo
E pra você fazer a conta na moeda que preferir, o câmbio de referência do post é US$ 1 = R$ 5,12 e 1 euro = R$ 5,91, cotações de 05/08/2026
O que realmente define se o modelo roda: RAM, GPU e quantização
Antes de comparar preço, precisa entender a régua, senão você paga por um servidor que não carrega o modelo
Se você já mexeu com container, é a mesma lógica: não adianta ter CPU sobrando se a memória não comporta a imagem
Hospedagem que aguenta seu projeto crescer
Hospedagem rápida, painel simples, backups automáticos e suporte 24/7 em português.
O piso de RAM por tamanho de modelo:
O Ollama documenta o mínimo recomendado por tamanho de modelo, e essa é a régua mais honesta que existe pra começar:
- pelo menos 8 GB de RAM para modelos 7B
- pelo menos 16 GB para 13B
- pelo menos 32 GB para 33B
Repare que é pelo menos, e não "vai voar"
Tamanho de download é prova concreta:
A biblioteca do Ollama mostra o peso real de cada variante do Llama 3.1, e isso ajuda a visualizar espaço em disco e memória de uma vez:
llama3.1:8b= 4,9 GBllama3.1:70b= 43 GBllama3.1:405b= 243 GB
Os três com janela de contexto de 128K
Olha o 405b ali: 243 GB
Só de olhar tu já sabe que ele não cabe em quase nada que se contrata por assinatura mensal 😅
E a quantização? Por que um modelo de 20B cabe em 16 GB
Aqui entra a parte que confunde muita gente
Quantização é reduzir a precisão dos pesos do modelo pra ele ocupar menos memória, e o gpt-oss é o exemplo mais direto disso
No gpt-oss, os pesos de mixture-of-experts (mais de 90% dos parâmetros) são quantizados em MXFP4, ou seja, 4,25 bits por parâmetro, e o Ollama suporta MXFP4 nativamente
É por isso que o gpt-oss-20b roda dentro de 16 GB de memória, enquanto o gpt-oss-120b pede uma única GPU de 80 GB
E aqui vai a frase que resume tudo: RAM define se o modelo CARREGA, GPU define se ele responde rápido
São duas perguntas diferentes, e a maioria dos comparativos mistura as duas
VPS sem GPU: RAM e preço mensal das opções que dá pra contratar
Essa é a faixa de entrada, onde o modelo roda na CPU e a RAM é quem manda
| Plano | vCPU e RAM | Disco | Preço/mês | Notas |
|---|---|---|---|---|
| Hostinger KVM 2 | 2 vCPU, 8 GB | 100 GB NVMe | R$ 42,99 | tem localização de VPS KVM no Brasil |
| Hostinger KVM 8 | 8 vCPU, 32 GB | 400 GB NVMe | a partir de aprox. R$ 109,99 em contrato longo | 8 TB de tráfego mensal |
| Contabo Cloud VPS 20 | 6 vCPU, 12 GB | 100 GB NVMe ou 200 GB SSD | 6,00 euros | porta de 300 Mbit/s, tráfego ilimitado |
| Contabo Cloud VPS 30 | 8 vCPU, 24 GB | 200 GB NVMe ou 400 GB SSD | 11,20 euros | porta de 600 Mbit/s, tráfego ilimitado |
| Locaweb | escada de planos | escada de planos | de R$ 15,90 a R$ 379,90 (contratação de 24 meses) | servidores no Brasil, SLA de 99,9% |
Duas observações importantes antes de você abrir a calculadora
A primeira: o preço anunciado do VPS da Hostinger é o equivalente mensal de um ciclo longo pago à vista, e a renovação é significativamente maior
A segunda: a Locaweb mostra as duas colunas na cara, e o contraste é didático
O degrau de R$ 15,90/mês renova por R$ 25,90, e o de R$ 379,90/mês renova por R$ 549,90
O servidor KVM da Hostinger fica em seis países da Europa, Ásia, América do Norte e América do Sul, incluindo o Brasil, o que importa se latência for parte do seu problema
Se a sua dúvida for menos sobre modelo e mais sobre provedor, vale olhar o custo-benefício entre provedores de VPS com calma, porque suporte e renovação pesam tanto quanto a ficha técnica
Servidores com GPU: quanto custa por mês e quanta memória de vídeo vem junto
Agora a outra metade da pergunta: aceleração dedicada
Prepara o coração, porque o salto de preço é feio
| Servidor | GPU e VRAM | CPU e RAM | Preço/mês |
|---|---|---|---|
| Hetzner GEX44 | RTX 4000 SFF Ada, 20 GB GDDR6 ECC | Core i5-13500, 64 GB DDR4, dois NVMe de 1,92 TB | 184,00 euros, mais taxa única de instalação de 79,00 euros, valores sem impostos |
| Hetzner GEX130 | RTX 6000 Ada, 48 GB GDDR6 ECC | Xeon Gold 5412U de 24 núcleos | – |
| Hetzner GEX131 | RTX PRO 6000 Blackwell Max-Q | – | – |
| Rollin Host, plano Inferência | GPU de 20 GB | – | R$ 3.249 |
| Rollin Host, plano Pro | GPU de 96 GB | – | R$ 12.879 |
| Magalu Cloud, instância L40S | NVIDIA L40S | – | aprox. R$ 6.310,00 rodando 24/7, cobrança em reais |
| RunPod, sob demanda | RTX 4090 / A100 PCIe | – | por hora, ver abaixo |
A Rollin Host é servidor com GPU no Brasil e já entrega o ambiente com Ollama, vLLM e llama.cpp, com o plano Inferência indicado pelo próprio fornecedor para modelos de 7B a 13B
O número da Magalu Cloud tem base de 06/02/2026 na própria fonte, então trate como referência de ordem de grandeza, não como tabela de hoje
E se eu não quiser pagar servidor parado?
Aí entra a cobrança por hora, que é uma lógica completamente diferente
Na RunPod, a GPU sob demanda sai a partir de:
- RTX 4090: US$ 0,34/hora
- A100 PCIe: US$ 1,39/hora sob demanda
- A100 PCIe no Community Cloud: US$ 1,19/hora
Com cobrança por milissegundo
Pra quem roda inferência em rajada, isso muda a conta inteira
O que cada faixa consegue rodar na prática
Agora amarrando hardware com modelo, sem prometer velocidade que não está verificada:
Faixa de 8 GB de RAM: modelos 7B, que é exatamente o piso recomendado pelo Ollama
O llama3.1:8b, com 4,9 GB de download, cabe nessa faixa
Faixa de 12 a 16 GB: aqui entram os 13B (16 GB é o piso documentado) e o gpt-oss-20b, que roda dentro de 16 GB graças ao MXFP4
Faixa de 24 a 32 GB: é onde os 33B começam a ser viáveis, já que 32 GB é o mínimo recomendado pra esse tamanho
GPU de 20 GB de VRAM: o próprio fornecedor brasileiro indica essa faixa para modelos de 7B a 13B, citando Llama 3 8B, Mistral 7B, Phi-3 e Gemma 2
Faixa de 48 a 96 GB de VRAM: aqui moram os grandes
O llama3.1:70b tem 43 GB de download, e o gpt-oss-120b roda em uma única GPU de 80 GB
É também a faixa que o plano Pro da Rollin Host ocupa, com GPU de 96 GB, indicado pelo fornecedor para modelos grandes (Llama 3 70B, Mixtral 8x22B, DeepSeek R1) e fine-tuning
E o llama3.1:405b? Com 243 GB, ele está fora de qualquer opção listada neste post
Sem meias palavras: não é o caso de "apertar um pouco", ele simplesmente não entra ali 🙂
Qual escolher em cada situação (e a conta que quase ninguém faz)
Veredito por perfil, direto:
Você só quer testar um 7B ou 8B e ver como é: VPS de CPU barato resolve
A faixa de 8 GB atende o piso do Ollama, e o custo mensal fica em dezenas de reais
Você quer rodar um 20B com folga: precisa dos 16 a 32 GB, então olhe pro Contabo VPS 30 (24 GB) ou pro Hostinger KVM 8 (32 GB)
Ainda é faixa de CPU, ainda é preço civilizado
Você precisa de resposta rápida em produção: precisa de GPU, e aí não tem jeito, o salto é brutal
Sai de dezenas de reais por mês e vai pra centenas de euros (Hetzner GEX44) ou pra alguns milhares de reais (planos brasileiros com GPU)
E agora a conta que quase ninguém faz antes de assinar:
- Preço promocional não é preço de renovação
A Hostinger anuncia o equivalente mensal de ciclo longo pago à vista, com renovação significativamente maior
A Locaweb é transparente e mostra as duas colunas: R$ 15,90 vira R$ 25,90, R$ 379,90 vira R$ 549,90, com contratação de 24 meses
- Taxa única existe e ninguém lembra dela
O Hetzner GEX44 tem 79,00 euros de instalação, que entram só no primeiro mês
- Preço em euro e dólar oscila, o seu boleto também
O câmbio de referência aqui é US$ 1 = R$ 5,12 e 1 euro = R$ 5,91, mas o seu custo real muda com a cotação do dia, e provedor brasileiro cobrando em reais tira essa variável da conta
- Servidor 24/7 x hora avulsa
Se a sua carga é intermitente (você gera algumas centenas de respostas por dia e o resto do tempo a máquina fica parada), pagar servidor com GPU o mês inteiro é queimar dinheiro
A cobrança por hora da RunPod, com faturamento por milissegundo, existe justamente pra esse cenário
Se é fluxo contínuo, o servidor fixo volta a fazer sentido
E antes de subir de plano por impulso, vale medir consumo de CPU e RAM da sua carga atual, porque muita gente troca de servidor sem saber onde o gargalo realmente está
Conclusão
A ordem certa de decisão é essa, e ela é mais simples do que parece:
- defina primeiro qual modelo e qual tamanho você vai rodar
- cheque o piso de RAM correspondente (8 GB para 7B, 16 GB para 13B, 32 GB para 33B)
- só então escolha a faixa de preço, decidindo se você precisa de GPU ou se CPU resolve
- teste com o menor plano antes de fechar contrato longo, porque contrato de 24 meses no plano errado é caro de corrigir
Se você quer o passo a passo de colocar o modelo pra rodar depois de escolher a máquina, o conteúdo sobre hospedar modelos LLM em VPS aqui do blog continua a história
E se a sua dúvida ainda é mais lá atrás, tipo "vale mais rodar local, chamar API ou subir numa VPS?", essa comparação é outro assunto e merece post próprio
Escolhe o modelo, confere a RAM, depois olha o preço
Nessa ordem 😀
Até o próximo post!
Matheus Battisti
Perguntas frequentes
Quanto de RAM preciso pra rodar o Llama 3.1 8B numa VPS?
O Ollama recomenda pelo menos 8 GB de RAM para modelos 7B, e o Llama 3.1 8B se encaixa nessa faixa (o download da variante pesa 4,9 GB, com janela de contexto de 128K). Na prática, um plano de entrada como o Hostinger KVM 2 (2 vCPU, 8 GB de RAM) já bate o piso mínimo, mas não sobra folga.
Dá pra rodar o Llama 3.1 405B numa VPS de assinatura mensal comum?
Na teoria sim, mas na prática é inviável nos planos comparados aqui. O download do llama3.1:405b sozinho pesa 243 GB, um volume de memória e disco que nenhuma VPS sem GPU desta lista atinge com folga.
Qual a diferença de hardware entre gpt-oss-20b e gpt-oss-120b?
O gpt-oss-20b roda dentro de 16 GB de memória, enquanto o gpt-oss-120b pede uma única GPU de 80 GB. Essa diferença existe porque os pesos de mixture-of-experts do gpt-oss (mais de 90% dos parâmetros) são quantizados em MXFP4, a 4,25 bits por parâmetro, e o Ollama já suporta esse formato nativamente.
Existe VPS com GPU no Brasil pra rodar modelo de IA local?
Sim, a Rollin Host tem servidor com GPU no Brasil em dois planos: o Inferência, com GPU de 20 GB por R$ 3.249/mês, indicado para modelos de 7B a 13B como Llama 3 8B, Mistral 7B, Phi-3 e Gemma 2; e o Pro, com GPU de 96 GB por R$ 12.879/mês, voltado a modelos grandes e fine-tuning. Os dois já vêm com Ollama, vLLM e llama.cpp prontos.
Compensa pagar GPU por hora em vez de assinar uma VPS com GPU fixa?
Depende de quanto tempo o modelo fica realmente em uso. Na RunPod, a RTX 4090 sob demanda sai a partir de US$ 0,34 por hora e a A100 PCIe a partir de US$ 1,39 por hora, com cobrança por milissegundo. Pra uso esporádico isso pode custar menos que um servidor fixo de centenas ou milhares de reais por mês, mas pra uso constante a assinatura tende a sair mais em conta.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

As diferenças de var, let e const

Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]

ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]
