Qual IA local rodar na sua máquina? O guia com os números que a documentação publica
Rodar IA no seu próprio computador, sem mensalidade e sem mandar suas conversas para servidor de ninguém, deixou de ser coisa de programador. Hoje é instalar um programa, baixar um modelo e conversar. A parte que quase ninguém explica é a que decide tudo: se a sua máquina aguenta o modelo que você quer — e essa resposta é um número, não um palpite.
Este guia usa só o que os próprios projetos publicam em suas documentações oficiais. Cada requisito abaixo tem fonte — e o que ninguém publica está marcado como não confirmado, não chutado.
Os três programas (e para quem cada um serve)
- Ollama — o caminho mais curto. No Windows é o instalador
OllamaSetup.exe; no Linux e macOS é uma linha:curl -fsSL https://ollama.com/install.sh | sh. A documentação pede Windows 10 22H2 ou mais novo e, para quem tem placa NVIDIA, driver 551.61 ou mais recente no Windows. - LM Studio — o de interface gráfica, para quem quer procurar e baixar modelos clicando. A documentação é específica sobre o que a máquina precisa ter: processador com AVX2, 16 GB de RAM recomendados e pelo menos 4 GB de VRAM dedicada recomendados. Funciona em Windows (x64 e ARM), Mac com Apple Silicon e Linux (Ubuntu 20.04 ou mais novo).
- llama.cpp — o motor. É o projeto em C/C++ que existe para fazer modelo rodar “in a wide range of hardware” com o mínimo de rodeio — e é ele que roda por baixo do LM Studio. No Windows instala com
winget install llama.cpp.
O número que decide tudo: memória
A regra oficial do llama.cpp é a mais importante deste guia, e ela é simples: “memory and disk requirements are the same” — o modelo é carregado inteiro na memória. Ou seja: o tamanho do arquivo do modelo é, na prática, o tamanho da memória que você vai precisar ter disponível para carregá-lo.
E os tamanhos oficiais (Llama 3.1, versão comprimida Q4_K_M, publicados pelo llama.cpp):
- 8B (8 bilhões de parâmetros): 4,9 GB
- 70B: 43,1 GB
- 405B: 249,1 GB
No catálogo oficial do Ollama os números batem: llama3.1:70b aparece com 43 GB; a família Gemma 3 vai de gemma3:1b com 815 MB até gemma3:12b com 8,1 GB e gemma3:27b com 17 GB.
Traduzindo para a vida real: modelo de 8 bilhões cabe tranquilo em um PC comum de hoje; o de 70 bilhões exige uma estação de trabalho; o de 405 bilhões não é coisa de PC — a própria tabela mostra por quê.
O que significa o "Q4" no nome do modelo
É a quantização: reduzir a precisão dos pesos do modelo — o llama.cpp descreve como ir de números de 32 bits para inteiros de 4 bits, o que "shrinks the model's size and can speed up inference". É por isso que o Llama 3.1 de 8B ocupa 4,9 GB e não os 32,1 GB originais. O LM Studio resume para o usuário: comprimir o arquivo "while giving up some degree of quality" — troca-se um pouco de qualidade por muito espaço e velocidade. Sem esse truque, IA local em PC comum não existiria.
Onde a placa de vídeo entra (o gancho deste guia)
Aqui está a decisão de hardware, na palavra dos próprios projetos:
- O Ollama mostra o quanto do modelo foi para a placa: "100% GPU means the model was loaded entirely into the GPU", e um parcial tipo 48%/52% significa metade na placa, metade na RAM do sistema.
- Quem decide isso é a VRAM: "Ollama evaluates the required VRAM for the model against what is currently available".
- Sem VRAM suficiente, não é proibido rodar — só fica pior: o Ollama usa a RAM do sistema, "but responses may be slower".
- O llama.cpp faz o mesmo de forma explícita: dá para escolher quantas camadas manter na placa (
-ngl, "999 para empurrar tudo") e suporta "CPU+GPU hybrid inference" — acelerar parcialmente modelos maiores do que a VRAM total.
Conclusão honesta em uma frase: a VRAM da placa é o teto do modelo que roda inteiro na velocidade máxima; o que passa disso desce para a memória do sistema e desacelera. É por isso que, para IA local, a pergunta "qual placa comprar?" tem resposta objetiva: a que tem VRAM para o modelo que você quer rodar com folga.
E os seus dados, ficam na sua máquina?
O que cada doc afirma — sem exagero:
- Ollama: "We don't see your prompts or data when you run locally." E existe um modo exclusivamente local, desativando os recursos de nuvem do próprio programa.
- LM Studio: "Nothing you enter into LM Studio when chatting with LLMs leaves your device" — e, em geral, funciona sem internet depois de baixar os modelos.
- llama.cpp: o aplicativo do projeto se apresenta como "Works offline".
Uma ressalva que vale sempre: "rodar localmente" se refere ao programa e ao modelo. Baixar o modelo precisa de internet (obviamente), e qualquer recurso extra de nuvem que você ligar por cima é sua escolha — daí a existência do modo local do Ollama.
A decisão em três caminhos
- PC com 8 GB de RAM, sem placa dedicada → comece com modelos pequenos:
gemma3:1btem 815 MB. Dá para começar hoje, sem gastar nada. - 16 GB de RAM com placa de 4 a 6 GB de VRAM → o padrão da IA local: modelos de 8 bilhões quantizados (4,9 GB). É a combinação que os próprios programas tratam como recomendada (o LM Studio pede 16 GB de RAM e 4 GB de VRAM).
- O alvo é 70 bilhões de parâmetros → 43 GB de memória. Máquina específica — ou um grupo de placas. Para 405B, são 249 GB: território de empresa, não de mesa.
Por onde começar, na prática: instale o Ollama, baixe um modelo pequeno, converse — e repare no número que ele mostra de GPU contra CPU. Esse número é o diagnóstico da sua máquina; ele diz, sem você precisar entender de hardware, o quanto do modelo está na placa e o quanto está na memória do sistema.
E se a sua ambição é ter um assistente que usa essa IA local para trabalhar sozinho — arquivo, terminal, rotinas agendadas —, veja como instalar o Hermes Agent, que é o agente que roda aqui na nossa bancada. Se o que travou é o computador velho, o guia de SSD resolve a primeira parte do problema por menos de R$ 360.
Transparência (de onde vem cada informação)
Método: curadoria de documentação oficial, com cada citação reaberta na origem em 08/10/2026. Fontes: docs.ollama.com (páginas Windows, GPU, FAQ, Quickstart), lmstudio.ai/docs (página do aplicativo, requisitos de sistema, offline, download de modelo, linha de comando), github.com/ggml-org/llama.cpp (página do projeto, build, instalação, quantização, múltiplas placas) e llama.app, além do catálogo oficial de modelos do Ollama (ollama.com/library). Tabelas de tamanho: README oficial de quantização do llama.cpp e páginas de catálogo do Ollama.
O que NÃO conseguimos confirmar: (a) RAM mínima para rodar o Ollama — a doc declara sistema e drivers, mas não publica um mínimo de memória; (b) uma tabela genérica de memória por "7B" e "13B" — as fontes oficiais publicam 8B/70B/405B e famílias específicas (1B/12B/27B), então não extrapolamos; (c) um fator numérico de aceleração com placa dedicada — nenhum dos três projetos publica número; a doc afirma apenas que a versão sem VRAM "pode responder mais devagar"; (d) RAM mínima declarada pelo llama.cpp — não publicada.
O que não fizemos: não rodamos os modelos em bancada própria para medir velocidade — os requisitos citados são os publicados pelos próprios projetos. Não temos relação comercial com Ollama, LM Studio ou llama.cpp, e este post não tem link de afiliado.
Nota sobre hardware: o gancho de placa de vídeo existe porque a VRAM é o critério objetivo citado pelas próprias documentações. Quando indicarmos placas aqui, virão com os mesmos critérios de fonte oficial deste blog.
Leia também
Quanto custa rodar IA local por mês? A conta de luz que ninguém faz (com os números oficiais)
Mensalidade zero, mas a conta de luz existe: R$ 4 a 35 por mes conforme o uso — calculado com a potencia…
Placa de vídeo para IA local: a VRAM é o que compra (e o que os anúncios escondem)
A NVIDIA publica a tabela: 6-8GB roda até 4B, 12-16GB destrava 9-12B, 24GB chega aos 27B. Comparadas as 6 placas com preço…
Como instalar o Hermes Agent: o agente de IA que roda na sua máquina (Windows e Linux)
Instalação em um comando no Windows e no Linux, como dar um modelo ao agente e as cinco armadilhas que a própria…