Capaciteitsplanner · Desktop & AI

Hoeveel RAM heeft Ollama / lokale LLM nodig?

Ollama / lokale LLM heeft in een homelab ongeveer 12 GB RAM nodig. In een LXC-container komt dat neer op 12 GB, als volledige VM op 12,5 GB inclusief kernel-overhead. Reken op 4 vCPU.

Werkende set12 GB
Als LXC12 GB
Als VM12,5 GB
vCPU4
Schijf60 GB

Waarom dit getal

Er is een simpele rekenregel: bij 4-bit kwantisatie, de standaard van Ollama, kost een model ongeveer 0,6 GB per miljard parameters. Een 7B-model komt daarmee op 4 tot 5 GB, een 13B op ongeveer 8 GB, en een 70B op 40 GB of meer. Zonder GPU komt dat allemaal uit je systeemgeheugen; mét GPU is je VRAM de bepalende factor.

Alleen zo hoog zonder GPU; mét GPU is VRAM de echte limiet

LXC of VM?

Een VM is hier de rustigere keuze. Ollama / lokale LLM kán in een container, maar in de praktijk levert dat problemen op. Reken op 12,5 GB inclusief overhead.

Waar je op moet letten

  • Tel 1 tot 2 GB bij voor het contextvenster en de KV-cache, en meer als je met lange contexten werkt.
  • Een 70B-model past niet in een homelab zonder serieuze GPU — 40 GB is geen tikfout.
  • 4-bit halveert het geheugen tegenover 8-bit met weinig kwaliteitsverlies; daarom is het de standaard.
  • Zonder GPU is het antwoordtempo zo laag dat het zelden praktisch is.
  • Dit is de dienst waar een homelab het snelst tekortkomt tegenover een API.

Hoeveel passen er?

na host en 12% marge
Aantal exemplaren van Ollama / lokale LLM per servergrootte
ServerAantal Ollama / lokale LLMBeschikbaar
8 GB0×5,28 GB
16 GB0×12,32 GB
32 GB2×26,4 GB
64 GB4×54,56 GB
Reken door met je eigen hardware en de rest van je configuratie erbij. Open de planner

Ook in Desktop & AI