Waarom dit getal
Er is een simpele rekenregel: bij 4-bit kwantisatie, de standaard van Ollama, kost een model ongeveer 0,6 GB per miljard parameters. Een 7B-model komt daarmee op 4 tot 5 GB, een 13B op ongeveer 8 GB, en een 70B op 40 GB of meer. Zonder GPU komt dat allemaal uit je systeemgeheugen; mét GPU is je VRAM de bepalende factor.
Alleen zo hoog zonder GPU; mét GPU is VRAM de echte limiet
LXC of VM?
Een VM is hier de rustigere keuze. Ollama / lokale LLM kán in een container, maar in de praktijk levert dat problemen op. Reken op 12,5 GB inclusief overhead.
Waar je op moet letten
- Tel 1 tot 2 GB bij voor het contextvenster en de KV-cache, en meer als je met lange contexten werkt.
- Een 70B-model past niet in een homelab zonder serieuze GPU — 40 GB is geen tikfout.
- 4-bit halveert het geheugen tegenover 8-bit met weinig kwaliteitsverlies; daarom is het de standaard.
- Zonder GPU is het antwoordtempo zo laag dat het zelden praktisch is.
- Dit is de dienst waar een homelab het snelst tekortkomt tegenover een API.
Hoeveel passen er?
na host en 12% marge| Server | Aantal Ollama / lokale LLM | Beschikbaar |
|---|---|---|
| 8 GB | 0× | 5,28 GB |
| 16 GB | 0× | 12,32 GB |
| 32 GB | 2× | 26,4 GB |
| 64 GB | 4× | 54,56 GB |