Beste AI-modellen om lokaal op hardware voor consumenten te draaien

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Qwen3.5-9B is in 2026 het beste lokale AI-model voor de meeste consumenten-pc’s, dankzij zijn veelzijdigheid.

De betere keuze kan nog steeds veranderen afhankelijk van je werklast: compacte modellen zijn sneller op CPU’s en laptops, 8B–14B-modellen bieden meestal de beste balans tussen kwaliteit en geheugengebruik, en grotere modellen of mixture-of-experts-modellen zijn zinvol wanneer nauwkeurigheid bij programmeren, redeneren of multimodale taken belangrijker is dan snelheid.

Bij de onderstaande vergelijking gebruiken we praktische implementaties in 4 bits als uitgangspunt, zodat je een model kunt afstemmen op het RAM of de VRAM die je al hebt voordat je tientallen gigabytes aan gewichten downloadt.

Vergelijking van lokale AI-modellen: de shortlist

Rang Model Ideaal voor Geschatte omvang in 4 bits Praktische startconfiguratie Belangrijk compromis
1 Qwen3.5-9B Beste algemene keuze 6–8 GB 16 GB RAM of 8–12 GB VRAM Lange contexten vereisen veel meer geheugen
2 Gemma 4 12B Multimodaal werk 9–12 GB 24 GB RAM of 12–16 GB VRAM Zwaarder dan modellen die alleen tekst verwerken
3 gpt-oss-20b Lokaal redeneren Ongeveer 16 GB in MXFP4 16 GB uniform geheugen of VRAM Vereist hoogwaardige consumentenhardware
4 Ministral 3 14B Instruct Agents en toolgebruik 9–12 GB 24 GB RAM of 12–16 GB VRAM Trager dan kleinere 8B–9B-modellen
5 Qwen3-Coder-30B-A3B Lokaal programmeren 18–22 GB 32 GB RAM of 24 GB VRAM De totale gewichten blijven groot, ondanks 3,3B actieve parameters
6 DeepSeek-R1-Distill-Qwen-14B Redeneren voor budgetsystemen 9–11 GB 24 GB RAM of 12–16 GB VRAM De uitvoer van redeneringen kan langdradig en traag zijn
7 Qwen3-VL-8B Instruct Afbeeldingen en documenten 7–10 GB inclusief vision-componenten 16–24 GB RAM of 12 GB VRAM De beeldresolutie beïnvloedt het geheugengebruik
8 Phi-4 Mini Instruct Redeneren op kleine apparaten 3–5 GB 8–16 GB RAM of 6 GB VRAM Minder brede kennis dan grotere modellen
9 Gemma 3n E4B Multimodale AI voor mobiele apparaten en systemen met beperkte middelen 4–7 GB 8–16 GB uniform RAM Ondersteuning voor runtimes verschilt per platform
10 Llama 3.2 3B Instruct Lichtgewicht compatibiliteit met het ecosysteem 2–4 GB 8 GB RAM of 4–6 GB VRAM Ouder en minder krachtig dan nieuwere kleine modellen

Geheugenwaarden zijn schattingen voor planningsdoeleinden, geen garanties. Ze gaan uit van een praktische 4-bits build, waar beschikbaar, en een gematigd contextvenster. Runtime-overhead, KV-cache, vision-encoders, batchgrootte en GPU-offloading kunnen meerdere gigabytes extra vereisen.

Hoe we de beste modellen voor lokaal gebruik hebben gekozen

Dit is geen ranglijst die alleen op benchmarks is gebaseerd. Een model dat een test wint maar niet op je machine past, is niet het beste lokale model voor jou. We hebben vijf factoren vooropgesteld: nuttige uitvoerkwaliteit, realistische compatibiliteit met consumentenhardware, beschikbaarheid van lokale runtimes of gekwantiseerde builds, taakbereik en licentie- of toegangsbeperkingen.

We hebben “consumentenhardware” ook breed opgevat: Windows- en Linux-pc’s, Macs met Apple Silicon, compacte thuisservers en homelabs rond NAS-opslag. Als je eerst onderdelen kiest, gebruik dan onze gids voor betaalbare hardware voor lokale AI-servers om het volledige systeem te dimensioneren, in plaats van je alleen op het GPU-geheugen te richten.

1. Qwen3.5-9B — Beste lokale AI-model in het algemeen

Qwen3.5-9B is de meest gebalanceerde aanbeveling voor een moderne computer met 16 GB of een GPU met 8–12 GB. Het model is klein genoeg om in een praktisch gequantiseerd formaat te draaien, maar krachtig genoeg voor chat, samenvattingen, retrieval-augmented generation, meertalig werk en lichte programmeertaken.

De officiële modelkaart vermeldt een native contextvenster van 262.144 tokens, maar dat getal moet niet je standaardinstelling voor lokaal gebruik worden. De KV-cache groeit mee met de context, dus begin rond 8K–16K en verhoog dit alleen wanneer de werklast dat rechtvaardigt. Zo houd je de latentie en het geheugengebruik onder controle.

  • Kies dit als: je één model voor algemeen dagelijks lokaal gebruik wilt.
  • Sla dit over als: je belangrijkste taak hoogwaardige codegeneratie of audio-/videobegrip is.
  • Ideale combinatie: 4-bitkwantisatie op een GPU van 12 GB, of hybride CPU/GPU-inferentie met 16–24 GB systeem-RAM.

2. Gemma 4 12B — Beste voor lokale multimodale AI

Gemma 4 12B is de sterkere keuze wanneer “lokale AI” meer betekent dan alleen tekst. Volgens de modelkaart van Google ondersteunt het model native invoer van tekst, afbeeldingen, audio en video, een contextvenster tot 256K, meertalige ondersteuning voor meer dan 140 talen en een architectuur die bedoeld is voor gestroomlijnde lokale uitvoering.

Maak kennis met Gemma 4 12B

Die veelzijdigheid brengt extra belasting met zich mee. Reken op 24 GB systeem-RAM of 12–16 GB VRAM voor een comfortabele gequantiseerde implementatie en houd extra ruimte vrij voor media-invoer. Het is vooral nuttig voor privé-fotoanalyse, documentbegrip, workflows met vergadermedia en multimodale zoekopdrachten.

  • Kies dit als: je één model nodig hebt dat tekst en media begrijpt.
  • Sla dit over als: je alleen snelle tekstchats nodig hebt op een laptop met 8 GB.
  • Ideale combinatie: 16 GB VRAM of 32 GB gedeeld geheugen.

3. gpt-oss-20b — Beste voor hoogwaardige redeneervermogens op een consumenten-GPU

gpt-oss-20b richt zich op het hogere segment van consumentenhardware. OpenAI zegt dat het kan draaien met 16 GB geheugen, terwijl de officiële Ollama-handleiding ten minste 16 GB VRAM of gedeeld geheugen aanbeveelt voor het kleinere model.

GPT-OSS 120B & 20B: OpenAI's redeneermodellen met open gewichten uitgelegd | door Servifyspheresolutions | Medium

Het is zeer geschikt voor gebruikers die weloverwogen redeneringen, gestructureerde uitvoer of lokale experimenten willen zonder over te stappen op GPU's uit de workstationklasse. Het praktische nadeel is dat 16 GB een beginpunt is en geen royale reserve biedt: lange contexten, parallelle verzoeken of indelingen die niet op MXFP4 zijn gebaseerd kunnen het geheugengebruik verhogen.

  • Kies dit als: redeneerkwaliteit belangrijker is dan lage latentie.
  • Sla dit over als: je slechts 8 GB VRAM hebt of uitsluitend CPU-inferentie gebruikt.
  • Ideale situatie: een GPU van 16–24 GB of een Apple Silicon-systeem met minstens 24 GB unified memory.

4. Ministral 3 14B Instruct — Beste voor lokale agents en toolgebruik

Ministral 3 14B Instruct combineert tekst en visie met native functieaanroepen, JSON-uitvoer, meertalige ondersteuning en sterke naleving van systeemprompts. Mistral positioneert deze familie voor edge-implementatie en vermeldt dat het 14B-model binnen 24 GB VRAM past in FP8, met lagere vereisten na verdere kwantisering.

Ministral-3 3B lokaal draaien: een efficiënt klein model met visie

Voor een private thuisassistent die zoek-, automatiserings- of bestandsfuncties aanroept, kunnen deze betrouwbaarheidsfuncties belangrijker zijn dan een klein benchmarkvoordeel. Een 4-bits versie zou op hardware met minder geheugen moeten passen, maar 12–16 GB VRAM biedt een comfortabeler werkbereik.

  • Kies dit als: je agents met toolgebruik of gestructureerde workflows bouwt.
  • Sla dit over als: je prioriteit ligt bij het maximale aantal tokens per seconde op een instap-GPU.
  • Ideale situatie: 16 GB VRAM en een gemiddeld contextvenster.

5. Qwen3-Coder-30B-A3B Instruct — Beste lokale codeermodel

Qwen3-Coder-30B-A3B Instruct is speciaal ontwikkeld voor agentisch coderen, begrip op repositoryschaal en het aanroepen van functies. De mixture-of-experts-architectuur bevat in totaal 30,5 miljard parameters, maar activeert er ongeveer 3,3 miljard per token. Dit bevordert de computerefficiëntie zonder dat de volledige gekwantiseerde gewichten niet langer hoeven te worden opgeslagen.

Qwen/Qwen3-Coder-30B-A3B-Instruct · Hugging Face

Dat onderscheid is belangrijk voor de hardwareplanning. Een 4-bits build hoort doorgaans op een GPU met 24 GB of op een machine met minstens 32 GB systeemgeheugen. De native context van 256K is aantrekkelijk voor grote repositories, maar lokale gebruikers kunnen beter kleiner beginnen, omdat de codecontext snel veel KV-cachegeheugen kan verbruiken.

  • Kies dit model als: coderen je belangrijkste toepassing is en je over 24 GB grafisch geheugen beschikt.
  • Sla dit model over als: je een lichtgewicht assistent voor dagelijks gebruik wilt.
  • Ideale punt: 24 GB VRAM, snelle NVMe-opslag en 64 GB systeem-RAM voor voldoende speelruimte.

6. DeepSeek-R1-Distill-Qwen-14B — Beste budgetmodel voor redeneren

DeepSeek-R1-Distill-Qwen-14B comprimeert redeneerpatronen die het van DeepSeek-R1 heeft geleerd in een dicht 14B-checkpoint op basis van Qwen2.5. Het blijft een praktische optie voor wiskunde, logica en stapsgewijze probleemoplossing op hardware waarop het volledige DeepSeek-R1-model niet kan draaien.

deepseek-ai/DeepSeek-R1-Distill-Qwen-14B · Hugging Face

De keerzijde is de efficiëntie van de uitvoer. Redeneringssporen kunnen lang zijn, waardoor de tijd tot een antwoord en het energieverbruik toenemen. Gebruik een verstandige tokenlimiet en bewaar dit model voor problemen die baat hebben bij weloverwogen redeneren in plaats van routinematige chat.

  • Kies dit model als: je betaalbaar lokaal redeneren wilt met breed beschikbare kwantisaties.
  • Sla dit model over als: je beknopte, directe antwoorden belangrijker vindt dan diepgang in het redeneren.
  • Ideale punt: 12–16 GB VRAM of 24–32 GB systeem-RAM.

7. Qwen3-VL-8B Instruct — Beste voor afbeeldingen en documentbegrip

Qwen3-VL-8B Instruct is een gerichte keuze voor vision-language-taken met screenshots, gescande pagina's, diagrammen, grafieken en visuele vraagbeantwoording. Officiële GGUF-builds bevatten Q4_K_M-gewichten en afzonderlijke vision-projectiebestanden, waardoor implementatie via llama.cpp-compatibele tools eenvoudiger wordt.

Qwen/Qwen3-VL-8B-Instruct · Hugging Face

Het werkelijke geheugengebruik hangt af van het aantal en de resolutie van de afbeeldingen. Zorg daarom voor meer geheugenruimte dan bij een tekstmodel van 8B. Combineer het model voor privéarchieven met OCR en retrieval, in plaats van elke pagina op volledige resolutie in één prompt te plaatsen. Onze hardwarevergelijking voor foto-AI en document-RAG legt de verschillende knelpunten uit.

  • Kies dit model als: je werkt met afbeeldingen, pdf's, schermafbeeldingen of visuele documenten.
  • Sla dit model over als: je werklast volledig uit tekst bestaat.
  • Ideale situatie: 12 GB VRAM of 24 GB gedeeld systeemgeheugen.

8. Phi-4 Mini Instruct — Beste keuze voor redeneren met weinig geheugen

Phi-4 Mini Instruct is ontworpen voor omgevingen met beperkte rekenkracht en hoge eisen aan latentie, met nadruk op het volgen van instructies, wiskunde en logica. Microsoft vermeldt een contextvenster van 128K, hoewel dezelfde waarschuwing voor lokaal geheugen geldt: capaciteit betekent niet dat je op een kleine machine de maximale context moet toewijzen.

Welkom bij de nieuwe Phi-4-modellen - Microsoft Phi-4-mini & Phi-4-multimodal

Het is een slimme eerste keuze voor een compacte pc, oudere laptop of server die voornamelijk op de CPU draait. Microsoft biedt ook geoptimaliseerde ONNX-versies voor implementatie op CPU en GPU in desktop- en mobiele omgevingen.

  • Kies dit model als: je redeneervermogen nodig hebt binnen een klein geheugengebruik.
  • Sla dit model over als: brede feitelijke kennis en creatief schrijven je hoogste prioriteiten zijn.
  • Ideale situatie: 8–16 GB systeem-RAM of een GPU van 6 GB.

9. Gemma 3n E4B — Beste keuze voor mobiel gebruik en multimodaal gebruik met beperkte middelen

Gemma 3n E4B is ontworpen voor efficiënte werking op apparaten met beperkte middelen en accepteert invoer in de vorm van tekst, afbeeldingen, video en audio. Het is een handige optie wanneer een geïntegreerde GPU of laptop met gedeeld geheugen belangrijker is dan maximale desktopprestaties.

gemma3n:e4b

Controleer de compatibiliteit met de runtime voordat je je aan een workflow vastlegt. Multimodale ondersteuning kan actuele bibliotheken en platformspecifieke backends vereisen, terwijl je voor toegang tot het model mogelijk de licentievoorwaarden van Google moet accepteren. Zodra het wordt ondersteund, maakt de compacte omvang het aantrekkelijk voor privétools in het veld en offline media-analyse.

  • Kiezen als: je multimodale functies wilt op een efficiënte laptop of edge-apparaat.
  • Overslaan als: je de eenvoudigste platformonafhankelijke configuratie nodig hebt.
  • Ideale balans: 16 GB gedeeld geheugen met een geoptimaliseerde native runtime.

10. Llama 3.2 3B Instruct — Beste keuze voor een lichtgewicht ecosysteem

Llama 3.2 3B Instruct is niet langer het nieuwste kleine model, maar blijft nuttig dankzij de brede ondersteuning voor runtimes, tutorials en de community. Meta ontwierp de tekstmodellen van 1B en 3B voor meertalige dialogen, retrieval, samenvattingen en gebruik op apparaten.

meta-llama/Llama-3.2-3B-Instruct · Hugging Face

Kies dit model vanwege de compatibiliteit, niet vanwege toonaangevende intelligentie. Het draait op bescheiden systemen en is eenvoudig te integreren, waardoor het een betrouwbare basis vormt om een toepassing te testen voordat je overstapt op een groter model.

  • Kiezen als: je volwassen tooling en een kleine download belangrijk vindt.
  • Overslaan als: je de hoogst beschikbare uitvoerkwaliteit in 2026 wilt.
  • Ideale balans: 8 GB systeem-RAM, met optionele gedeeltelijke GPU-offloading.

Welk model past bij jouw hardware?

8 GB RAM of 4–6 GB VRAM

Begin met Phi-4 Mini of Llama 3.2 3B met 4-bitsquantisatie. Houd de context tussen 4K en 8K, verwerk één verzoek tegelijk en verwacht dat generatie op de CPU bruikbaar is, maar niet direct. Kleine systemen werken goed voor classificatie, samenvattingen, eenvoudige RAG en automatiseringen thuis.

16 GB RAM of 8–12 GB VRAM

Qwen3.5-9B is de standaardaanbeveling. Qwen3-VL-8B past ook wanneer visuele input vereist is, al heeft het meer speelruimte nodig. Deze klasse biedt de beste balans voor gangbare gaming-pc's, MacBooks en compacte lokale AI-configuraties.

24–32 GB RAM of 16 GB VRAM

Gemma 4 12B, Ministral 3 14B, DeepSeek-R1-Distill-Qwen-14B en gpt-oss-20b worden realistische opties. De GPU-klasse van 16 GB is bijzonder nuttig, omdat die trage overdrachten van CPU naar GPU voorkomt en toch voldoende capaciteit biedt voor een gematigde context.

64 GB RAM of 24 GB VRAM

Qwen3-Coder-30B-A3B is hier praktisch, samen met hoogwaardige quantisaties van kleinere modellen. Deze klasse is geschikt voor serieuze codeerassistenten, meerdere lokale services, grotere RAG-collecties en experimenten met langere contexten.

Als de prestaties tegenvallen, stel dan eerst de daadwerkelijke bottleneck vast voordat je het model vervangt. Onze handleiding over knelpunten in rekenkracht, geheugen, opslag en netwerken voor lokale AI helpt onderscheid te maken tussen trage tokengeneratie en langzaam laden of ophalen van modellen.

Deze modellen lokaal uitvoeren

  1. Kies een runtime. Ollama is handig voor gebruik via de opdrachtregel en API's, LM Studio biedt een toegankelijke desktopinterface en llama.cpp biedt uitgebreide controle over GGUF-inferentie en hardware-offloading.
  2. Download een gekwantiseerde build. Q4_K_M is een verstandig algemeen startpunt voor GGUF-modellen. Indelingen met minder bits besparen geheugen, maar kunnen de kwaliteit verminderen; indelingen met meer bits verbeteren de getrouwheid, maar gebruiken meer RAM.
  3. Begin met een korte context. Stel eerst 4K–8K in, controleer het geheugen- en snelheidsgebruik en verhoog dit daarna geleidelijk. Een geadverteerde context van 128K of 256K betekent niet dat de maximale context kosteloos is.
  4. Besteed lagen uit aan de GPU. Als het volledige model niet in het VRAM past, kan gedeeltelijke offloading de inferentie toch versnellen, terwijl het systeem-RAM de rest bevat.
  5. Test je eigen prompts. Beoordeel nauwkeurigheid, latentie, toolaanroepen, opmaak en hallucinaties bij de taken die je daadwerkelijk uitvoert. Openbare benchmarks kunnen je documenten of workflow niet reproduceren.

Volg voor een end-to-end-implementatieplan de handleiding van ZimaSpace voor het bouwen van een lokale AI-server. Als gegevensprivacy de belangrijkste reden is om lokaal te werken, behandelt de privacyhandleiding voor zelfgehoste LLM's opslag, netwerkblootstelling, logboeken en toegangsbeheer.

Waar Zima-hardware past

Een lokaal AI-systeem hoeft opslag, orkestratie en inferentie niet op één apparaat te plaatsen. Een ZimaBoard 2 kan model-API's, lichte RAG, automatiseringen en privédataservices coördineren. De Intel N150-processor, tot 16 GB LPDDR5-geheugen, dubbele 2,5GbE, SATA en PCIe-uitbreiding maken het apparaat geschikter voor kleine CPU-modellen of orkestratie dan voor hoogwaardige LLM-inferentie.

Voor grotere datasets en uitbreidbare AI-hardware combineert ZimaCube 2 opslag met meerdere schijven, SSD-uitbreiding, Thunderbolt 4 en PCIe-opties. Het kan privé opgeslagen modelbestanden en RAG-gegevens hosten terwijl een systeem met GPU de inferentie uitvoert, of fungeren als het centrum van een meer geïntegreerde AI-homelab. Door deze scheiding blijven waardevolle gegevens lokaal, zonder dat elke service op de machine met het hoogste energieverbruik hoeft te draaien.

Veelgestelde vragen

Wat is het beste AI-model om lokaal uit te voeren in 2026?

Qwen3.5-9B is voor de meeste gebruikers het beste algemene startpunt, omdat het mogelijkheden, snelheid, meertalige prestaties en een beheersbare gekwantiseerde omvang in balans brengt. Kies Gemma 4 12B voor multimodaal werk, gpt-oss-20b voor sterkere redeneercapaciteit of Qwen3-Coder-30B-A3B voor serieus programmeerwerk.

Kan ik een lokaal AI-model uitvoeren zonder GPU?

Ja. CPU-inferentie werkt goed met kleinere 3B–4B-modellen en kan 8B–9B-modellen uitvoeren als je voldoende RAM hebt, maar de generatie zal trager zijn. Apple Silicon en moderne geïntegreerde GPU's kunnen gedeeld geheugen gebruiken, terwijl x86-systemen vaak baat hebben bij gedeeltelijke GPU-offloading.

Hoeveel RAM heb ik nodig voor een lokaal LLM?

Acht gigabyte is genoeg voor compacte gekwantiseerde modellen, 16 GB is het praktische minimum voor de meeste toepassingen en 32 GB biedt ruimte voor 12B–20B-modellen. Voor gekwantiseerde gewichten van de 30B-klasse kan 32 GB het model uitvoeren, maar 64 GB is comfortabeler wanneer andere services en lange contexten een rol spelen.

Verliest een 4-bitsmodel kwaliteit?

Meestal een beetje, maar goede 4-bitskwantiseringen behouden voldoende kwaliteit voor chat, RAG, programmeerondersteuning en thuisgebruik, terwijl ze het geheugengebruik sterk verlagen. De precieze impact hangt af van het model en de kwantiseringsmethode, dus vergelijk enkele representatieve prompts voordat je je implementatie standaardiseert.

Is VRAM belangrijker dan systeem-RAM?

VRAM bepaalt meestal hoeveel van het model op volledige GPU-snelheid kan draaien. Systeem-RAM kan gewichten bevatten die niet passen, maar het verplaatsen van gegevens tussen CPU en GPU verlaagt de prestaties. Systemen met gedeeld geheugen vervagen die grens, al blijft de geheugenbandbreedte belangrijk.

Eindoordeel

Begin met het kleinste model dat je echte werklast betrouwbaar afhandelt. Voor de meeste mensen betekent dat Qwen3.5-9B; stap over op Gemma 4 12B voor multimodale invoer, gpt-oss-20b of DeepSeek-R1-Distill-Qwen-14B voor redeneertaken en Qwen3-Coder-30B-A3B voor programmeren. Stem de kwantisering en contextlengte af op je beschikbare geheugen en schaal de hardware pas op nadat je de bottleneck hebt gemeten.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.