Qwen3.8-27B lokaal uitvoeren: RAM, VRAM, kwantisatie en Ollama-handleiding

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Qwen3.8-27B is uitzonderlijk praktisch voor een model in deze capaciteitsklasse. De officiële release is een dicht vision-language-model van 27B met een native contextvenster van 262.144 tokens, terwijl huidige vierbits-GGUF-builds ongeveer 16–18 GB groot zijn. Daarmee komt bruikbare lokale inferentie binnen bereik van één NVIDIA-GPU van 24 GB, een systeem met veel gedeeld geheugen of zelfs een CPU-georiënteerde machine met voldoende RAM—hoewel deze drie configuraties zeer verschillende snelheden bieden.

Voor de meeste lokale gebruikers is een Q4-configuratie met minimaal 32 GB systeem-RAM het beste startpunt, of een GPU van 24 GB als je het model vrijwel volledig op de GPU wilt laten draaien. Maar modelgrootte is slechts een deel van de hardwareberekening. Een lange context gebruikt extra geheugen, multimodale invoer voegt een visioncomponent toe, agressieve 1-bits- en 2-bits-kwantisaties ruilen kwaliteit in voor capaciteit, en de keuze tussen Ollama, llama.cpp, vLLM en andere runtimes kan zowel de compatibiliteit als de doorvoersnelheid veranderen. Deze gids behandelt die variabelen afzonderlijk, zodat je hardware en kwantisatie kunt kiezen op basis van de werklast.

Kun je Qwen3.8-27B lokaal draaien?

Ja. Qwen3.8-27B is een van de realistischer Qwen-modellen met hoge capaciteiten om op consumentenhardware te draaien. In tegenstelling tot Qwen3.8-Flash-Next, dat een veel grotere sparse architectuur gebruikt, is Qwen3.8-27B een conventioneel dicht 27B-model. Kwantisatie kan het officiële checkpoint van ongeveer 55,6 GB terugbrengen tot circa 16–18 GB bij vierbits-precisie.

De officiële modelkaart van Qwen3.8-27B beschrijft een model met 64 lagen, native begrip van afbeeldingen en video, flexibele denkregeling en een contextvenster van 262.144 tokens dat kan worden uitgebreid tot één miljoen tokens. Qwen bracht het model op 14 augustus 2026 uit onder de Apache 2.0-licentie.

Het belangrijke onderscheid bij lokale hardware is dat een dicht 27B-model al zijn taalmodelgewichten opslaat en gebruikt, in plaats van slechts een kleine subset van MoE-experts te activeren. Kwantisatie heeft daardoor direct invloed op hoeveel RAM of VRAM je nodig hebt.

Implementatie Kan Qwen3.8-27B draaien? Praktische verwachting
16GB RAM-minipc Alleen met zeer agressieve kwantisatie Mogelijk voor experimenten, maar de compromissen in kwaliteit en snelheid zijn aanzienlijk
32GB RAM-pc Ja Een model uit de Q4-klasse past; de CPU- of geïntegreerde-GPU-snelheid hangt sterk af van de geheugenbandbreedte
64GB RAM-pc Ja Ruime capaciteit voor Q4/Q6/Q8, met veel meer ruimte voor context
16GB GPU Gedeeltelijk Vereist een kleinere kwantisatie, een kortere context of gedeeltelijke CPU-offloading
24GB GPU Ja Uitstekend geschikt voor Q4/Q5 en veel praktische contextgroottes
32GB GPU Ja Meer ruimte voor quantisaties van hogere kwaliteit, KV-/cachestatus en lange context
48 GB GPU Ja Q8 plus aanzienlijke ruimte voor inferentie
32 GB+ gedeeld geheugen Ja Capaciteit werkt goed; prestaties hangen af van geheugenbandbreedte en backendoptimalisatie

De eerste fout die je moet vermijden, is ervan uitgaan dat "passen" en "goed draaien" dezelfde vraag zijn. Een GGUF van 17 GB past in 32 GB gewone RAM, maar CPU-inferentie via DDR5 verschilt fundamenteel van het plaatsen van hetzelfde model in 24 GB grafisch geheugen met hoge bandbreedte.

Hoeveel RAM heeft Qwen3.8-27B nodig?

32 GB systeem-RAM is het praktische startpunt voor een normale Q4-implementatie. Zestien gigabyte kan technisch gezien sommige builds met zeer weinig bits bevatten, maar dan blijft er weinig ruimte over voor het besturingssysteem, de contextstatus, runtimebuffers, visionverwerking en andere toepassingen.

De officiële modelrepository zelf is ongeveer 55,6 GB groot. Voor lokale inferentie kiezen de meeste gebruikers echter voor GGUF of een andere gequantiseerde representatie in plaats van de oorspronkelijke BF16-gewichten te laden.

De huidige Qwen3.8-27B-GGUF-repository van Unsloth geeft een nuttig beeld van het geheugenbereik:

Quantisatie Geschatte modelgrootte Aanbevolen systeem-RAM Beste gebruik
UD-IQ1_M 6,73 GB 16 GB+ Extreme geheugenbeperkingen en experimenten
UD-Q2_K_XL 9,83 GB 16 GB+ Systemen met zeer weinig geheugen waarbij kwaliteit moet worden ingeruild voor capaciteit
UD-IQ3_S 12GB 24–32 GB Middenweg voor beperkte hardware
UD-IQ4_XS 14,3 GB 24–32 GB Compacte implementatie in de klasse van vier bits
UD-Q4_K_M 16,5 GB 32 GB+ Sterke standaard voor lokaal gebruik
UD-Q4_K_XL 17,6 GB 32 GB+ Q4-optie van hogere kwaliteit
UD-Q5_K_M 19,8 GB 32 GB+ Meer kwaliteit wanneer het geheugen dit toelaat
UD-Q6_K 22GB 32 GB krap / 48 GB+ Lokale inferentie van hogere kwaliteit
Q8_0 29GB 48–64 GB+ Hoogwaardige quantisatie met minder compressie
Officieel BF16 ~55,6 GB repository 64 GB krap / 96 GB+ Gespecialiseerde implementatie met veel geheugen

Deze RAM-waarden zijn planningsbereiken en geen officiële minimale hardwarevereisten van Qwen. Het modelbestand vormt niet de volledige geheugenvoetafdruk van inferentie. Een systeem heeft ook geheugen nodig voor runtime-status, context, het besturingssysteem en—in multimodale workloads—het visionpad.

Daarom is 32 GB een verstandig uitgangspunt voor Q4, terwijl 64 GB de veel flexibelere configuratie voor lokale AI is. Dankzij het extra geheugen kun je de context vergroten, andere services naast het model draaien, Q6- of Q8-builds testen en voorkomen dat je dicht bij de fysieke geheugenlimiet van het systeem werkt.

Qwen3.8-27B officieel opensource! 27B parameters evenaren topmodellen met gesloten broncode, ondersteuning voor 1 miljoen tokens, lokaal te draaien met slechts 8 GB VRAM – Zero Degree-blog

Hoeveel VRAM heeft Qwen3.8-27B nodig?

Als je een discrete GPU gebruikt, wordt het nuttigste antwoord bepaald door de quantisatie die je in het VRAM wilt behouden.

De standaardbuild van Ollama is momenteel een Q4_K_M-model van ongeveer 18 GB. Ollama identificeert het als een architectuur met 27,3 miljard parameters, qwen35, en bevat een afzonderlijke BF16-visionprojector met 461 miljoen parameters. Je kunt de huidige build bekijken op de Ollama-pagina van het Qwen3.8-27B-model.

GPU-VRAM Aanbevolen richting Wat het betekent
8GB Zware CPU-offload / zeer kleine kwantisatie Geen ideaal doel voor Qwen3.8-27B
12GB Q2/Q3 of gedeeltelijke offload Mogelijk, maar de compromissen worden aanzienlijk
16GB IQ4 of gedeeltelijke Q4 Bruikbaar met zorgvuldige keuzes voor kwantisatie en context
20GB Q4 De basisgewichten passen, maar marge voor context en runtime wordt belangrijk
24GB Q4/Q5-ideale middenweg Een van de sterkste consumentendoelen voor volledige of vrijwel volledige residentie op de GPU
32GB Q6/Q8 of Q4 met grote context Meer vrijheid voor cache- en workloads met lange context
48GB Q8 met ruime marge Implementatie op een high-end werkstation

Dit maakt oudere kaarten met 24 GB bijzonder interessant. Een RTX 3090 heeft voldoende VRAM-capaciteit voor een Q4-achtige Qwen3.8-27B-build, ook al is deze kaart inmiddels enkele GPU-generaties oud. Hetzelfde geldt voor een RTX 4090, terwijl de 32 GB van de RTX 5090 aanzienlijk meer ruimte biedt voor hogere precisie of een grotere context.

De daadwerkelijke prestaties hangen van veel meer af dan alleen de VRAM-capaciteit. Geheugenbandbreedte, kernels, kwantisatieformaat, runtime, speculatief decoderen, het KV-cacheformaat, de promptlengte en vermogenslimieten kunnen allemaal het aantal tokens per seconde veranderen.

Het lokale wonder uit de vorige generatie is verder geëvolueerd: Qwen3.8-27B is open source. Het vorige Qwen3.6-27B-model was al razend populair in de lokale community; nu heeft het Qwen-team rechtstreeks de open-sourcegewichten van Qwen3.8-27B vrijgegeven. Dit oorspronkelijke dichte multimodale model behoudt nog steeds

Kan een RTX 3090 of RTX 4090 Qwen3.8-27B draaien?

Ja. Een RTX 3090 of RTX 4090 met 24 GB is waarschijnlijk een van de meest voor de hand liggende configuraties met één GPU voor Qwen3.8-27B Q4.

Dit is niet langer slechts een capaciteitsinschatting. Vroege tests door de community hebben verschillende concrete voorbeelden opgeleverd. Eén gebruiker van een RTX 3090 meldde Q4_K_M met MTP en een contextvenster van 64K te gebruiken voor een agentische programmeerworkflow. Een andere gebruiker draaide Qwen3.8-27B op één RTX 4090 met volledige offload van lagen naar de GPU en een configuratie van 160K tokens, waarbij in die specifieke opstelling ongeveer 47–57 tokens per seconde werden gemeld.

Een communitytest op één RTX 4090 is bijzonder nuttig, omdat die de relatie tussen modelgewichten en context illustreert: het inpassen van een model van ongeveer 17 GB in 24 GB VRAM betekent niet dat de resterende 7 GB kan worden genegeerd. Runtime- en contextkeuzes bepalen of die marge toereikend is.

Een ander Q4-codeervoorbeeld op een RTX 3090 gebruikte een context van 64K en 64 GB systeem-RAM. Dit zijn individuele configuraties uit de community, geen gestandaardiseerde Qwen-benchmarks, maar ze laten zien dat kaarten van 24 GB daadwerkelijk nuttig zijn en niet slechts theoretische opties.

Voor een normale gebruiker die vandaag begint, is Q4 op een kaart van 24 GB een beter te verdedigen configuratie dan proberen de quantisatieprecisie te maximaliseren. Meerdere gigabytes VRAM vrijhouden voor context, runtime-toewijzingen, beeldverwerking en desktopgebruik is vaak belangrijker dan een iets grotere quantisatie op de GPU te proppen.

Kan een RTX 5090 Qwen3.8-27B lokaal uitvoeren?

Ja, en de 32 GB VRAM biedt aanzienlijk meer mogelijkheden dan een kaart van 24 GB. De eenvoudige aanpak is om Q4, Q5 of Q6 te gebruiken en meer geheugen over te houden voor context en cache. Experimentele inferentiestacks gaan inmiddels nog veel verder.

Bijvoorbeeld: een recente implementatie uit de community gebruikte een NVFP4-build van Qwen3.8-27B op één RTX 5090, samen met een gecomprimeerde KV-cache en speculatieve decodering met DFlash2. De auteur meldde een volledige context van 262K en een zeer hoge totale doorvoer bij gelijktijdige verwerking. Een andere test meldde ongeveer 24,5 GB VRAM-gebruik rond de volledige contextlengte van het model na toepassing van een gespecialiseerde inferentiestack.

Die resultaten zijn nuttige demonstraties van waartoe geoptimaliseerde inferentie kan leiden, maar ze moeten niet worden beschouwd als normale Ollama-prestaties. Ze zijn afhankelijk van specifieke quantisatie-indelingen, aangepaste of snel veranderende runtimepaden, gecomprimeerde cache-indelingen en speculatieve decodering.

De praktische conclusie is eenvoudiger: met 32 GB VRAM heeft Qwen3.8-27B genoeg ruimte, waardoor lange context een afstemmingsprobleem wordt in plaats van een fundamenteel probleem om het model passend te krijgen.

Welke Qwen3.8-27B-quantisatie moet je gebruiken?

Voor de meeste lokale gebruikers blijft Q4 de beste keuze om mee te beginnen. Lager gaan bespaart snel geheugen, maar quantisatie schaadt niet elke mogelijkheid in dezelfde mate. Agentisch programmeren, langdurig redeneren in meerdere stappen, toolgebruik en multimodaal werk zijn precies de soorten taken waarbij het behoud van modelkwaliteit enkele extra gigabytes waard kan zijn.

Als je hardware beschikt over... Begin met Waarom
Alleen 16 GB systeem-RAM Q2 Capaciteit eerst; houd rekening met een merkbaar kwaliteitsverlies
24–32 GB RAM IQ4 / Q4_K_M Goede balans tussen omvang en modelmogelijkheden
32–64 GB RAM Q4_K_M of Q4_K_XL Beste standaardkeuze voor de meeste gebruikers
24 GB VRAM Q4_K_M Laat meer ruimte over voor runtime en context dan Q6
32 GB VRAM Q5 / Q6 of Q4 + lange context Kies op basis van de werklast tussen kwaliteit en geheugencapaciteit
48 GB+ VRAM Q8 Lokale inferentie van hoge kwaliteit zonder agressieve compressie
64 GB+ unified memory Q6 / Q8 Capaciteit ondersteunt een hogere precisie; bandbreedte bepaalt de snelheid

De extreem kleine build van één bit is interessant omdat deze een 27B-model comprimeert tot ongeveer 6–7 GB, maar dat maakt dit niet vanzelf de voor de hand liggende keuze voor echt werk. Als je doel alleen is om te demonstreren dat Qwen3.8-27B op zeer weinig geheugen kan draaien, is deze nuttig. Als je doel coderen, agentuitvoering, documentworkflows of betrouwbaar toolgebruik is, is meer precisie behouden meestal de betere afweging.

Een nuttige vuistregel is:

Kies de quant met de hoogste kwaliteit die nog voldoende geheugen overlaat voor de context en workload die je daadwerkelijk van plan bent te gebruiken.

Kies geen quant van 22 GB alleen omdat je kaart 24 GB heeft, om er vervolgens achter te komen dat er vrijwel geen ruimte over is voor de rest van de inferentie.

Qwen3.8 27B lokaal uitvoeren: echte cijfers van mijn Mac Studio | TerminalBytes

Hoeveel geheugen heeft een context van 262K nodig?

Qwen3.8-27B ondersteunt een native contextlengte van 262.144 tokens, maar je hoeft geen context van 262K toe te wijzen alleen omdat het model dit ondersteunt.

Dit model gebruikt een hybride attentionarchitectuur. De officiële configuratie wisselt Gated DeltaNet-lagen af met periodieke Gated Attention-lagen, in plaats van op elke laag conventionele volledige attention te gebruiken. Daardoor wordt een zeer lange context beter hanteerbaar dan bij een eenvoudige transformer met 27B parameters.

Het maakt lange context niet gratis.

Runtime-status, attention- of recurrente status, KV-cache waar van toepassing, speculatieve decodering, multimodale gegevens, batching en buffers die specifiek zijn voor de backend gebruiken allemaal geheugen boven op de modelgewichten. Cache-quantisatie kan deze vereiste verminderen, maar brengt mogelijk eigen kwaliteits- of prestatieafwegingen met zich mee.

Contextdoel Goed voor Hardwarestrategie
8K–16K Chat, normale codeervragen, korte documenten Eenvoudig startpunt
32K Repositories, lange documenten, agentsessies Goede praktische standaard
64K Grotere workflows voor coderen en onderzoek Nog steeds realistisch op een GPU van 24 GB met een geschikte quant/runtime
128K Grote repositories en langdurig draaiende agents Geheugenplanning wordt belangrijker
262K Workloads met maximale native context Gebruik dit alleen wanneer de workload het echt nodig heeft

Een contextvenster van 262K is bijzonder aantrekkelijk voor coderen op repositoryniveau, privéanalyse van documenten, grote onderzoekscollecties en lange agentgeschiedenissen. Maar maximale context reserveren voor een gesprek van vijf berichten verspilt geheugen dat anders kan worden gebruikt voor een betere quant, andere lokale services of extra gelijktijdige aanvragen.

Qwen3.8-27B lokaal uitvoeren met Ollama

Voor de meeste gebruikers is Ollama de eenvoudigste optie, omdat het al een Qwen3.8-27B-build met ondersteuning voor vision, tools en redeneren publiceert.

Het huidige standaardmodel is ongeveer 18 GB groot en gebruikt Q4_K_M-kwantisatie.

ollama run qwen3.8:27b

Met die opdracht wordt het model gedownload als het nog niet aanwezig is en wordt een interactieve sessie geopend.

Je kunt bevestigen dat het model is geïnstalleerd met:

ollama list

Voor applicaties die een lokale API nodig hebben, stelt Ollama zijn lokale service beschikbaar via het gebruikelijke API-eindpunt. Een eenvoudig verzoek ziet er als volgt uit:

curl http://localhost:11434/api/chat \
  -d '{
    "model": "qwen3.8:27b",
    "messages": [
      {
        "role": "user",
        "content": "Leg ZFS-snapshots uit in eenvoudig Nederlands."
      }
    ]
  }'

Denken is standaard ingeschakeld in Qwen3.8. Voor korte extractie-, classificatie-, opmaak- of eenvoudige assistenttaken kan het uitschakelen of verminderen van reasoning de ervaren latentie verbeteren. Voor moeilijke codeer- en agenttaken kunnen de extra redeneerstappen de extra tokens waard zijn.

Qwen waarschuwt zelf dat het verlagen van de reasoning-effort niet noodzakelijkerwijs de totale voltooiingstijd verkort voor lange agenttaken: zwakkere analyse kan extra pogingen en toolaanroepen veroorzaken. De officiële modelkaart ondersteunt momenteel xhigh, gemiddeld, en laag niveaus voor reasoning-effort, hoewel de exacte instellingen per inferentieframework verschillen.

Qwen3.8-27B uitvoeren met llama.cpp

llama.cpp geeft je meer controle over de GGUF-keuze, GPU-offloading, context en lokale serving.

De huidige Unsloth-builds kunnen rechtstreeks vanuit Hugging Face worden gestart met een recente versie van llama.cpp:

llama cli \
  -hf unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_M

Zo stel je het model beschikbaar als lokale OpenAI-compatibele server:

llama serve \
  -hf unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_M

De actuele GGUF-implementatie-instructies documenteren ook Ollama, LM Studio, Jan, Pi, OpenClaw, Hermes Agent en andere compatibele frontends.

Als Qwen3.8-27B mislukt met een foutmelding waarin een onbekende qwen35 architectuur, werk llama.cpp of de op llama.cpp gebaseerde applicatie bij voordat je tijd besteedt aan het debuggen van het modelbestand. De hybride architectuur van Qwen vereist recente runtime-ondersteuning.

Dit punt is belangrijk, omdat Qwen zelf aanbeveelt om actuele frameworkversies te gebruiken. De officiële modelkaart vermeldt dat de inferentie-efficiëntie aanzienlijk verschilt tussen frameworks en raadt speciale serving-engines zoals vLLM, SGLang of TokenSpeed aan voor productie en workloads met hoge doorvoer.

Moet je Ollama, llama.cpp, vLLM of SGLang gebruiken?

Runtime Ideaal voor Waarom hiervoor kiezen
Ollama Snelste configuratie Eenvoudig modellen ophalen, lokale API, workflow voor vision en tools
llama.cpp GGUF-beheer en hardware voor consumenten Fijnmazige kwantisatie, GPU-offloading, platformonafhankelijke lokale inferentie
LM Studio Gebruikers van desktop-GUI's Handig lokaal modelbeheer boven op compatibele runtimes
vLLM GPU-serving en doorvoer Sterke productie-API en batchingpad
SGLang Geoptimaliseerde serving en geavanceerde inferentie Handig voor experimenten met hoge prestaties en speculatieve decodering

Voor één persoon die het model op een gamingworkstation draait, zijn Ollama of llama.cpp meestal de juiste startpunten. Een lokale AI-server voor meerdere gebruikers, een programmeerteam of een applicatiebackend kan meer baat hebben bij vLLM of SGLang.

Kan Qwen3.8-27B draaien op Apple Silicon?

Ja. Apple Silicon past hier interessant bij, omdat CPU en GPU één gedeelde geheugenpool gebruiken. Een Mac met 32 GB of meer kan een Qwen3.8-27B van Q4-klasse bevatten zonder de modelcapaciteit over afzonderlijke pools van systeem-RAM en VRAM te verdelen.

Capaciteit is echter niet hetzelfde als NVIDIA-achtige inferentiesnelheid. De prestaties hangen sterk af van de Metal-backend, geheugenbandbreedte, GPU-configuratie en de mate waarin de runtime-kernels voor de hybride architectuur van Qwen3.8 zijn uitontwikkeld.

Een Mac met 32 GB gedeeld geheugen moet vooral worden gezien als een doel voor Q4-capaciteit. Een systeem met 64 GB of meer biedt aanzienlijk meer flexibiliteit voor Q6/Q8, langere contexten en het openlaten van andere applicaties. Mac Studio-configuraties met veel geheugen kunnen de oorspronkelijke modelrepresentaties of representaties met hogere precisie uitvoeren die niet op normale consumenten-GPU's passen, hoewel een grotere capaciteit niet automatisch een hogere snelheid voor het genereren van tokens oplevert.

Kan Qwen3.8-27B draaien op AMD Strix Halo?

Ja. Strix Halo-systemen met veel geheugen zijn bijzonder relevant, omdat Ryzen AI Max-platforms een groot deel van het gedeelde systeemgeheugen aan de geïntegreerde GPU kunnen toewijzen.

Daarmee verschilt een Strix Halo-machine met 64 GB of 128 GB fundamenteel van een traditionele laptop-iGPU die toegang heeft tot het systeem-RAM, maar een beperkte geheugenbandbreedte en beperkte GPU-middelen heeft. Qwen3.8-27B Q4 past qua capaciteit gemakkelijk, en systemen met meer geheugen kunnen minder agressieve kwantisatie gebruiken terwijl er ruimte blijft voor een grote context.

De afweging draait opnieuw om bandbreedte en de volwassenheid van de backend. Een discrete RTX 4090 of RTX 5090 kan een veel hogere GPU-geheugenbandbreedte bieden, terwijl een machine met gedeeld geheugen een grotere gedeelde capaciteit biedt zonder PCIe-overdrachten tussen CPU-geheugen en VRAM.

Dit levert twee geldige strategieën voor lokale AI op:

Strategie met discrete GPU: maximaliseer de inferentiesnelheid binnen een relatief kleine VRAM-pool van 24–32 GB met hoge bandbreedte.

Strategie met gedeeld geheugen: ruil wat ruwe GPU-snelheid in voor een veel grotere geheugenpool waarin modellen met hogere precisie en grotere workloads passen.

Welke hardware moet je kopen voor Qwen3.8-27B?

Als Qwen3.8-27B het doelmodel is en niet zomaar een van vele modellen, is het niet nodig om meteen over te stappen op hardware uit de serverklasse. Vierbitskwantisatie plaatst het model duidelijk binnen het bereik van geavanceerde consumentenhardware.

Doel Aanbevolen hardwareklasse Aanbevolen quantisatie
Goedkoopste experiment 16 GB RAM Q2
CPU-assistent op de achtergrond 32–64 GB RAM Q4
Algemeen lokaal AI-werkstation 64 GB RAM + 16 GB GPU IQ4 / Q4 met offload
Beste doel voor één GPU 64 GB RAM + RTX 3090/4090 24 GB Q4
High-end consumenten-GPU 64 GB+ RAM + RTX 5090 32 GB Q4/Q5/Q6
Werkstation met geïntegreerd geheugen 64–128 GB geïntegreerd geheugen Q6/Q8
Lokale AI-server 128 GB+ RAM + 48 GB+ GPU of meerdere GPU's Q8 / productie-quantisatie

Als je al een RTX 3090 bezit, is het moeilijk te rechtvaardigen om die uitsluitend te vervangen omdat Qwen3.8-27B bestaat. Het framebuffergeheugen van 24 GB valt precies in het capaciteitsbereik waarin Q4 praktisch wordt. Een nieuwere GPU kan een betere efficiëntie en snelheid bieden, maar de geheugencapaciteit van de oudere kaart blijft zeer waardevol voor lokaal werken met LLM's.

Als je een systeem vanaf nul aanschaft, kijk dan verder dan alleen het model. Een lokale AI-machine heeft ook ruimte nodig voor modelvarianten, embeddings, RAG-indexen, broncodeopslagplaatsen, documenten, afbeeldingen en werkruimten voor agents. Meerdere modelbestanden van 15–30 GB kunnen al snel honderden gigabytes worden.

Daar komt het bredere local-first-ontwerp om de hoek kijken. De GPU of machine met veel bandbreedte en geïntegreerd geheugen kan de inferentie uitvoeren, terwijl snelle lokale opslag modelbestanden en privéwerkgegevens bevat. Een zelfgehoste opslaglaag kan documentbibliotheken, datasets, back-ups en bestanden die toegankelijk zijn voor agents afzonderlijk opslaan, zonder elke byte op de interne SSD van het AI-werkstation te zetten.

Is Qwen3.8-27B goed genoeg om als lokale codeer- of AI-agent te draaien?

Dit is de interessantere vraag dan of het model alleen maar kan worden geladen.

Qwen positioneert Qwen3.8-27B specifiek voor programmeren, professioneel werk, onderzoek en agenttaken met een lange tijdshorizon. In Qwens eigen evaluatie behaalt het model 61,7 op SWE-bench Pro en 73,0 op Terminal Bench 2.1, met aanzienlijke verbeteringen ten opzichte van Qwen3.6-27B. Dit zijn door de leverancier gerapporteerde benchmarkresultaten en ze mogen niet worden opgevat als een directe garantie voor elke lokale programmeerworkflow, maar ze verklaren waarom de belangstelling vanuit de community vooral op agents is gericht en niet op gewone chat.

Het model ondersteunt ook native beeld- en videobegrip. Dat is belangrijk voor lokale agents, omdat schermafbeeldingen, diagrammen, gescande documenten, webinterfaces en visuele debugging onderdeel kunnen blijven van dezelfde modelworkflow, in plaats van te worden doorgestuurd naar een afzonderlijke cloud-vision-API.

Recente experimenten uit de community gebruiken Qwen3.8-27B al met codeerharnassen en lange reeksen toolaanroepen op afzonderlijke GPU's van 24 GB. Die combinatie—bruikbare agentmogelijkheden plus een vierbitsmodel van ongeveer 17 GB—is belangrijker voor lokale AI dan een kleine verbetering op een algemene chatbenchmark.

Het brengt een categorie workflows die gebruikers eerder richting gehoste frontiermodellen duwde naar hardware die onder een bureau kan staan en met privébestanden kan werken zonder kosten per token.

Moet je Qwen3.8-27B lokaal uitvoeren?

Qwen3.8-27B is bijzonder geschikt voor lokaal gebruik als je al 24 GB GPU-geheugen of minstens 32–64 GB snel systeem- of unified memory hebt. Het Q4-model is klein genoeg om echt praktisch te zijn en behoudt tegelijkertijd een capaciteitsprofiel dat gericht is op programmeren, vision, tools en langdurig draaiende agents.

Het model is minder aantrekkelijk op een machine waarop alleen een quant van 1 of 2 bit past. Op dat punt kan het gebruik van een kleiner model met een gezondere kwantisatie een betere algehele ervaring opleveren. Evenzo is er weinig reden om 262K context te reserveren voor workloads die doorgaans maar een paar duizend tokens gebruiken.

De beste configuratie is daarom niet het kleinste bestand dat succesvol start. Voor de meeste gebruikers is dat Q4, met voldoende RAM of VRAM om constant offloaden te voorkomen, een contextlimiet die bij de taak past en een actuele inferenceruntime.

Dat is wat Qwen3.8-27B onderscheidt van veel grotere recente open modellen. Het is niet alleen technisch mogelijk om het lokaal uit te voeren. Het valt binnen een hardwareklasse waarin een normale high-end workstation een bruikbare versie kan uitvoeren, zonder dat de implementatie zelf het project wordt.

FAQ: Qwen3.8-27B lokaal uitvoeren

Hoeveel RAM heb ik nodig voor Qwen3.8-27B?

Voor de meeste gebruikers is 32 GB RAM het praktische minimum voor een Qwen3.8-27B-implementatie uit de Q4-klasse. Huidige Q4-GGUF-bestanden zijn ongeveer 16–18 GB groot. Een systeem met 64 GB biedt aanzienlijk meer ruimte voor context, quants van hogere kwaliteit, andere applicaties en lokale AI-diensten.

Kan Qwen3.8-27B draaien op 16 GB RAM?

Ja, maar alleen met agressieve kwantisatie, zoals Q2 of lager. Huidige Q2-builds zijn kleiner dan 10 GB, terwijl varianten met één bit ongeveer 6–7 GB groot zijn. Dat het model past, garandeert geen gelijkwaardige kwaliteit, vooral niet voor programmeren, agentische taken en lange redeneertaken.

Is 24 GB VRAM genoeg voor Qwen3.8-27B?

Ja. Een GPU met 24 GB is een van de beste praktische opties voor Qwen3.8-27B. Huidige Q4-builds zijn ongeveer 16–18 GB groot, waardoor er nog enkele gigabytes overblijven voor context en runtimegegevens. Gebruikers van de RTX 3090 en RTX 4090 hebben al volledige Q4-implementaties op de GPU gemeld, hoewel de bruikbare context afhankelijk is van de exacte runtime- en cacheconfiguratie.

Kan een RTX 4090 Qwen3.8-27B uitvoeren?

Ja. De 24 GB VRAM van de RTX 4090 kan een model uit de Q4-klasse bevatten en vormt een krachtige configuratie met één GPU. Gebruikers uit de community hebben volledige GPU-offloading en gebruik met een lange context op één kaart gemeld. De exacte tokensnelheid varieert aanzienlijk afhankelijk van de runtime, kwantisatie, context en speculatieve decodering.

Kan een RTX 3090 Qwen3.8-27B draaien?

Ja. De 24 GB VRAM is voldoende voor Q4, hoewel de RTX 3090 een oudere GPU is. Recente communityvoorbeelden laten zien dat Q4_K_M op één RTX 3090 kan draaien voor programmeer- en agenttaken. De kaart blijft uitzonderlijk nuttig voor lokale AI dankzij de grote geheugencapaciteit.

Kan Qwen3.8-27B draaien op een RTX 5090?

Ja. De 32 GB VRAM van de RTX 5090 biedt voldoende capaciteit voor Q4, Q5, Q6 of agressievere configuraties met lange context. Experimentele implementaties met NVFP4 en speculatieve decoding laten al een aanzienlijk hogere doorvoersnelheid zien, maar die resultaten mogen niet worden verward met de standaardprestaties van Ollama.

Wat is de beste quantisatie voor Qwen3.8-27B?

Q4_K_M is voor de meeste lokale gebruikers de veiligste standaardkeuze, omdat het model daarmee ongeveer 16–18 GB groot blijft en aanzienlijk meer kwaliteit behoudt dan extreme builds met weinig bits. Gebruikers met meer geheugen kunnen overstappen op Q5, Q6 of Q8, terwijl systemen met beperkte capaciteit mogelijk Q3 of Q2 nodig hebben.

Hoe groot is Qwen3.8-27B?

De officiële repository op Hugging Face is momenteel ongeveer 55,6 GB groot. Community-GGUF-versies variëren van ongeveer 6 GB bij extreme éénbitkwantisatie tot 29 GB voor Q8_0. Ollama's huidige standaardpakket Q4_K_M is ongeveer 18 GB groot en bevat een vision-projector.

Ondersteunt Qwen3.8-27B lokaal vision?

Ja. Qwen3.8-27B is van nature een vision-language-model en geen tekstgebaseerde LLM. Het huidige Ollama-pakket bevat een vision-projector van ongeveer 461 miljoen parameters. Beeldbegrip is daarom beschikbaar in ondersteunde lokale workflows, terwijl de exacte ondersteuning voor video nog afhankelijk is van de runtime en frontend.

Ondersteunt Qwen3.8-27B lokaal echt een context van 262K?

Het model ondersteunt van nature 262.144 tokens, maar lokale hardware moet voldoende geheugen hebben voor de bijbehorende runtime-status en de inference-backend moet de configuratie efficiënt ondersteunen. Je hoeft niet het volledige contextvenster te gebruiken; 32K of 64K is vaak een praktischere instelling voor lokaal programmeren en agenttaken.

Moet ik Ollama of llama.cpp gebruiken voor Qwen3.8-27B?

Gebruik Ollama als je de eenvoudigste installatie en lokale API wilt. Gebruik llama.cpp als je directe controle wilt over de selectie van GGUF-bestanden, GPU-offloading, de context en gedetailleerde runtime-instellingen. Voor productiegebruik op GPU's of gelijktijdige verwerking worden vLLM en SGLang ook officieel ondersteund.

Is Qwen3.8-27B gemakkelijker lokaal te draaien dan Qwen3.8-Flash-Next?

Ja, met ruime voorsprong. Qwen3.8-27B is een dicht model van 27B parameters, waarvan Q4-builds ongeveer 16–18 GB groot zijn. Qwen3.8-Flash-Next bevat een veel grotere modelstatus, en huidige builds in de vierbitklasse naderen ongeveer 100 GB of overschrijden die grootte. Flash-Next is een experiment voor werkstations met veel geheugen; Qwen3.8-27B is een echte optie voor consumentenwerkstations.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.