Waarom Zero to MVP 2–4 GB AI-modellen 24/7 op ZimaCube 2 uitvoert

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Dank aan Zero to MVP voor het demonstreren van een praktische manier om naar kleine taalmodellen te kijken. In zijn volledige video betoogt hij dat modellen van 2–4 GB veel nuttiger worden wanneer ze worden ingezet als gespecialiseerde, altijd beschikbare tools in plaats van als zwakkere vervangers voor de grootste AI-modellen.

Zijn opstelling gebruikt een ZimaCube 2 als stille thuisserver die lokale modellen de klok rond beschikbaar kan houden en tegelijkertijd de documenten kan opslaan waarmee die modellen werken. De demonstraties omvatten OCR, het automatisch samenvatten van artikelen, het privé verwerken van gezondheidsgerelateerde informatie en vertalen op basis van bestanden—taken waarbij voorspelbare invoer, herhaalde verzoeken, privacy en lage overhead belangrijker kunnen zijn dan maximale modelcapaciteit.

Openbaarmaking over de samenwerking: Dit artikel is gebaseerd op de workflows en modelvoorbeelden die door Zero to MVP zijn gedemonstreerd. Modelversies, bestandsgroottes, geheugengebruik tijdens runtime, hardwarevereisten, softwarecompatibiliteit en inferentieprestaties kunnen in de loop der tijd veranderen. De gezondheidsgerelateerde AI-tools die hier worden besproken, mogen niet worden beschouwd als vervanging voor professioneel medisch advies, een diagnose of behandeling.

Het resultaat: kleine modellen worden interessant wanneer ze beperkte taken krijgen toegewezen die herhaaldelijk moeten worden uitgevoerd. In plaats van één enorm model alles te laten doen, kan een thuisserver meerdere compacte modellen beschikbaar houden voor OCR, samenvattingen, vertalingen of andere gespecialiseerde achtergrondtaken.

Waarom kleine AI-modellen 24/7 draaien?

Discussies over lokale AI richten zich vaak op het grootste model dat een machine kan laden. Zero to MVP kiest voor een andere aanpak. Voor een workflow die altijd actief is, is de nuttigere vraag of een model één duidelijk omschreven taak betrouwbaar genoeg kan uitvoeren om op de achtergrond beschikbaar te blijven.

Een model van 2–4 GB hoeft niet bij elk type redeneertaak te concurreren met een model op frontierniveau. Het kan in plaats daarvan een gespecialiseerde component binnen een grotere workflow worden: tekst uit een document herkennen, een artikel samenvatten, een bestand vertalen of informatie lokaal verwerken voordat een andere toepassing het resultaat gebruikt.

Hierdoor verandert de rol van het model van een incidentele chatbot in een dienst.

Hoe ziet een lokaal model van 2–4 GB er in de praktijk uit?

De modellen die in de Ollama-omgeving van Zero to MVP zijn geïnstalleerd, laten zien hoe compact deze aanpak kan zijn. De terminal vermeldt vier modellen van ongeveer 2,1 GB tot 3,4 GB, elk geschikt voor een ander type taak.

Terminaloverzicht van Ollama met de modellen MedGemma 1.5, Granite 4.1 3B, GLM-OCR en Qwen 3.5 4B tussen 2,1 GB en 3,4 GB

De Ollama-bibliotheek van Zero to MVP bevat MedGemma 1.5, Granite 4.1 3B, GLM-OCR en Qwen 3.5 4B, waarbij de weergegeven modelbestanden variëren van 2,1 GB tot 3,4 GB.

Getoond model Weergegeven grootte Rol in de workflow
MedGemma 1.5 3,3 GB Lokale verwerking van gezondheidsgerelateerde informatie.
Granite 4.1 3B 2,1 GB Een compact algemeen model dat beschikbaar is in de lokale modellencollectie.
GLM-OCR 2,2 GB Zet gescande documenten om in machineleesbare tekst en Markdown.
Qwen 3.5 4B 3,4 GB Gebruikt voor taken zoals het samenvatten van artikelen en vertalen.

Het belangrijkste punt is niet dat elk model tijdens het uitvoeren precies evenveel geheugen gebruikt. Deze getallen beschrijven de modelbestanden die door Ollama worden weergegeven. Het runtimegeheugen, de context, caching, het besturingssysteem en andere actieve services voegen hun eigen resourcevereisten toe.

Kleine modellen zijn een ander hulpmiddel, niet alleen kleinere grote modellen

Lokale AI wordt vaak geassocieerd met desktopworkstations en grote afzonderlijke GPU's. Die hardware is logisch wanneer de werklast grotere modellen, hoge verwerkingssnelheid of veeleisende generatietaken vereist.

Desktopworkstation met een geïnstalleerde AMD Radeon Pro W7800-grafische kaart

Een desktopworkstation met een AMD Radeon PRO W7800 vertegenwoordigt de bekendere krachtige aanpak van lokale AI-hardware.

Maar een achtergrondservice die eenvoudige, repetitieve verzoeken ontvangt, heeft andere vereisten. Een klein gespecialiseerd model klaar laten staan op bescheiden hardware kan zinvoller zijn dan voor elke OCR-taak, vertaalopdracht of korte samenvatting een krachtig workstation te reserveren.

Twee compacte computerapparaten met koellichamen op een bureau naast een toetsenbord

Compacte computerhardware illustreert de andere kant van het lokale AI-spectrum: gespecialiseerde kleine modellen kunnen nuttige AI-diensten mogelijk maken zonder voor elke taak een volledig workstation uit de desktopklasse te reserveren.

Groot model voor algemeen gebruik Klein gespecialiseerd model
Ontworpen om een breed scala aan open prompts te verwerken. Kan een beperktere en voorspelbaardere taak toegewezen krijgen.
Profiteert vaak van meer geheugen en acceleratorresources. Kan draaien met een kleinere hardware- en geheugenvoetafdruk.
Handig wanneer complexe redeneerprestaties of brede inzetbaarheid belangrijk zijn. Handig wanneer dezelfde eenvoudige bewerking herhaaldelijk moet worden uitgevoerd.
Kan overdreven zijn voor eenvoudige achtergrondverwerking. Kan als permanente service beschikbaar blijven met minder overhead.

Een klein model betekent niet nul resourcekosten

De kleine bestandsgrootte moet niet worden verward met nul runtime-overhead. De systeemmonitor van Zero to MVP biedt een nuttige realitycheck terwijl Ollama actief is.

htop-terminal waarin het CPU- en geheugengebruik van Ollama llama-server wordt weergegeven terwijl een lokaal AI-model actief is

De live systeemmonitor toont dat Ollama's llama-server tijdens de uitvoering CPU en enkele gigabytes geheugen gebruikt. Dit laat zien dat een klein modelbestand nog steeds extra runtime-resources vereist.

In de vastgelegde werklast rapporteert het systeem ongeveer 7,8 GB totaal geheugen, waarvan enkele gigabytes in gebruik zijn, terwijl een Ollama llama-server het proces een aanzienlijk deel van het resident geheugen en de CPU-tijd in beslag neemt.

Dit onderscheid is belangrijk bij het plannen van een server die altijd actief is. Een modelbestand van 3,4 GB betekent niet dat 3,4 GB systeem-RAM voldoende is voor de hele machine. Het besturingssysteem, de inferentieruntime, context, caches, opslagdiensten en andere zelfgehoste toepassingen hebben ook ruimte nodig.

Het voordeel van het kleinere model is dus beheersbare resourcebehoefte, niet inferentie zonder resources.

Vier taken waarvoor altijd actieve kleine modellen zinvol zijn

Zero to MVP demonstreert vier workflows met een belangrijk gemeenschappelijk kenmerk: ze hebben duidelijkere grenzen dan een algemene assistent zonder vaste taak. Daardoor zijn ze goede kandidaten voor gespecialiseerde modellen die actief kunnen blijven op een thuisserver.

1. Gescande pdf's met GLM-OCR omzetten naar Markdown

De eerste workflow gebruikt GLM-OCR om gescande pdf's om te zetten naar Markdown. OCR is een nuttig voorbeeld omdat het doel duidelijk is: visuele documentinhoud omzetten in machineleesbare tekst die kan worden opgeslagen, doorzocht, geïndexeerd, samengevat of door een andere toepassing verwerkt.

Zodra OCR een serverdienst wordt, hoeft een workflow niet te beginnen met een handmatig chatbotgesprek. Een document kan een map binnenkomen, automatisch worden verwerkt en de OCR-fase verlaten als gestructureerde tekst.

Dit is vooral nuttig wanneer de thuisserver de bron-pdf's al opslaat. Opslag en documentverwerking kunnen in dezelfde lokale omgeving plaatsvinden, in plaats van bestanden steeds opnieuw naar een externe dienst te uploaden.

2. Artikelen automatisch samenvatten met Qwen 3.5 4B

Het tweede voorbeeld gebruikt Qwen 3.5 4B om artikelen samen te vatten. Samenvatten laat zien waarom herhaling voor sommige werklasten belangrijker is dan maximale intelligentie.

Als het doel is om binnenkomende artikelen consequent om te zetten in kortere notities, kan een compact model een schakel worden in een geautomatiseerde pijplijn:

  • Ontvang of sla een artikel op.
  • Extraheer de tekst.
  • Stuur de tekst naar het lokale model.
  • Genereer een kortere samenvatting.
  • Sla het resultaat op om het later te lezen, te indexeren of te doorzoeken.

Voor dit type workflow is beschikbaarheid belangrijk. Een klein model dat al lokaal draait, kan terugkerende taken verwerken zonder dat iemand voor elk document handmatig een AI-interface hoeft te openen.

3. Houd gezondheidsgerelateerde informatie lokaal met MedGemma

Zero to MVP demonstreert MedGemma ook als een private lokale assistent voor gezondheidsgerelateerde informatie. Het belangrijkste voordeel is hier niet simpelweg de modelgrootte, maar waar de gegevens worden verwerkt.

Inferentie uitvoeren op hardware die de gebruiker beheert, kan de noodzaak verminderen om persoonlijke documenten voor routinematige organisatie-, extractie- of samenvattingstaken naar een externe chatbot te sturen.

Dat maakt een lokaal model nog geen arts. Modeluitvoer kan onvolledig, onnauwkeurig of misleidend zijn, en gezondheidsgerelateerde beslissingen moeten nog steeds door gekwalificeerde medische professionals worden genomen. De nuttige rol van het lokale model is die van een hulpmiddel voor informatieverwerking, vooral wanneer privacy een belangrijk onderdeel van de workflow is.

4. Automatisch vertalen met Qwen 3.5 4B

De vertaaldemonstratie is misschien wel het duidelijkste voorbeeld van een klein model dat als achtergrondservice werkt. In plaats van vertalen als een chatsessie te behandelen, kan de workflow rond bestanden en mappen worden georganiseerd.

Het voorbeeld van Zero to MVP toont een vertaalmap op de lokale server met afzonderlijke invoer- en uitvoermappen. Een Japans tekstbestand kan vervolgens als resultaat van die verwerkingspipeline worden bekeken.

Japans tekstbestand dat wordt weergegeven vanuit een vertaalmap op de lokale thuisserver zimacube2-local

Een vertaald Japans tekstbestand wordt geopend vanuit de zimacube2-local server, met afzonderlijke invoer- en uitvoermappen die erachter zichtbaar zijn als onderdeel van de bestandsgebaseerde vertaalworkflow.

Vertalen leent zich goed voor specialisatie, omdat zowel de invoer als de verwachte uitvoer beperkt zijn. Als het doel is om documenten herhaaldelijk naar een bekende doeltaal te vertalen, heeft het systeem mogelijk niet voor elk verzoek het breedst mogelijke redeneermodel nodig.

Waarom ZimaCube 2 geschikt is voor dit soort achtergrond-AI

Het model is slechts één laag van een workflow die altijd actief is. De server moet ook bronbestanden opslaan, applicaties actief houden, die services beschikbaar maken voor andere apparaten en gedurende lange perioden praktisch te beheren blijven.

Zero to MVP beschrijft zijn ZimaCube 2 als een systeem dat altijd aanstaat, weinig energie verbruikt, voldoende schijfcapaciteit biedt voor de gegevens die zijn modellen verwerken en stil genoeg werkt voor continu gebruik.

Deze combinatie is bijzonder relevant voor workflows met kleine modellen, omdat de AI-service naast de benodigde bestanden kan draaien. Pdf's die wachten op OCR, artikelen die op samenvattingen wachten, privédocumenten en vertaalopdrachten kunnen in dezelfde thuisserveromgeving blijven als de modellen.

De ZimaCube 2 biedt ook een uitbreidingspad voor gebruikers van wie de AI-workloads later toenemen. Zo kun je beginnen met lichtere lokale inferentie en acceleraterhardware toevoegen wanneer een groter model of hogere doorvoer de extra energie en kosten waard wordt.

Voor een uitgebreidere blik op deze uitbreidingsaanpak kun je de ZimaSpace-gids over lokale AI op de ZimaCube 2 bekijken. Daarin worden Ollama, PCIe-uitbreiding en de upgrade van CPU-gebaseerde workloads naar GPU-ondersteunde inferentie besproken.

Kleine modellen werken het best als achtergrondprocessen

De vier demonstraties wijzen op een breder ontwerppatroon. Een klein model wordt vooral waardevol wanneer gebruikers het niet langer vragen zich als een universele assistent te gedragen, maar het in plaats daarvan in een beperkt proces plaatsen.

Dat proces kan er als volgt uitzien:

  • Bewaken: houd een map of applicatie in de gaten voor nieuwe invoer.
  • Verwerken: stuur de invoer naar een model dat voor die taak is gekozen.
  • Valideren: controleer of het resultaat de verwachte structuur of kwaliteit heeft.
  • Opslaan: sla de uitvoer weer op de lokale server op.
  • Herhalen: houd de service beschikbaar voor het volgende verzoek.

Daarom betekent de term “24/7 AI” niet noodzakelijkerwijs dat er continu tokens worden gegenereerd. Het kan betekenen dat er verschillende lichtgewicht services klaarstaan zodra er een nieuw document, artikel of vertaalopdracht verschijnt.

Wanneer moet je een klein taalmodel kiezen?

Aan het einde van de video vat Zero to MVP zes omstandigheden samen waarin kleine modellen bijzonder voordelig zijn. Samen vormen ze een nuttig besliskader om te kiezen tussen een compact lokaal model en een groter alternatief.

Dia met zes voordelen van kleine AI-modellen, waaronder privacy, offlinegebruik, hardware met weinig vermogen, eenvoudige verzoeken, lagere kosten en specialisatie

Zero to MVP vat zes situaties samen waarin kleine modellen bijzonder nuttig zijn: lokale en private verwerking, offline werken, hardware met weinig vermogen, veel eenvoudige verzoeken, kostenminimalisatie en specialisatie.

Kleine modellen zijn vooral nuttig wanneer... Waarom dit belangrijk is
Lokale en private verwerking is belangrijk Gegevens kunnen binnen een zelfgehoste workflow blijven in plaats van voor elk verzoek naar een model op afstand te worden gestuurd.
Er is geen internetverbinding Een lokaal beschikbaar model kan ondersteunde taken blijven verwerken zonder afhankelijk te zijn van een cloud-inferentie-endpoint.
De hardware heeft beperkte middelen Kleinere modelbestanden en bescheidener runtimevereisten kunnen lokale inferentie praktisch maken op minder krachtige systemen.
Er zijn veel eenvoudige verzoeken Een permanent geladen model kan herhaaldelijk een beperkte bewerking uitvoeren zonder voor elke taak een veel groter model te gebruiken.
De kosten moeten worden geminimaliseerd Lokale hardware gebruiken voor repetitieve werklasten kan de afhankelijkheid van gehoste inferentiediensten per verzoek verminderen, hoewel elektriciteit en hardware nog steeds kosten met zich meebrengen.
De taak kan gespecialiseerd zijn Een model dat voor één welomschreven taak is geselecteerd, hoeft niet elke categorie van redeneren even goed uit te voeren.

Wat dit experiment wel en niet laat zien

De demonstratie laat zien Het garandeert niet
Bruikbare lokale modellen kunnen slechts enkele gigabytes schijfruimte innemen. Een model van 2–4 GB vereist tijdens het uitvoeren slechts 2–4 GB aan totaal systeemgeheugen.
Kleine modellen kunnen OCR, samenvattingen, vertalingen en andere gerichte taken uitvoeren. Een compact model zal bij elke complexe of open prompt even goed presteren als een veel groter model.
Meerdere gespecialiseerde modellen kunnen naast elkaar op één lokale server draaien. Elk model moet tegelijkertijd in het geheugen geladen blijven.
AI-workflows op basis van bestanden kunnen zonder voortdurend handmatig prompten worden uitgevoerd. Elke gegenereerde uitvoer zal nauwkeurig genoeg zijn om zonder controle te gebruiken.
Lokale verwerking kan onnodige blootstelling van externe gegevens beperken. Een lokale implementatie is niet automatisch veilig alleen omdat deze thuis draait.
Kleine modellen kunnen de hardwaredrempel voor bruikbare lokale AI verlagen. Grote GPU's en grotere modellen hebben geen rol meer bij veeleisende werklasten.

Denk in taken, niet in modelranglijsten

De nuttigste les uit het experiment van Zero to MVP is niet dat kleine modellen beter zijn dan grote modellen. Het is dat modelselectie bij de taak moet beginnen.

Als een taak moeilijke redeneringen in onbekende domeinen, complexe code of zeer open interactie vereist, kan een groter model de extra benodigde middelen rechtvaardigen. Maar als de taak OCR, voorspelbare samenvatting, routinematige vertaling, classificatie, extractie of een andere herhaalde bewerking is, kan een kleiner gespecialiseerd model de praktischere keuze zijn.

De kernvraag verandert van “Wat is het slimste model dat ik kan draaien?” in “Wat is het kleinste model dat deze specifieke taak betrouwbaar uitvoert?”

Met deze aanpak kan een altijd beschikbare homeserver veel nuttiger worden. In plaats van te wachten tot een gebruiker een AI-sessie start, kan de server stilletjes bestanden en verzoeken verwerken als onderdeel van de infrastructuur die al actief is.

Bouw een altijd beschikbare werkruimte voor lokale AI

De configuratie van Zero to MVP laat zien hoe opslag en AI elkaar kunnen aanvullen. De NAS bevat de informatie, terwijl kleine lokale modellen gespecialiseerde verwerking dicht bij die gegevens uitvoeren.

Met een systeem zoals ZimaCube 2 kan dezelfde machine dienen als thuisopslagplatform, zelfgehoste applicatieserver en basis voor permanente AI-workflows. Gebruikers kunnen beginnen met kleinere modellen en de hardware later uitbreiden als hun vereisten verschuiven naar grotere modellen of snellere GPU-ondersteunde inferentie.

Als je onderzoekt hoe opslag en lokale intelligentie kunnen samenwerken, laat de ZimaSpace-gids voor AI-NAS-workflows een andere aanpak zien om documentopslag, indexering en lokale AI-verwerking op ZimaCube 2 te combineren.

Je kunt ook de handleiding voor lokale AI met GPU lezen als je workload verder groeit dan compacte modellen en je wilt begrijpen hoe ZimaCube 2 kan worden uitgebreid met GPU-ondersteunde inferentie.

Bekijk de volledige video van Zero to MVP om de OCR-, samenvattings-, MedGemma- en vertaalworkflows in context te zien en te horen op basis van welke criteria hij bepaalt wanneer een klein model de juiste keuze is.

Wil je lokale AI-workflows, modelkeuzes en zelfgehoste serverconfiguraties vergelijken met andere gebruikers? Word lid van de ZimaSpace Discord-community om meer projecten rond homeservers en lokale AI te ontdekken.

Zima Campagnecentrum

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.