Naar de inhoud
← Alle artikelen

Lokale AI

Welke hardware heb je nodig voor lokale AI op kantoor?

Jasper Thijssen14 mei 2026 · 6 min lezen

Het werkgeheugen van de grafische kaart bepaalt welk taalmodel je kunt draaien. Een vuistregel voor de maat, plus wat je naast de machine zelf nog nodig hebt.

Voor lokale AI op kantoor is het werkgeheugen van de grafische kaart de maat die telt: daar moet het taalmodel in passen, en dat bepaalt welk model je kunt draaien en met hoeveel mensen tegelijk. Als vuistregel heeft een model dat in 4 bits is gecomprimeerd ongeveer 0,5 tot 0,6 GB nodig per miljard parameters, plus ruimte voor de context, dus een model van acht miljard parameters past ruwweg in vijf tot zes GB en een model van zeventig miljard heeft al gauw veertig GB of meer nodig.

Daarmee is de kern gezegd. De rest van de keuze gaat over hoe snel het moet, met hoeveel mensen, en wat er naast de machine zelf nog geregeld moet worden.

Hoeveel geheugen heeft een lokaal taalmodel nodig?

Een taalmodel bestaat uit parameters, en die moeten allemaal in het geheugen staan waar de rekenkern bij kan. Hoeveel ruimte dat kost, hangt af van hoe fijn die parameters zijn opgeslagen. Dat heet kwantisatie.

OpslagvormRuwweg per miljard parametersWaar je het voor gebruikt
16 bitsongeveer 2 GBvolledige precisie, vooral voor onderzoek en modeltraining
8 bitsongeveer 1 GBlicht verlies, goede keuze als het geheugen het toelaat
4 bitsongeveer 0,5 tot 0,6 GBde gangbare vorm op kantoorapparatuur

Bij die getallen komt de context nog. Elk gesprek en elk document dat je erin stopt, wordt tijdens het werk apart bijgehouden in geheugen. Werk je met korte vragen, dan valt dat mee. Laat je het model een contract van veertig pagina’s doorlezen, of voer je een lang gesprek, dan loopt dat deel flink op. Een systeem dat op papier precies genoeg geheugen heeft voor het model, blijkt in de praktijk dus te krap.

De vuistregel in één zin: neem de omvang van het modelbestand op de schijf, tel daar ruim een kwart bij op voor context en werkruimte, en zorg dat dat in het geheugen van de kaart past.

Wat bepaalt hoe snel het antwoord komt?

Voor het produceren van tekst is de geheugenbandbreedte de begrenzing, niet de rekenkracht. Het model moet voor elk stukje tekst dat het genereert zijn parameters langslopen, dus hoe sneller het geheugen, hoe sneller de woorden verschijnen. Daar zit het verschil tussen een grafische kaart en een gewone computer: het geheugen op zo’n kaart is een veelvoud sneller dan het werkgeheugen op een moederbord.

Rekenkracht telt vooral bij het inlezen. Voer je een pdf van dertig pagina’s in, dan moet het model die hele tekst eerst verwerken voordat het eerste woord verschijnt. Bij factuurverwerking en documentanalyse is dat het deel dat je merkt.

Grafische kaart, gedeeld geheugen of alleen een processor

Er zijn drie vormen die je in de praktijk tegenkomt.

Een aparte grafische kaart. Snel geheugen, maar de hoeveelheid ligt vast bij aanschaf. Past het model er niet in, dan wordt een deel naar het gewone werkgeheugen geschoven en zakt de snelheid in. Deze vorm trekt onder belasting flink stroom en maakt geluid.

Gedeeld geheugen, zoals in moderne compacte werkstations waar processor en grafische kern hetzelfde geheugen gebruiken. Je kunt daar vaak veel meer geheugen in kwijt, wat ruimte geeft voor grotere modellen, tegen een lagere bandbreedte dan een snelle kaart. Stil, klein en zuinig, en voor veel kantoorwerk ruim voldoende.

Alleen een processor. Werkt, maar traag, omdat de bandbreedte van gewoon werkgeheugen het tempo bepaalt. Voor kleine modellen die classificeren of gegevens uit een bestand halen is dat prima, zeker als het ‘s nachts mag draaien. Voor iemand die op een antwoord zit te wachten niet.

Hoeveel mensen kunnen er tegelijk op?

Niet het aantal medewerkers telt, maar het aantal gelijktijdige verzoeken. Een systeem verwerkt verzoeken gebundeld, waardoor een paar mensen die af en toe iets vragen elkaar niet in de weg zitten. Het wringt op twee punten: als er meer verzoeken tegelijk binnenkomen dan de kaart aankan, ontstaat er een rij, en elk lopend gesprek houdt geheugen bezet voor zijn eigen context.

Daar komt bij dat een werkende opstelling zelden uit één model bestaat. Naast het taalmodel draait meestal een kleiner model dat teksten omzet in zoekvectoren, zodat je documenten doorzoekbaar zijn. Soms draait er een apart klein model voor classificatie. Die hebben allemaal hun eigen plek in het geheugen nodig.

Een praktische manier om dit te begroten: schat niet op medewerkers, maar op werkgangen per uur. Veertig inkoopfacturen die door de nacht heen verwerkt worden, stellen heel andere eisen dan vijftien mensen die tussen negen en tien ‘s ochtends een mail laten opstellen.

Wat heb je naast de machine nog nodig?

De AI-machine is niet de hele opstelling.

  1. Snelle opslag. Modelbestanden zijn enkele gigabytes per stuk, en je wilt er meerdere bewaren: het model dat draait, het vorige om op terug te vallen, en het nieuwe dat je aan het testen bent. Daarbovenop komt de index van je documenten.
  2. Back-up naar een tweede locatie. Apparatuur in het pand beschermt niet tegen brand, waterschade of diefstal. Een back-up die nooit is teruggezet, is een aanname. Wij doen daar een herstelproef bij, zodat het geen aanname blijft.
  3. Noodstroom. Een stroomdip tijdens het schrijven naar de index kan die index beschadigen. Een kleine noodstroomvoorziening die het systeem netjes afsluit, is genoeg.
  4. Een goede plek. Koel, stofvrij, afsluitbaar, met een eigen stroomgroep. Een meterkast is meestal te warm en te stoffig. Naast een bureau is het onder belasting te luidruchtig.
  5. Netwerk. Gewoon bekabeld gigabit volstaat. Het knelpunt zit in het geheugen van de kaart, niet in de kabel.

Hoe bepaal je wat jij nodig hebt?

Werk van achteren naar voren, niet van de winkel naar het werk.

  1. Schrijf op welke taken het systeem moet doen, en hoeveel keer per dag. Facturen uitlezen, meerwerkbonnen omzetten, conceptantwoorden schrijven, documenten doorzoeken.
  2. Bepaal per taak hoe snel het antwoord er moet zijn. Iets dat ‘s nachts draait, mag traag zijn.
  3. Kies daar het type en de grootte van het model bij. Uitlezen en classificeren kan vaak met een klein model; vloeiend Nederlands schrijven vraagt meer. De afweging staat in welk taalmodel je lokaal draait.
  4. Reken de geheugenbehoefte uit met de vuistregel hierboven, tel de context en de extra modellen erbij op, en rond ruim naar boven af.
  5. Kijk pas daarna naar apparatuur.

Deze volgorde voorkomt de twee klassieke missers: een dure machine kopen voor werk dat een klein model prima aankan, en een machine kopen die precies past totdat er een tweede toepassing bij komt.

Wat als je over drie jaar meer nodig hebt?

Apparatuur voor AI verandert snel. Koop dus niet wat je pas over vijf jaar nodig hebt. Bij de pakketten Start en Groei staat de apparatuur bij ons in bruikleen en komt er elke drie jaar nieuwe apparatuur, of eerder als je meer nodig hebt, afgestemd op wat je dan nodig hebt. Bij Private AI is de apparatuur van jou, omdat organisaties met eigen ICT dat meestal zo willen. Hoe dat doorloopt in het beheer, met bewaking en het opnieuw kunnen opbouwen van de omgeving, vaak binnen twee werkdagen, staat op hoe wij het beheren. Wat de verschillende maten kosten staat in wat lokale AI kost voor een mkb-bedrijf.

Wat je nu kunt doen

Pak de vuistregel erbij en reken één toepassing door die je echt zou willen: welk model, hoe groot, hoeveel context, hoeveel gelijktijdige gebruikers. Dan weet je binnen een half uur of je in de categorie compact werkstation zit of in die van een aparte machine met een zware kaart. Wil je zien wat er op zo’n opstelling draait, dan laat de demo vijf fictieve bedrijven zien die samen op één lokaal AI-systeem werken, met per stap de echt gemeten tijd erbij.

Stuur ons een bericht

Lokale AI bij jou op kantoor?

Vertel welk werk elke week terugkomt. We kijken wat een eigen AI daarvan kan overnemen. Je hoort binnen één werkdag van ons.

Veelgestelde vragen

Kort antwoord op wat vaak gevraagd wordt

Hoeveel geheugen heeft een lokaal taalmodel nodig?
Als vuistregel heeft een model dat in 4 bits is gecomprimeerd ongeveer 0,5 tot 0,6 GB geheugen nodig per miljard parameters, plus ruimte voor de context waarmee je werkt. Een model van acht miljard parameters past daarmee ruwweg in vijf tot zes GB, een model van zeventig miljard heeft al gauw veertig GB of meer nodig. Hoe zwaarder de compressie, hoe minder geheugen, en hoe meer je inlevert op kwaliteit.
Heb je per se een GPU nodig voor lokale AI?
Nee, maar zonder GPU wordt het traag. De snelheid waarmee een model tekst produceert, wordt vooral bepaald door de geheugenbandbreedte, en die ligt op een grafische kaart veel hoger dan op gewoon werkgeheugen. Voor kleine modellen en werk dat 's nachts mag draaien kan een machine zonder GPU voldoen; voor mensen die zitten te wachten op een antwoord niet.
Hoeveel mensen kunnen tegelijk op één lokaal AI-systeem werken?
Dat hangt niet af van het aantal medewerkers maar van het aantal gelijktijdige verzoeken. Een systeem verwerkt verzoeken in batches, dus een paar mensen die af en toe iets vragen merken niets van elkaar. Tien mensen die tegelijk een lang document laten samenvatten wel: dan ontstaat er een rij, en elk gelijktijdig gesprek houdt ook geheugen bezet.
Waar zet je zo'n systeem neer?
In een ruimte die koel, stofvrij en afsluitbaar is, met een eigen stroomgroep en een noodstroomvoorziening. Een meterkast is meestal te warm en te stoffig, en een werkplek is te luidruchtig als de ventilatoren opdraaien. Denk ook aan de back-up naar een tweede locatie: apparatuur in het pand beschermt je niet tegen brand of diefstal.
Bel onsDirect appen