Lokale AI
Welk taalmodel draai je lokaal? Llama, Mistral, Qwen en Gemma vergeleken
Kies een lokaal taalmodel op licentie, grootte en hoe goed het jouw Nederlands schrijft, en beslis pas na een test op je eigen werk. Zo pak je die test aan.
Voor werk op kantoor kom je in de praktijk vier modelfamilies tegen die je lokaal kunt draaien: Llama van Meta, Mistral uit Frankrijk, Qwen van Alibaba en Gemma van Google. Welke de beste is, hangt af van je taak, je taal en je apparatuur, dus kies op licentie, grootte en hoe het model jouw vaktaal schrijft, en hak de knoop pas door na een test met je eigen documenten.
Ranglijsten helpen daar weinig bij. Ze meten opgaven die zelden lijken op het werk waarvoor jij het systeem neerzet, en ze verouderen sneller dan je kunt lezen. Hieronder staat waar je wel op kunt sturen.
Wat is een open taalmodel precies?
Een open taalmodel is een model waarvan de gewichten te downloaden zijn, zodat je het op eigen apparatuur kunt draaien zonder verbinding met de leverancier. Dat is iets anders dan open source: bij veel modellen mag je de gewichten gebruiken onder voorwaarden die de maker zelf heeft opgesteld.
Dat onderscheid is belangrijker dan het klinkt. Open gewichten zijn wat lokale AI mogelijk maakt: de data blijft in je pand, er gaat geen tekst naar buiten, en je bent niet afhankelijk van de beschikbaarheid van een dienst. De licentie bepaalt vervolgens wat je er commercieel mee mag.
Hoe kies je op licentie?
Kijk per model en per versie wat de licentie zegt, want binnen één familie verschilt dat. Dit zijn de vormen die je tegenkomt:
| Familie | Herkomst | Vorm van de licentie | Waar je op let |
|---|---|---|---|
| Llama | Meta | Eigen gemeenschapslicentie, geen standaard open source-licentie | Voorwaarden over toegestaan gebruik en naamsvermelding, en een drempel voor zeer grote diensten |
| Mistral | Mistral AI, Frankrijk | Wisselt per model: een deel onder Apache 2.0, een deel onder een eigen licentie | Per model nakijken of commercieel gebruik gewoon is toegestaan |
| Qwen | Alibaba | Veel modellen onder Apache 2.0, sommige onder een eigen licentie | Per uitgave en per grootte controleren |
| Gemma | Eigen gebruiksvoorwaarden, geen standaard open source-licentie | Gebruiksbeperkingen, en de voorwaarden gelden ook voor afgeleide modellen |
Drie praktische regels hierbij. Bewaar de licentietekst bij het modelbestand dat je draait, zodat je later kunt aantonen onder welke voorwaarden je bent begonnen. Ga er niet van uit dat de nieuwe versie dezelfde voorwaarden heeft als de vorige. En let op afgeleide modellen: iemand die een model heeft bijgetraind, erft in de regel de voorwaarden van het model waar hij mee begon, ook als de nieuwe naam anders doet vermoeden. Dit is algemene uitleg en geen juridisch advies; bij twijfel laat je de licentie lezen door iemand die daarvoor doorgeleerd heeft.
Hoe goed is een lokaal model in het Nederlands?
Het meeste trainingsmateriaal is Engels. Dat merk je in Nederlandse teksten. Grotere modellen schrijven in de regel beter Nederlands dan kleine uit dezelfde familie, omdat er meer ruimte is voor talen die minder in de data zitten. Verder verschilt het per familie hoeveel aandacht Europese talen hebben gekregen, en dat verschuift met elke nieuwe uitgave.
Wat je in de praktijk ziet: begrijpen gaat bijna altijd beter dan schrijven. Een model dat uit een Nederlandse mail feilloos haalt om welk project en welk bedrag het gaat, kan toch een offertezin opleveren waar een stroeve vertaling in doorklinkt. Voor uitlezen en sorteren is de taal dus zelden het probleem, voor tekst die de deur uitgaat wel.
Test daarom op je eigen vaktaal. Een model dat “meerwerk”, “stelpost”, “verlegde btw”, “opleverpunten” of “kozijndorpel” correct gebruikt in een lopende zin, heeft meer bewezen dan een model dat een algemene vraag netjes beantwoordt. Zet er ook een paar lastige gevallen in: een mail in dialect getinte spreektaal, een notitie met afkortingen van de bouwplaats, een klantvraag met een spelfout in de productnaam.
Welke grootte heb je nodig?
Grootte wordt uitgedrukt in parameters, en die bepaalt zowel de kwaliteit als het geheugen dat je nodig hebt. Grof ingedeeld:
- Klein, ongeveer één tot vier miljard parameters. Snel en zuinig. Goed voor sorteren, labelen en gegevens uit een vast formaat halen. Zwak in vrij schrijven.
- Middel, ongeveer zeven tot veertien miljard parameters. Het werkpaard voor kantoorapparatuur. Schrijft bruikbare concepten en kan met een document in de context werken.
- Groot, dertig miljard en meer. Merkbaar beter in redeneren over lange teksten en in nuance, maar vraagt fors geheugen en levert minder snelheid.
Sommige families bieden modellen die intern uit meerdere deelmodellen bestaan en per vraag maar een deel activeren. Die zijn sneller dan hun totale omvang doet vermoeden, maar het geheugen moet nog steeds het geheel kunnen herbergen. Reken ze dus als groot bij het bepalen van je apparatuur. Hoeveel geheugen welke maat vraagt, staat in welke hardware je nodig hebt voor lokale AI.
Combineren mag, en gebeurt in de praktijk vaak: een klein model dat binnenkomende mail sorteert en de gegevens eruit haalt, en een groter model dat alleen aan het werk gaat als er tekst geschreven moet worden. Dat scheelt geheugen en wachttijd.
Waar let je nog meer op bij de keuze?
Naast licentie, taal en grootte spelen vier dingen mee.
Contextvenster. Hoeveel tekst het model in één keer kan meenemen. Voor een klantmail is dat nooit een probleem, voor een bestek of een raamcontract wel. Let erop dat een groot contextvenster ook geheugen kost tijdens het werk.
Instructiegedrag. Houdt het model zich aan een vast antwoordformaat? Als je gegevens in een vast schema terug wilt krijgen, zodat je systeem ermee verder kan, is dat belangrijker dan mooie zinnen.
Beschikbaarheid in gecomprimeerde vorm. Vrijwel alles draait op kantoor in gecomprimeerde vorm. Of daar goede uitgaven van zijn, bepaalt of een model bruikbaar is op jouw apparatuur.
Onderhoud. Hoe vaak komt er een nieuwe versie, en hoe lang blijft de vorige beschikbaar? Een familie die stilvalt, is geen ramp voor een draaiend systeem, maar wel voor je plannen van volgend jaar.
Wat een model niet doet, ongeacht de keuze: rekenen. De bedragen in een offerte en de totalen in een rapportage horen uit je eigen systeem te komen, niet uit het model. Waarom dat zo is, staat in waarom een taalmodel niet mag rekenen.
Hoe test je modellen op je eigen werk?
Dit is het deel dat de keuze maakt. Het kost een middag en het is de enige meting die over jouw situatie gaat.
- Verzamel twintig tot dertig echte voorbeelden uit je eigen administratie: binnengekomen mails, meerwerkbonnen, inkoopfacturen, klantvragen. Neem er bewust een paar rommelige tussen.
- Schrijf per voorbeeld op wat eruit moet komen. Welk bedrag, welk project, welke categorie, of welke strekking het antwoord moet hebben. Dit is je meetlat.
- Houd alles gelijk behalve het model. Dezelfde instructies, dezelfde documenten, dezelfde instellingen. Anders meet je je prompt en niet het model.
- Scoor per voorbeeld goed of fout, en noteer bij fout wat er misging. Tel de fouten, maar lees ze ook: tien keer hetzelfde soort fout is iets anders dan tien verschillende.
- Meet ook de tijd. Een model dat één op de twintig keer beter is maar drie keer zo traag, verliest bij werk waar iemand op wacht.
- Bewaar de set. Bij elke nieuwe modelversie draai je hem opnieuw. Zo merk je dat een update iets breekt voordat je klant het merkt.
Die laatste stap is ook hoe wij het bij klanten doen: voor elke omgeving ligt een eigen testset klaar die automatisch draait bij elke modelwissel. Dat staat beschreven op hoe wij het beheren.
Drie keuzes die vaak verkeerd uitpakken
Kiezen op een ranglijst. Die meet iets anders dan jouw werk. Gebruik hem hooguit om een korte lijst te maken die je zelf natest.
Altijd het nieuwste nemen. Een nieuw model kan net anders antwoorden. Dan haalt je factuurverwerking ineens het verkeerde veld op. Nieuw is pas beter als je eigen testset dat laat zien.
Eén model voor alles. Uitlezen, sorteren en schrijven zijn verschillende taken met verschillende eisen. Voor de eerste twee is een klein model vaak sneller en net zo goed.
Wat je nu kunt doen
Begin met de testset, niet met het model. Twintig echte voorbeelden uit je eigen postvak, met per stuk het antwoord dat je verwacht, zijn genoeg om elke kandidaat binnen een middag af te wegen. Wil je eerst zien hoe modelkeuze, vaste dataroutes en menselijke goedkeuring samen één werkgang vormen, dan kun je de demo aanvragen: vijf fictieve bedrijven op één lokaal AI-systeem, met bij elk antwoord de bron erbij. Wat het kost om zoiets neer te zetten staat op wat het kost.
Stuur ons een bericht
Lokale AI bij jou op kantoor?
Vertel welk werk elke week terugkomt. We kijken wat een eigen AI daarvan kan overnemen. Je hoort binnen één werkdag van ons.
Verstuurd
Je bericht is binnen
Je hoort binnen één werkdag van ons, op de manier die je hebt aangegeven. Wil je ondertussen al iets zien, dan staat de demo voor je open.
Veelgestelde vragen
Kort antwoord op wat vaak gevraagd wordt
Welk lokaal taalmodel is het beste voor een bedrijf?
Zijn open modellen ook open source?
Hoe goed schrijven lokale taalmodellen Nederlands?
Moet je het grootste model kiezen dat op je apparatuur past?
Meer lezen




