Hoeveel geheugen vraagt een lokaal taalmodel?
Kies een modelgrootte, een kwantisatievorm en het aantal mensen dat tegelijk werkt. Je ziet meteen hoeveel geheugen dat vraagt en wat voor machine daarbij hoort. Vuistregels, geen belofte: pas op de machine zelf weet je het zeker.
Wat je nodig hebt
Vuistregel- Het model zelf
- 0GB
- Met context en werkruimte
- 0GB
- Geheugen in de machine
- 0GB of meer
Rekenregel: het aantal miljard parameters maal het aantal bytes per parameter, plus ruimte voor de context en voor het werk zelf. Hoe snel het daarna voelt, hangt af van de geheugenbandbreedte van de machine en niet van dit getal.
Waar je op let
Geheugen is de eerste grens, snelheid de tweede
Past een model niet in het geheugen van de grafische kaart of in het gedeelde geheugen van de machine, dan valt hij terug op de processor. Hij draait dan nog steeds, maar merkbaar trager.
Past hij er wél in, dan bepaalt de geheugenbandbreedte hoe snel het antwoord komt. Dat is de reden dat twee machines met hetzelfde aantal gigabytes heel verschillend kunnen aanvoelen.
Voor het werk waar wij het meestal over hebben, zoals facturen uitlezen, mail samenvatten en documenten doorzoeken, is een model van acht tot veertien miljard parameters in vierbits vorm in de praktijk de gangbare keuze. Groter wordt pas interessant als het werk echt om redeneren vraagt.
Welk model kies je: Llama, Mistral, Qwen of Gemma →Wij kiezen de maat op jouw werk, niet op een getal
We draaien je eigen documenten door een proefopstelling en meten wat eruit komt voordat er iets bij je op kantoor staat.




