Naar de inhoud

Hoeveel geheugen vraagt een lokaal taalmodel?

Kies een modelgrootte, een kwantisatievorm en het aantal mensen dat tegelijk werkt. Je ziet meteen hoeveel geheugen dat vraagt en wat voor machine daarbij hoort. Vuistregels, geen belofte: pas op de machine zelf weet je het zeker.

Hoe groot is het model?

In welke vorm draai je hem?

Hoeveel tekst mag hij in één keer overzien?

Meer context betekent langere stukken tekst in één beurt, en meer geheugen.

Niet hoeveel medewerkers je hebt, maar hoeveel er op hetzelfde moment een vraag stellen of een document laten verwerken.

Wat je nodig hebt

Vuistregel
Het model zelf
0GB
Met context en werkruimte
0GB
Geheugen in de machine
0GB of meer

Rekenregel: het aantal miljard parameters maal het aantal bytes per parameter, plus ruimte voor de context en voor het werk zelf. Hoe snel het daarna voelt, hangt af van de geheugenbandbreedte van de machine en niet van dit getal.

Waar je op let

Geheugen is de eerste grens, snelheid de tweede

Past een model niet in het geheugen van de grafische kaart of in het gedeelde geheugen van de machine, dan valt hij terug op de processor. Hij draait dan nog steeds, maar merkbaar trager.

Past hij er wél in, dan bepaalt de geheugenbandbreedte hoe snel het antwoord komt. Dat is de reden dat twee machines met hetzelfde aantal gigabytes heel verschillend kunnen aanvoelen.

Voor het werk waar wij het meestal over hebben, zoals facturen uitlezen, mail samenvatten en documenten doorzoeken, is een model van acht tot veertien miljard parameters in vierbits vorm in de praktijk de gangbare keuze. Groter wordt pas interessant als het werk echt om redeneren vraagt.

Welk model kies je: Llama, Mistral, Qwen of Gemma →

Wij kiezen de maat op jouw werk, niet op een getal

We draaien je eigen documenten door een proefopstelling en meten wat eruit komt voordat er iets bij je op kantoor staat.

Bel onsDirect appen