Hoe klein is klein?
Er bestaat geen universele parametergrens. Voor een telefoon is een ander model compact dan voor een server met meerdere GPU’s. Kijk daarom naar de combinatie van taak, modelvariant, precisie, contextlengte en hardware.
Een modelnaam alleen zegt te weinig. Een familie kan zowel kleine als grote varianten bevatten. Ook “actieve parameters” bij een mixture-of-experts-model zijn niet hetzelfde als het totale aantal gewichten dat je moet opslaan.
Klein, lokaal en open zijn verschillende dingen
Klein gaat over de omvang en benodigde middelen. Lokaal gaat over de plek waar je de berekening uitvoert. Open gewichten betekent dat je de modelbestanden kunt verkrijgen, onder een specifieke licentie.
Een klein model kan gewoon via een cloud-API draaien. Een groot model kan op een eigen server staan. En toegang tot modelgewichten betekent niet automatisch dat ieder commercieel gebruik zonder voorwaarden is toegestaan.
Begin bij een afgebakende taak
Denk aan het categoriseren van supportvragen, velden uit documenten halen of een conceptsamenvatting maken. Die taken kun je met eigen voorbeelden beoordelen. “Een assistent die alles kan” maakt het veel lastiger om fouten en grenzen te ontdekken.
Neem ook een eenvoudige baseline mee: regels, zoektechnologie of een klassiek classificatiemodel. Generatieve AI is niet automatisch de beste oplossing voor elk tekstprobleem.
Wat vraagt lokaal draaien van je hardware?
De gewichten vormen maar één deel van het geheugengebruik. Bij 4-bit opslag vraagt een dicht model met 4 miljard parameters theoretisch ongeveer 2 GB voor de gewichten. Quantisatie-informatie, de runtime en het geheugen voor de context komen daar nog bij.
Quantisatie slaat gewichten met minder precisie op. Dat kan geheugen besparen, maar verandert mogelijk de uitvoerkwaliteit. Vergelijk daarom de variant die je werkelijk gaat inzetten, niet alleen de benchmark van het oorspronkelijke model.
Een lange prompt en meerdere gelijktijdige gebruikers kunnen het geheugenverbruik sterk verhogen. Meet op het doelapparaat ook de tijd tot het eerste token, totale antwoordtijd en piekgeheugen.
Lokaal is geen automatische privacygarantie
Een lokale berekening kan dataverkeer naar een externe modelprovider vermijden. Maar een toepassing bevat meer dan het model: logbestanden, zoekdiensten, tools, telemetrie en een eventuele cloudfallback kunnen nog steeds gegevens versturen.
Breng die volledige keten in kaart. Beperk toegang, controleer welke data wordt opgeslagen en test wat er gebeurt zonder internet. Een hybride toepassing moet expliciet maken welke gegevens alsnog naar de cloud gaan.
Zo maak je een bruikbare vergelijking
- Stel een taakset samen. Gebruik representatieve Nederlandse voorbeelden, moeilijke gevallen en voorbeelden waarop het systeem moet weigeren of escaleren.
- Leg acceptatiecriteria vast. Meet bijvoorbeeld gemiste velden, onjuiste feiten, ongeldige JSON en menselijke correctietijd. Kies de maat die past bij de taak.
- Vergelijk dezelfde workflow. Houd prompts, bronnen en testdata gelijk; noteer modelversie, quantisatie en instellingen.
- Reken de hele oplossing door. Neem hardware, beheer, ontwikkeling, energie en eventuele cloudkosten mee.
- Maak fouten herstelbaar. Voeg menselijke controle of een expliciete fallback toe waar de impact van een fout dat vraagt.
Een klein model is interessant wanneer de volledige oplossing binnen je kwaliteitsgrenzen blijft en op relevante punten beter past. Niet alleen omdat het minder parameters heeft.
Bronnen & verantwoording
De uitleg en afwegingen zijn van deze site. Productspecificaties komen uit de onderstaande primaire bronnen; mogelijkheden kunnen veranderen.