· 3 min · ai-modellen · kosten

Kies het kleinste AI-model dat de klus goed doet

Open-weight modellen verwerken nu meer dan de helft van het AI-werk via Vercel. Voor het MKB telt welk model genoeg is, en hoe makkelijk je later wisselt.

Vercel publiceerde deze week cijfers over het AI-verkeer dat door zijn AI Gateway loopt. In augustus verwerkten open-weight modellen 56 procent van alle tokens. In april was dat nog 13 procent. Volgens Emerce is het de eerste keer dat open-weight modellen meer tokens verwerken dan alle closed-weight modellen samen.

Een token is een klein brokje tekst: een letter, een stukje woord, een heel woord of een leesteken. Een taalmodel leest en schrijft in tokens, en je betaalt er ook per token voor.

Het meeste werk kost het minste geld

Die 56 procent van de tokens was goed voor maar 14 procent van de uitgaven via de gateway. De closed-weight modellen verwerkten dus 44 procent van de tokens en kostten 86 procent van het geld. Tegelijk daalde de gemiddelde prijs per token in augustus met 23,2 procent. Volgens Vercel was dat al de derde maand op rij met een prijsdaling. Vercel concludeert dat de prijs-prestatieverhouding steeds zwaarder weegt bij de keuze voor een model.

Wij lezen daarin dat bedrijven die AI in productie draaien het bulkwerk naar goedkope modellen sturen en de dure modellen bewaren voor het werk waar die echt verschil maken. Dat vinden we een gezonde ontwikkeling.

Een model dat alleen een keuze teruggeeft

Claire Vo liet deze week zien hoe ver dat kan gaan, in haar podcast How I AI, verschenen via Lenny's Newsletter. Ze testte Jev, een nieuw model van TypeSafe AI. Jev schrijft geen tekst. Het geeft een gestructureerde waarde terug: een keuze uit een lijst, een score of een kans. Invoer kost 4 cent per miljoen tokens en voor de uitvoer betaal je niets.

Vo liet Jev 1.700 pull requests (wijzigingen in code) indelen in categorieën, voor 9 cent in totaal. Voor ChatPRD deed ze 200.000 classificaties op 1.100 signalen. Ze bouwde ook een dashboard op basis van 4.500 YouTube-reacties en liet Jev haar Gmail sorteren. Ze noemt het de snelste en goedkoopste classificatielaag die ze ooit heeft ingebouwd.

Het nuttigste deel van haar verhaal is dat ze Jev inmiddels niet meer los gebruikt. Bij het sorteren van haar Gmail geeft Jev een score en doet een gewoon taalmodel de opvolging.

Veel kantoorwerk is sorteren

Een groot deel van het administratieve werk in het MKB bestaat uit sorteren en beslissen. Denk aan een groothandel die elke ochtend een inbox vol mail heeft: is dit een order, een klacht of een vraag over levertijd? Of een accountantskantoor dat binnenkomende stukken per klant en per soort moet wegzetten. Voor zulke vragen is een model genoeg dat betrouwbaar het juiste vakje kiest. Dat het ook een heel verslag kan schrijven, heb je daar niet nodig.

Wie daar standaard het grootste model op zet, betaalt voor capaciteit die hij niet gebruikt. Bij een paar honderd mails per dag zie je dat misschien nauwelijks terug op de factuur. Het gaat wel meetellen zodra je hetzelfde proces loslaat op alle orders, alle facturen en alle klantvragen. Een klein model dat alleen een keuze teruggeeft, is ook makkelijker te controleren: je neemt een steekproef en kijkt of het vakje klopt.

Als we een proces uitpluizen in een kansenscan, maken we dit onderscheid als eerste. Welk deel is sorteerwerk, en welk deel vraagt echt om geschreven tekst?

Houd het wisselen goedkoop

Het aandeel van open-weight modellen ging in vier maanden van 13 naar 56 procent, en de prijs zakt maand na maand. Het model dat je vandaag kiest, is over een halfjaar waarschijnlijk niet meer het beste of het goedkoopste voor jouw klus. Je wilt dan kunnen overstappen zonder alles opnieuw te bouwen.

Dat lukt als je de taak vastlegt los van het model. Schrijf op welke categorieën er zijn, welke uitkomst je verwacht en hoe je controleert of het goed ging. Bewaar een set voorbeelden waarvan je het juiste antwoord kent. Een ander model uitproberen is dan een middag werk: je haalt de voorbeelden erdoorheen en kijkt of de score gelijk blijft. Zonder zo'n testset kun je twee modellen niet eerlijk vergelijken, en blijf je hangen bij de leverancier waarmee je toevallig begon.

Geschreven met AI-ondersteuning op basis van de gelinkte bronnen en onze eigen praktijk, automatisch gecontroleerd op feiten tegen die bronnen.

Gepubliceerd op 28 september 2026

--:--