AI in het tijdperk van tokens: na de hype, de rekening
Door Pierre Wilmet
Het nieuwe abonnementsmodel voor AI: tokens
Op 1 juni 2026 is GitHub Copilot met al zijn formules overgestapt op facturatie naar gebruik. We gaan van "premium requests" naar GitHub AI Credits. Die worden berekend op basis van de tokens die echt verbruikt worden aan input, output en cache. De basisprijzen van de abonnementen zijn niet veranderd, maar het inbegrepen gebruik is drastisch verlaagd. En vooral: het vangnet waarmee je na een uitgeput quotum kon terugvallen op het gratis model, bestaat niet meer.
Het gaat zo ver dat sommige developers op Reddit en X spreken van een "Tokenpocalypse". Ze posten geprojecteerde rekeningen die springen van enkele tientallen naar enkele duizenden dollars per maand. Overdreven of niet, deze cijfers vertellen ons één ding: AI heeft een prijs, en die prijs werd tot nu toe niet correct weerspiegeld.
De inzet is enorm. Zoals de kilowattuur dat is voor elektriciteit, wordt de token de verbruikseenheid van AI. Wat beangstigt is niet de prijs van tokens, maar wat ze onthullen over de werkelijke kost van AI.
Wat is een token?
Om een tekst te kunnen lezen, knipt AI die op in kleinere eenheden: tokens. Dat kan een woord zijn, een deel van een woord, een leesteken, een spatie, enzovoort. Deze tokens vormen een woordenschat die de AI gebruikt om tekst te lezen, te voorspellen en te genereren. Een bijzonder complex en/of zeldzaam woord bestaat uit meer tokens dan een eenvoudig of veelgebruikt woord. Dat weegt uiteraard door in de prijs.
Wanneer je AI gebruikt, spelen drie soorten tokens mee:
- Inputtokens: wat je aan het model geeft. Je vraag, met alles wat erbij hoort: de tekst, de context, eventuele bestanden. Ze staan voor alles wat je naar de AI stuurt.
- Outputtokens: het omgekeerde van inputtokens: ze staan voor alle elementen van het antwoord van de AI (tekst, spreadsheet, afbeelding, enzovoort).
- Cachetokens: de context van je eerdere interacties met de AI, die al verwerkt is en waar nodig hergebruikt wordt. Meestal goedkoper, maar niet gratis.
Dat is het grote verschil tussen facturatie per token en facturatie per request: niet alle requests zijn gelijk qua tokens. Sommige zeer complexe requests kosten 100 keer meer dan andere. En elke token die het model verbruikt, wordt gefactureerd.
Waarom deze verandering nu?
Het afgelopen jaar is Copilot sterk geëvolueerd. Van een eenvoudige tool voor codeaanvulling is het uitgegroeid tot een agentplatform dat een repository kan analyseren, meerdere bestanden kan aanpassen, pull requests kan genereren, code reviews kan uitvoeren en zelfs stappen aan elkaar kan rijgen.
Daarom was het businessmodel niet langer houdbaar: het verschil tussen de tokens die één voorgestelde regel code verbruikt en die van een sessie met een agent wordt steeds groter. Bij inputtokens is dat nog sterker, omdat de agent bij elke stap opnieuw context inlaadt.
Dit is maar één voorbeeld van vele. Omdat de rekening afhangt van het gedrag van de agents, en die steeds autonomer worden, hebben de intenties van de gebruiker er steeds minder impact op.
"Blinde" precisie
Niemand betwist facturatie per token. De logica is duidelijk en het gebruik wordt meetbaar: we kunnen prompts optimaliseren, het model kiezen dat het best bij onze noden past en overbodige context schrappen. Tegelijk vinden aanbieders een alternatief voor twee slechte opties: alle gebruikers afknijpen, of de kosten sneller zien stijgen dan de inkomsten.
De keerzijde is dat de rekening onvoorspelbaar wordt: niemand weet vooraf hoeveel tokens een taak zal verbruiken. Ook al is het vrij eenvoudig om richtlijnen op te stellen voor zuinige prompts, je bent nooit veilig voor een verkeerd spoor dat de agent verkent, overbodige vervolgstappen of te veel gelezen bestanden.
Het probleem is dat als elke iteratie iets kost, we aarzelen om te experimenteren. Toch komt een groot deel van de waarde van AI precies uit exploratie. Het risico op nutteloze uitgaven kan de zin doden om onvolmaakte vragen te stellen, om een alternatief te vragen of om een redenering te laten nalezen.
En technische teams?
We gaan van de vraag "Welk model is het meest efficiënt voor een bepaalde taak?" naar "Welk model geeft het meest relevante antwoord, tegen de meest redelijke kost, met zo weinig mogelijk foutmarge?"
Er zijn dus drie belangrijke reflexen om te onthouden:
Eerst: stem het model af op de taak. Een foutmelding herformuleren of een basistest genereren vraagt niet het krachtigste model. Een architectuuranalyse of een kritieke migratie wel.
Vervolgens: behandel context als een asset. De juiste bestanden, de juiste logs en de juiste recente wijzigingen meesturen levert een beter resultaat op met minder tokens dan een hele repository "voor de zekerheid" doorsturen.
Tot slot: stuur het verbruik zoals we de cloud al sturen. Er ontstaan "AI FinOps"-praktijken: budgetten per team, alerts, automatische modelselectie, contextcaching, uitgavenplafonds, audits, dashboards en meer. Het onderwerp is niet langer alleen technisch, maar ook financieel, operationeel en managerial.
Wat nu?
Facturatie per token maakt AI-gebruik vooral bewust. Op korte termijn zal het gebruikers aanzetten om beter om te gaan met hun tokens, hun prompts en de verschillende modellen die ze ter beschikking hebben. Op middellange termijn zullen producten meer automatische optimalisaties inbouwen: contextreductie, dynamische modelselectie, kostenraming vóór uitvoering, enzovoort.
We verlaten de experimentele fase voor een meer doordachte, industriële fase; we gaan op zoek naar de beste verhouding tussen kost en kwaliteit van het antwoord.
De token is dus meer dan een technische eenheid: het is een nieuwe beslissingseenheid en een nieuwe kostenpost die een bedrijf niet langer kan negeren.
De vraag die we je meegeven: betaal je AI liever op basis van echt gebruik (en denk je over elke prompt na), of liever een voorspelbaar vast bedrag (waarvan een deel het gebruik van anderen financiert)?
De volgende editie per e-mail, zonder vast ritme.