4min Financieel

AI-kosten onvoorspelbaar door wisselend tokenverbruik

AI-kosten onvoorspelbaar door wisselend tokenverbruik

Slechts 11 procent van de bedrijven voorspelt de eigen AI-uitgaven nauwkeurig. Dat komt doordat modellen per taak heel verschillende aantallen tokens verbruiken. Uit onderzoek blijkt bovendien dat goedkope modellen in bijna een derde van de gevallen duurder uitvallen dan premium-alternatieven.

Eerst moesten werknemers van veel Amerikaanse bedrijven zoveel mogelijk AI gebruiken, een trend die gekscherend ook wel tokenmaxxing werd genoemd, maar daarna kwam de rekening. Organisaties merken nu dat ze hun tokens veel strakker moeten monitoren, maar dat blijkt in de praktijk heel wat moeilijker dan gedacht.

Wat is een token eigenlijk?

Waar traditionele software meestal wordt afgerekend per seat of via een vaste maandlicentie, werkt generatieve AI op basis van reken- en verbruikseenheden, oftewel tokens. Een token staat ruwweg gelijk aan driekwart van een woord (ongeveer vier leestekens), maar het model hakt tekst, code, getallen en zelfs fragmenten van afbeeldingen in ‘brokjes’ op. Bedrijven betalen per duizend of per miljoen verwerkte tokens, waarbij leveranciers onderscheid maken tussen inputtokens (de prompt en meegestuurde context) en outputtokens (het gegenereerde antwoord).

Dat maakt budgetteren wezenlijk anders dan bij klassieke IT. Een AI-model gedraagt zich niet als een statisch programma, maar meer als een werknemer. Zo leest het informatie, denkt na, neemt beslissingen en maakt soms omwegen of fouten. Bij zogeheten ‘redeneermodellen’ en autonome agents komen daar nog ’thinking tokens’ of interne redeneerstappen bij. Een taak die er aan de voorkant eenvoudig uitziet, kan achter de schermen honderden onzichtbare tussenstappen vereisen, waardoor het uiteindelijke tokenverbruik vooraf nauwelijks exact te ramen is.

Volgens het 2026 State of AI Cost Governance Report van Mavvrik en Benchmarkit zat maar 11 procent van de 396 ondervraagde organisaties met de prognose binnen 10 procent van de werkelijke uitgaven. Bij 39 procent lag de afwijking al tussen 11 en 25 procent en bij 35 procent tussen 26 en 50 procent. 13 procent zat er meer dan de helft naast.

Goedkoop blijkt duur

Een lagere prijs per token betekent niet automatisch lagere kosten. Onderzoekers van Stanford University, Carnegie Mellon University, UC Berkeley en Microsoft Research lieten dit jaar modellen meer dan 6800 taken uitvoeren, onder meer in wiskunde, programmeren en wetenschap. In 32 procent van de gevallen kostte een goedkoper model uiteindelijk meer dan een duurder model. Onderzoekers concluderen dat de prijs alleen niets zegt over welk model echt goedkoper is.

Een opvallend voorbeeld was eenzelfde prompt die werd gegeven aan Gemini 3.1 Pro en de lichtere Gemini 3 Flash. Het betrof een analyse van een frame uit een YouTube-video. Het Pro-model rondde de taak af in 85 stappen, waar ongeveer 1 dollar aan kosten mee gemoeid was. Flash had maar liefst 952 stappen nodig, liep tegen bot-detectie aan, vroeg Yahoo’s Scout-chatbot om hulp, probeerde het via Bing en strandde ten slotte op de maximale tokenlimiet. De totale kosten bedroegen 14 dollar en dat ook nog eens zonder resultaat.

Ook het type output telt mee. Bij Gemini 2.5 Flash rekende Google bijvoorbeeld 0,60 dollar per miljoen outputtokens zonder ’thinking’ en 3,50 dollar mét.

Lees ook: AI-watermerken zijn onzichtbaar, maar overal aanwezig

Zelfde model, andere rekening

Maar zelfs een en hetzelfde model is niet consistent, blijkt uit hetzelfde onderzoek. Snelle modellen en redeneermodellen van Anthropic, Google en OpenAI, waaronder GPT-5.4, Gemini 3.1 Pro en Claude Opus 4.7, kregen elk vijf keer dezelfde programmeerprompt. Elke run leverde een ander bedrag op aan kosten en ook mislukte runs verbruikten betaalde tokens.

Google erkent die schommelingen. “Enige variatie op promptniveau is inherent aan AI, en uit onze tests blijkt dat dit gemiddeld genomen wegvalt bij een groot aantal uiteenlopende, praktijkgerichte workloads”, aldus een woordvoerster. Volgens haar maken de vele factoren achter de totale kosten precieze voorspellingen lastig. Google biedt klanten daarom spending caps en flexibele prijsmodellen.

Andere leveranciers passen hun prijsmodel ook aan. Zo stapt GitHub met Copilot over op usage-based billing, terwijl DeepSeek de prijzen van OpenAI, Anthropic en Google onder druk zet.

Hoe budgetteer je dan?

De FinOps Foundation adviseert om eerst 30 tot 60 dagen te meten, het budget vervolgens op 110 tot 120 procent van die baseline te zetten en alerts in te stellen bij 80 en 100 procent. Voor agentic workflows is het slim om te rekenen met een budgetmultiplier van vijf tot tien keer. De Wall Street Journal noemt het trainen van medewerkers in de keuze van het juiste model per taak als een van de belangrijkste strategieën om het gebruik te beheersen en te voorkomen dat IT-kosten een oncontroleerbare black box worden.