Steeds meer grote organisaties tellen niet langer hoeveel AI-toepassingen ze draaien, maar willen weten wat die opleveren. Dat bleek op World Summit AI in Amsterdam. Alleen gaat de rekening verder dan tokens: ook menselijk toezicht kost iets, en hoe je dat effectief houdt, is volgens de sprekers nog een open vraag.
Een AI-toepassing krijgt bij ABN AMRO alleen nog geld als die aantoonbaar iets oplevert op één van de volgende vijf maatstaven: lagere kosten, groei, hogere klanttevredenheid, betere kapitaalallocatie of minder risico. Dat vertelde Hiek van der Scheer, Chief Data and AI Officer van de bank, tijdens een panel over agentic AI op World Summit AI. De jaarlijkse AI-conferentie vond dit jaar voor de tiende keer plaats, op het Hembrugterrein in Zaandam.
Het is een duidelijke koerswijziging. “Vorig jaar was mijn doel vooral om een aantal toepassingen in productie te krijgen”, zegt Van der Scheer. “Naar de businesscase keken we wel een beetje, maar niet zo heel erg. Nu kijken we waar de waarde echt zit.” Dat het om vijf maatstaven gaat en niet alleen om kostenbesparing, is voor hem een bewuste keuze. Samen met de financiële afdeling en de controllers zet de bank een meetkader op. Makkelijk is het niet, geeft hij toe. “Dat meten is wel een uitdaging, moet ik zeggen.”
Productiviteit verdampt
Marco Bressan, chief scientist bij de Spaanse bank Santander, ziet in zijn keynote hoe veel grote bedrijven daar eigenlijk op vastlopen. Ze geven medewerkers assistenten en copilots en hopen de rekening daarna te verantwoorden met hogere productiviteit. Die winst valt in de praktijk alleen nauwelijks aan te wijzen. Medewerkers worden wel sneller, maar gaan vervolgens gewoon andere dingen doen.
Bressan noemt dat de adoptieval. Volgens hem moet AI daarom niet alleen het werk van medewerkers versnellen, maar ingebouwd worden in wat de bank aan klanten levert. Denk aan advies dat zich aanpast aan alles wat de bank al van een klant weet. Dan zie je de opbrengst terug in omzet of lagere kosten, en kun je dat ook aantonen. AI moet voor Santander tussen 2026 en 2028 meer dan een miljard euro opleveren aan extra omzet en lagere kosten, vertelde Bressan.
Ook bij ABN AMRO is het toerekenen niet altijd scherp, vooral bij de grote transformaties die de raad van bestuur zelf kiest. “Omdat de hele omgeving verandert, is het soms moeilijk aan te wijzen of iets echt door AI komt of door iets anders dat we doen”, zegt Van der Scheer. “Het wordt dan een beetje wazig, maar we meten het wel.”
Eerst bewijzen, dan bouwen
Albert Heijn probeert die vraag te beantwoorden vóórdat er iets gebouwd wordt. “Als het kan, gebruiken we liever geen AI”, zegt Noortje van Genugten, VP Product bij de supermarktketen, in een panel over klantbeleving. “Kunnen we een probleem op een eenvoudigere manier oplossen, dan doen we dat.” Ze geeft een voorbeeld uit de winkels, waar nogal wat scholieren werken. Van Genugten vertelt op het podium dat zo’n 20 procent van de Nederlanders ooit bij Albert Heijn gewerkt, vaak als bijbaantje. Dat cijfer leverde in de zaal vol internationale toehoorders een golf van verbazing op.
“Klanten kunnen voor tieners best een beetje eng zijn”, zegt Van Genugten. “Ze vragen waar een bepaalde soort bonen ligt, terwijl je als vakkenvuller geen idee hebt wat het überhaupt is.” Albert Heijn vermoedde dat een AI-assistent daar kon helpen, maar wilde er nog geen geld in steken zolang niet duidelijk was welke vragen medewerkers eigenlijk hadden. Dus bouwde het team in de bestaande medewerkersapp alleen de voorkant van een assistent, zonder AI erachter, en ging het in een paar winkels zélf in de achterkamer zitten om alle vragen zo snel mogelijk met de hand te beantwoorden. “Want misschien was AI helemaal niet de oplossing”, zegt ze.
Dat bleek het toch wel te zijn. De meeste vragen gingen namelijk over producten: zit het in het assortiment, waar ligt het, is er nog voorraad, wat kost het en is het in de aanbieding. Maar pas toen duidelijk was welke vragen mensen stellen, bouwde Albert Heijn de AI-assistent. Op een organisatie van 125.000 medewerkers voert die volgens Van Genugten nu zo’n 80.000 gesprekken per week, terwijl hij voorlopig alleen vragen beantwoordt over producten die op voorraad zijn.
Die volgorde, eerst rekenen en dan bouwen, kwam vaker langs op World Summit AI. Pratyus Sinha, tot voor kort Senior Director Responsible AI bij Decathlon, maakte voor de zoekfunctie van de webshop eerst de som: het aantal gemiste zoekopdrachten maal de conversie maal de gemiddelde orderwaarde. Daarmee was voor zijn team duidelijk dat het de moeite waard was om te bouwen. Daarna moet zoiets volgens hem eerst via A/B-tests bij een deel van de klanten bewijzen dat het werkt, waarna er pas wordt opgeschaald.
Te vroeg om te rekenen
Soms draait een toepassing al voordat duidelijk is wat die precies oplevert. Zo gaat het bij ING België. Elke statutenwijziging of bestuurswissel van een Belgisch bedrijf verschijnt in het Belgisch Staatsblad, en bij de bank moest al die informatie tot voor kort grotendeels met de hand worden bijgewerkt in de eigen systemen. Dat wordt nu gedaan door een AI-toepassing, vertelt Bram Joostens tussen de sessies door. Hij is Customer Journey Expert bij business lending, de afdeling voor zakelijke kredieten, waar ze nog wel meer in de steigers hebben staan. Zo bouwt het team een agent die binnenkomende dossiers screent en nagaat of alle informatie compleet is.
Ook nieuwe collega’s moeten door AI sneller op stoom komen. Wie bij business lending begint, heeft veel vakkennis nodig, bijvoorbeeld om een bepaald type kredietcontract op te stellen. Die kennis zit in opleidingsmateriaal, en dat kunnen nieuwkomers nu via een AI-agent doorzoeken in plaats van het zelf bij elkaar te zoeken. Normaal duurt het zo’n twee jaar voordat een nieuwe medewerker zelfstandig werkt. “We zijn nog maar kort live, dus het is moeilijk om al iets concreets te zeggen over besparingen”, zegt Joostens. “Misschien is de inwerktijd door de AI-agent gehalveerd, maar dat weet ik nog niet. Het ziet er wel veelbelovend uit.”
Wie betaalt de tokens
Ook de kostenkant vraagt om een rekensom. Toen chipmaker AMD op grote schaal agents ging inzetten, schoot de rekening voor AI-tokens omhoog. “Onze CFO zei: het is prima dat we dit uitgeven, zolang we zeker weten dat het iets oplevert”, vertelt Mark Papermaster, CTO van AMD, in een interview. Sindsdien neemt elke afdeling die AI inzet de kosten op in de eigen begroting, en moeten ze zelf aantonen dat het rendeert. Daarnaast zette AMD een tokenrouter in die eenvoudige taken naar goedkopere modellen stuurt.
Dat het ook goedkoper kan, ziet Wei Manfredi, die bij hotelketen IHG, bekend van onder meer Holiday Inn en InterContinental, de AI-architectuur en innovatie leidt. Van de meeste AI-investeringen is volgens haar nog moeilijk te zeggen wat ze opleveren. “Maar als je mensen die hun proces door en door kennen, bijvoorbeeld van de maandafsluiting of de inkoop, goede AI-tools geeft en er een engineer naast zet, zie je wel meetbare resultaten”, zegt ze. Duur is dat volgens Manfredi niet. Waar een traditioneel softwareproject al snel miljoenen kost, zijn de engineers hier toch al in dienst. Wat er extra bijkomt, is vooral de rekening voor het gebruik van de AI-modellen.
Alleen weten veel organisaties niet eens wat ze uitgeven, zegt Kim-Norman Sahm, CTO van Cast AI, dat software maakt om cloud- en AI-infrastructuur efficiënter en goedkoper te laten draaien. Ze hebben geen zicht op hoeveel agents er draaien, wat die kosten en wie ervoor verantwoordelijk is. “We vliegen eigenlijk in het donker”, zegt hij. Het moment van de waarheid komt volgens Sahm aan het eind van de maand. “Dan breekt het hart van de CFO, als hij zich bij de Oscars waant en de rekening van Anthropic uit de envelop haalt.”
Naar een goedkoper model overstappen lost dat overigens niet vanzelf op. De prijs per token zegt volgens Sahm namelijk niet alles. “Levert een goedkoop model dezelfde kwaliteit, prima, dan bespaar je. Maar als het onzin oplevert, heb je er niets aan.” ABN AMRO houdt die keuze open met een eigen AI-gateway, vertelt Van der Scheer, waarmee de bank per toepassing kan kiezen tussen onder meer Anthropic, OpenAI en Mistral.
Toezicht wordt afstempelen
“Wanneer een agent 95 procent nauwkeurigheid behaalt, klinkt dat misschien goed genoeg om live te gaan”, zegt Sahm. “Maar in productie geeft die agent zijn werk door aan de volgende, en die weer aan de volgende.” Omdat elke fout doorwerkt in de volgende stap, stapelen de fouten zich op. Drie agents die het elk in 95 procent van de gevallen goed doen, halen achter elkaar samen nog maar zo’n 86 procent, rekent Sahm voor. Bij twintig agents is dat nog slechts 36 procent. “Zou jij iemand vertrouwen die zegt dat hij voor 36 procent zeker weet dat zijn oplossing klopt?” Menselijk toezicht moet dat opvangen, maar, ook dat heeft zijn prijs.
Bij ingrijpende klantbesluiten, zoals een hypotheek, beslist bij ABN AMRO altijd een mens, vertelt Van der Scheer. “We zullen nooit zeggen: computer says no.” Maar hij ziet ook waar het toezicht wringt. Bij softwareontwikkeling schrijven agents bij de bank steeds meer code, en controleren mensen elke stap. Dat controlewerk wordt na een tijdje nogal saai, zegt Van der Scheer, en daar zit dan ook het risico. “Als de code voor 95 procent goed is, vind je nog maar vijf procent fouten, en dat is dan je dagelijkse werk”, legt hij uit. “Je kunt zeggen dat er menselijk toezicht was, maar als het een stempelmachine wordt, heb je geen effectieve controle.”
De Autoriteit Persoonsgegevens waarschuwt voor hetzelfde. In de handvatten voor betekenisvolle menselijke tussenkomst uit juli 2025 stelt de toezichthouder dat menselijke tussenkomst bij geautomatiseerde besluiten over mensen niet mag blijven bij een symbolische klik op goedkeuren. Tijdsdruk en onduidelijke systemen noemt de AP als oorzaken waardoor dat in de praktijk misgaat.
Rens van Dongen, Chief AI Officer bij NS, verwijst naar diezelfde AP, maar gaat nog een stap verder. “Over human in the loop wordt in discussies over AI-governance veel gesproken, maar ik vind dat beeld eigenlijk misleidend, of op zijn minst achterhaald”, zegt hij. “Het is heel moeilijk om een human in the loop echt effectief te laten zijn.” Vooral bij agents ziet hij dat probleem. “Daar gaat alles met bovenmenselijke snelheid en complexiteit. Het is niet redelijk om te verwachten dat mensen al die goedkeuringen nog beoordelen.” Hij pleit ervoor dat mensen gealarmeerd worden en kunnen ingrijpen, in plaats van elke stap af te tekenen.
Ook bij ABN AMRO is dat raadsel niet opgelost. Van der Scheer verwacht dat er over een paar jaar geen mens meer naar code kijkt. “Maar je moet er nog steeds controle op hebben”, zegt hij. “Hoe je dat doet, dát is de puzzel.”