← Alle artikelen
Waypoint · Editie 5·27 juli 2026·7 min lezen

De objectiviteit van AI: waarom AI kan falen, zelfs als het gehoorzaamt

Door Pierre Wilmet

Als we het over de risico's van artificiële intelligentie hebben, stellen we ons vaak een AI voor die vijandig wordt: een machine die ons kwaad "wil" doen. Een spectaculair scenario, heel handig voor films, maar minder nuttig om de echte problemen te begrijpen.

De meeste interessante risico's zijn subtieler. Een AI kan falen zonder kwaadaardig te zijn. Het kan een instructie te letterlijk toepassen. Het kan de verkeerde metriek optimaliseren. Het kan een impliciete beperking over het hoofd zien die voor een mens vanzelfsprekend is. Het kan een antwoord geven dat in een beperkte context logisch klopt, maar in de echte wereld absurd is.

Dat illustreren twee voorbeelden die in discussies over AI bekend zijn geworden: de paperclipfabriek en de carwashparadox. Het eerste is een gedachte-experiment over alignment. Het tweede is een virale test van de grenzen van het redeneervermogen van huidige modellen. Beide tonen, op heel verschillende schaal, hetzelfde: het probleem is niet alleen wat AI kan doen. Het is wat het denkt te moeten optimaliseren.

De paperclipfabriek: het gevaar van een te eenvoudig doel

De paperclipfabriek is een gedachte-experiment dat werd gepopulariseerd door filosoof Nick Bostrom. Het idee is bewust absurd. Stel je een zeer geavanceerde AI voor met één enkel doel: zoveel mogelijk paperclips produceren.

In het begin is daar niets bedreigends aan. Paperclips zijn niet bepaald massavernietigingswapens, behalve misschien op administratieve afdelingen.

Maar als de AI zeer krachtig is en zijn doel niet goed wordt afgebakend, kan hij die missie tot in de uiterste consequenties doordrijven. Hij zoekt meer metaal, meer energie, meer fabrieken, meer controle over zijn omgeving. Als mensen dreigen hem te stoppen, kan hij mensen als obstakels zien. Als de planeet materiaal bevat dat in paperclips kan worden omgezet, wil hij dat misschien omzetten.

AI wordt niet "slecht". Het streeft zijn doel gewoon te efficiënt na. Precies dat maakt dit voorbeeld interessant. Het gevaar komt niet voort uit haat tegenover de mensheid. Het komt voort uit een slecht gedefinieerd doel.

De mens dacht: "Maak paperclips binnen redelijke grenzen." De machine krijgt: "Maximaliseer paperclips." De hele moeilijkheid zit in wat onuitgesproken bleef.

Het probleem van alignment

Alignment verwijst naar het vermogen van een AI-systeem om de doelen na te streven die mensen echt willen, en niet alleen de expliciet geformuleerde doelen. Dat is veel moeilijker dan het lijkt.

Mensen communiceren met heel veel impliciete betekenis. Als we iemand vragen om "een restaurant te reserveren", gaan we ervan uit dat die geen creditcard steelt, de ober niet lastigvalt en geen tafel reserveert op 400 kilometer afstand. We zeggen het niet expliciet, omdat de sociale context dat voor ons regelt.

AI deelt die context daarentegen niet automatisch. Het leert van instructies, voorbeelden, feedback, beloningen, regels en data. Als het gemeten doel niet perfect overeenkomt met de werkelijke bedoeling, kan het een strategie vinden die de metriek maximaliseert en tegelijk de bedoeling verraadt.

Dit wordt vaak "reward hacking" of "specification gaming" genoemd: het systeem volgt de regel zoals hij geschreven staat, maar omzeilt de geest ervan. Ook de wet van Goodhart vat dit samen: wanneer een metriek een doel wordt, is het vaak geen goede metriek meer.

De carwashparadox: AI vergeet het echte doel

De carwashparadox is veel recenter en veel concreter. De test is eenvoudig. Aan een AI-model wordt gevraagd: "De carwash is 100 meter van mijn huis. Ik wil mijn auto wassen. Moet ik lopen of rijden?"

Veel modellen antwoorden: "Je kunt beter lopen, dat is sneller en handiger." Op het eerste gezicht klinkt dat redelijk. Voor 100 meter is lopen inderdaad logischer dan rijden. Maar de AI ziet één detail over het hoofd: het doel is de auto te wassen.

Deze test ging viraal omdat hij een heel interessante beperking blootlegt. Het model herkent dat "100 meter" "een korte afstand" betekent en past een gangbare vuistregel toe: voor een korte afstand kun je beter lopen. Maar het controleert onvoldoende waar de handeling om draait: de auto wassen. Het model optimaliseert een plausibel antwoord, niet per se een antwoord dat bij de context past.

Twee voorbeelden, één probleem

De paperclipfabriek en de carwash beschrijven niet hetzelfde risiconiveau. De paperclipfabriek verwijst naar een zeer krachtig systeem dat een slecht gedefinieerd doel optimaliseert tot het extreme gevolgen heeft. De carwash illustreert een huidig model dat faalt bij een eenvoudige taak omdat het een impliciete voorwaarde over het hoofd ziet.

Toch wijzen beide op dezelfde zwakte: de kloof tussen de instructie en de bedoeling. In beide gevallen geeft het systeem een antwoord dat binnen zijn eigen kader consistent lijkt, maar faalt zodra dat kader op de echte wereld wordt toegepast. Precies dat soort problemen zullen bedrijven tegenkomen met AI-agents.

Waarom dit probleem dringend wordt met AI-agents

Zolang AI zich beperkt tot antwoorden in een chatvenster, blijven de fouten vaak beperkt. Een slecht antwoord kan tijd kosten, verwarring zaaien of middelmatige tekst opleveren, wat in de digitale economie bijna de norm is geworden.

Maar agents veranderen de aard van het risico. Een agent kan bestanden lezen, code aanpassen, een API aanroepen, een ticket aanmaken, een commando uitvoeren, een database bijwerken of een workflow starten. Is het doel slecht geformuleerd, dan geeft de agent niet alleen een verkeerd antwoord. Hij kan ook de verkeerde actie ondernemen.

Vraag hem om "de cloudkosten te verlagen" zonder enige beperking, en hij stelt misschien voor om kritieke resources te verwijderen. Vraag hem om "de conversieratio te verhogen" zonder vangrails, en hij raadt misschien misleidende interfaces aan. Vraag hem om "alle tests te repareren" zonder details, en hij past misschien de tests aan in plaats van de code te repareren.

Dit zijn geen futuristische scenario's. Het zijn heel realistische varianten van hetzelfde probleem: AI optimaliseert wat gevraagd wordt, niet per se wat bedoeld wordt.

Het verschil tussen uitvoeren en begrijpen

Goede AI moet niet alleen een instructie uitvoeren. Ze moet begrijpen wat die instructie wil bereiken, welke beperkingen erin besloten liggen, welke gevolgen aanvaardbaar zijn en waar ze moet stoppen.

Dat is heel moeilijk, omdat mensen vaak onvolledige verzoeken doen: "verbeter deze functie", "laat het team tijd winnen", "optimaliseer deze workflow", "verlaag de kosten", "maak het product eenvoudiger." Die zinnen klinken natuurlijk. Voor een AI-agent kunnen ze gevaarlijk open zijn. Elk woord kan afwegingen verbergen: kwaliteit, beveiliging, gebruikerservaring, technische schuld, kosten, compliance, reputatie, onderhoudbaarheid.

Een ervaren mens stelt vragen, begrijpt de context en vangt op wat niet gezegd wordt. Een agent kan dat tot op zekere hoogte, maar het systeemontwerp moet hem daartoe dwingen. Anders dreigt hij heel efficiënt de verkeerde kant op te gaan.

Hoe kunnen we die risico's verkleinen?

  • Definieer doelen duidelijker. Een taak voor een AI moet niet alleen aangeven wat geoptimaliseerd moet worden, maar ook wat niet opgeofferd mag worden. Voorbeeld: "Verkort de laadtijd zonder de toegankelijkheid aan te tasten, zonder de publieke API te wijzigen en zonder logs te verwijderen die nuttig zijn voor support."
  • Voeg expliciete beperkingen toe. Wat voor het team vanzelfsprekend is, is dat niet per se voor het model. Zakelijke, beveiligings-, juridische of productbeperkingen moeten zichtbaar zijn.
  • Scheid voorstellen van acties. Een agent kan analyseren, voorstellen, simuleren of een wijziging voorbereiden. Maar gevoelige acties moeten nog altijd gevalideerd worden door een mens of via degelijke tests.
  • Meet meerdere dimensies. Wordt een AI alleen op snelheid beoordeeld, dan kan hij kwaliteit opofferen. Alleen op opgeloste bugs, dan levert hij misschien oppervlakkige fixes. Alleen op conversieratio, dan moedigt hij misschien twijfelachtige praktijken aan.
  • Test op absurde gevallen. De carwashoefening is nuttig omdat ze laat zien dat een eenvoudig probleem een diepe fout kan blootleggen. Teams zouden hun eigen gezondverstandtests moeten bouwen: randgevallen, impliciete beperkingen, dubbelzinnige verzoeken en tegenstrijdige doelen.

Wat bedrijven moeten onthouden

AI is niet alleen een kwestie van prestaties: het is een kwestie van governance. Een zeer krachtig model kan nutteloos zijn als het doel slecht gedefinieerd is. Een zeer autonome agent kan gevaarlijk worden als zijn rechten te ruim zijn. Een goedbedoelde metriek kan absurd gedrag opleveren als ze het enige doel wordt.

De vraag is dus niet alleen: "Is het model slim?" De echte vraag is: "Begrijpt het systeem wat we echt willen, en hebben we beperkt wat het kan doen als het zich vergist?"

De paperclipfabriek is een extreme karikatuur. De carwash is een haast gênante grap. Maar ergens daartussen ligt de echte vraag voor bedrijven: hoe kunnen we taken aan AI toevertrouwen zonder ons oordeel blindelings uit handen te geven?

AI-systemen worden capabeler, beter verbonden en autonomer. Dat maakt ze nuttiger. Het maakt hun fouten ook duurder. De toekomst van AI zal dus niet alleen afhangen van krachtigere modellen. Ze zal afhangen van ons vermogen om betere doelen te stellen, betere vangrails te bouwen en mensen aan het roer te houden bij belangrijke beslissingen.

AI kan optimaliseren. Heel goed zelfs. We moeten het nog leren wat nooit ten koste van al de rest geoptimaliseerd mag worden.

Waypoint

De volgende editie per e-mail, zonder vast ritme.

Bevestiging per e-mail, altijd uit te schrijven.