Wat als het antwoord niet meer het moeilijke deel is?

Gisteren maakte mijn LLM-tool een klein foutje.

Ik had een foto gedeeld van een handgeschreven reflectie. De tool las één woord verkeerd en gebruikte die verkeerde lezing vervolgens in de reflectie die het voor mij schreef.

Ik corrigeerde het.

De tool keek opnieuw naar de foto en kwam vrij overtuigd met een andere interpretatie.

Ook fout.

Op zichzelf niet zo spannend. Mijn handschrift is niet altijd even makkelijk te lezen en uiteindelijk ging het maar om één woord.

Maar wat daarna gebeurde was ook erg interessant.

Het probleem was namelijk niet dat mijn LLM-tool geen goed verhaal kon maken.

Het probleem was juist dat het dat wel kon.

De reflectie was logisch. De verbanden klonken aannemelijk. De tekst liep lekker. Als ik niet beter had geweten, was er weinig reden geweest om eraan te twijfelen.

Alleen was een stukje van het verhaal gebouwd op iets wat ook weer niet klopte.

Een plausibele output is nog geen betrouwbare output.

De fout zat vóór het antwoord

We kijken bij AI vaak naar het eindproduct.

Klopt het antwoord? Werkt de code? Is de samenvatting goed? Heeft de test het juiste resultaat?

Logische vragen.

Maar vóór ieder antwoord gebeurt iets anders.

Er wordt iets waargenomen. Er wordt betekenis aan gegeven. Er wordt bepaald wat relevant is. Mogelijkheden worden afgewogen. Er wordt gekozen.

En pas daarna krijgen wij het antwoord te zien.

Bij mijn handgeschreven reflectie ging het al bij de eerste stap mis: de tool had niet goed waargenomen wat er stond.

Wat daarna gebeurde, was eigenlijk best goed.

En precies dát maakt het interessant.

Een systeem dat iets verkeerd waarneemt en daarna onzin produceert, valt snel door de mand.

Een systeem dat iets verkeerd waarneemt en daarna een overtuigend verhaal produceert, is een stuk lastiger.

Niet meteen invullen

Het gekke is dat ik dezelfde gedachte de laatste tijd op heel andere plekken tegenkom.

Bijvoorbeeld wanneer ik een training geef.

Als trainer is het verleidelijk om een stilte op te vullen. Je kent de stof. Je ziet waar het gesprek naartoe kan. Vaak heb je het antwoord al klaar.

Maar juist door even niets te zeggen, kan er iets anders gebeuren.

Iemand stelt een vraag die je zelf niet had bedacht. Een deelnemer formuleert het anders. Er ontstaat interactie in plaats van alleen kennisoverdracht.

Het interessante zit dan niet in het antwoord.

Het zit in de ruimte ervoor.

Ook in mijn eigen reflecties probeer ik daar bewuster mee om te gaan. Eerst kijken wat er eigenlijk gebeurt. Niet iedere observatie onmiddellijk omzetten in een conclusie, actie of verbeterpunt.

Sommige dingen mogen even blijven liggen.

En toen ging AI software bouwen

Diezelfde vraag kwam terug in een experiment waarin ik met AI software ben gaan ontwikkelen.

In eerste instantie is dat vooral fascinerend.

Je beschrijft wat je wilt. AI helpt requirements uitwerken. Er verschijnt code. Functionaliteit wordt toegevoegd. Tests worden uitgevoerd. Documentatie ontstaat.

De voor de hand liggende vraag is:

Kan AI dit?

Steeds vaker is het antwoord: behoorlijk veel.

Maar juist toen het bouwen makkelijker werd, begonnen andere vragen me meer te interesseren.

Waarom voeren we eigenlijk deze test uit?

Wie heeft bepaald wat belangrijk genoeg is om te testen?

Wat bewijst een geslaagde test werkelijk?

En als AI de code schrijft, vervolgens een test bedenkt, die test uitvoert en daarna concludeert dat het resultaat voldoende is — waar vond dan het onafhankelijke oordeel plaats?

Langzaam verschoof voor mij de vraag.

Niet alleen: wat kan AI overnemen?

Maar ook: wat neemt AI eigenlijk over?

Waar zat het menselijke oordeel?

Een workflow bestaat namelijk niet alleen uit handelingen.

Er zitten ook momenten in waarop iemand waarneemt, interpreteert, twijfelt, afweegt en besluit.

Wie bepaalde wat belangrijk was?

Wie zag dat iets afwijkends misschien relevant was?

Wie besloot dat het beschikbare bewijs voldoende was?

Wie zei: hier weet ik eigenlijk nog te weinig van?

Wanneer we zo’n workflow automatiseren, automatiseren we daarom mogelijk meer dan alleen werk.

We kunnen ongemerkt ook een stukje menselijk oordeel automatiseren.

Dat hoeft helemaal niet verkeerd te zijn. Als een machine iets aantoonbaar beter, sneller en consistenter kan uitvoeren, hoeven we daar niet uit principe een mens tussen te zetten.

Maar een handeling automatiseren is iets anders dan het oordeel dat erin verscholen zit overdragen.

Daarom zijn voor mij twee vragen uit elkaar gaan lopen:

Kan AI deze stap betrouwbaar uitvoeren?

en:

Willen we het oordeel in deze stap aan AI overdragen?

Die lijken op elkaar.

Maar het zijn totaal verschillende vragen.

Een mens bij de knop

We lossen dat graag op met human in the loop.

Er blijft een mens betrokken. Probleem opgelost.

Maar stel dat AI de informatie verzamelt, interpreteert wat relevant is, mogelijkheden afweegt, een conclusie formuleert en vervolgens een voorstel presenteert.

Daarna verschijnt bij een mens:

Approve?

Formeel zit er een mens in de loop.

Maar hoeveel menselijk oordeel hebben we werkelijk behouden?

Misschien moeten we daarom minder kijken naar of er ergens een mens in het proces zit en meer naar waar het menselijke denken en beslissen daadwerkelijk plaatsvindt.

Dat is een subtiel verschil.

Maar naarmate AI meer kan, wordt het volgens mij een steeds belangrijker verschil.

Als antwoorden goedkoop worden

Daarmee kom ik bij iets wat misschien nog groter is.

Veel kenniswerk is lange tijd georganiseerd geweest rond het vermogen om goede antwoorden te produceren.

De trainer weet wat hij moet uitleggen.

De consultant weet wat verstandig is.

De programmeur weet hoe iets gebouwd moet worden.

De kwaliteitsprofessional weet waar hij naar moet kijken.

Kennis en ervaring maken dat je sneller tot een goed antwoord komt.

Maar AI verandert daar iets aan.

Antwoorden produceren wordt steeds goedkoper.

Niet foutloos. Niet zonder risico. En zeker niet zonder menselijk toezicht.

Maar wel snel, overtuigend en op enorme schaal beschikbaar.

Misschien verschuift daardoor ook wat menselijke expertise waardevol maakt.

Niet alleen het antwoord weten.

Maar goed kijken voordat je antwoordt.

Merken dat iets niet klopt.

Onderscheid maken tussen wat je werkelijk weet en wat je ervan maakt.

Begrijpen welk bewijs een conclusie ondersteunt — en welk bewijs niet.

Een stilte niet onmiddellijk opvullen.

Twijfel herkennen als nuttige informatie.

En misschien vooral:

weten wanneer je nog niet genoeg hebt gezien om een antwoord te mogen geven.

Misschien zit dáár het vakmanschap

Ik kom die gedachte inmiddels op verrassend veel plekken tegen.

In een training.

In kwaliteitsmanagement.

Tijdens het bouwen van software met AI.

En zelfs tijdens een persoonlijke reflectie aan het einde van een gewone dag.

Steeds vaker kan technologie het antwoord produceren.

Misschien wordt daardoor het moment vóór het antwoord interessanter.

Het moment waarop je kijkt.

Nog een vraag stelt.

Iets niet invult.

Twijfelt.

Of besluit dat het beschikbare bewijs nog niet genoeg zegt.

Misschien zit juist daar een deel van wat we menselijk oordeel noemen.

En daarmee blijf ik voorlopig met één vraag zitten:

Wat gebeurt er met menselijk oordeel wanneer het antwoord niet langer het moeilijke deel is?

Ik heb daar nog geen definitief antwoord op. Maar daar ga ik zeker nog mee aan de slag.