Onderzoek toont winst, maar geen magie
In een experiment met 758 consultants leverde generatieve AI binnen de gemeten capability frontier sneller en hoger beoordeeld werk op. Buiten die frontier kon AI de prestatie juist verlagen. De relevante les is dus niet dat kenniswerk als geheel automatiseerbaar is, maar dat taakfit doorslaggevend is.
Een NBER-veldexperiment bij 7.137 kenniswerkers in 66 organisaties vond dat actieve gebruikers in de tweede helft van het experiment twee uur minder per week aan e-mail besteedden en minder buiten reguliere uren werkten. De onderzoekers vonden daarnaast geen verschuiving in de hoeveelheid of samenstelling van taken. Toegang tot een copilot verandert een operating model kennelijk niet vanzelf.
Breng de echte waardestroom in kaart
Een kennisdienst bestaat zelden alleen uit schrijven. Er is acquisitie, intake, dossieropbouw, brononderzoek, analyse, besluitvorming, productie, review, uitleg, opvolging en facturatie. Meet per stap wachttijd, bewerkingstijd, herwerk, foutimpact en benodigde expertise. Dan wordt zichtbaar waar AI werkelijk doorstroming verbetert en waar een lokaal snellere taak alleen een volgende bottleneck creëert.
Ontwerp daarna de overdrachten weg. Laat gestructureerde intake direct de dossiercontext vormen, laat bronbewijs bij iedere claim blijven en geef correcties terug aan evaluaties en templates. De producteenheid is niet de AI-output, maar het gecontroleerde klantresultaat inclusief herkomst, beslissing en opvolging.
- Welke klantuitkomst wordt gekocht—document, beslissing, uitvoering of zekerheid?
- Welke informatie wordt meerdere keren opnieuw geïnterpreteerd of ingevoerd?
- Waar wacht werk op een expert, klant of extern systeem?
- Welke fouten zijn goedkoop herstelbaar en welke veranderen rechten, geld of reputatie?
Ontwerp rollen rond uitzonderingen en bewijs
Wanneer AI eerste versies, classificatie of dossiervergelijking versnelt, wordt expertcapaciteit waardevoller op andere plekken. Senior professionals definiëren kwaliteitsnormen, beoordelen moeilijke uitzonderingen, leggen trade-offs uit en verbeteren het systeem met terugkerende foutpatronen. Juniors hebben juist oefen- en feedbacklussen nodig; alleen AI-output accepteren bouwt geen domeinmodel op.
Maak zichtbaar welke rol iedere stap heeft: eigenaar, uitvoerder, reviewer en escalation owner. Een generiek 'human in the loop' is te vaag. De mens moet weten wat is veranderd, welk bewijs ontbreekt en welke consequentie goedkeuring heeft. Zonder dat wordt review een snel ritueel in plaats van werkelijke controle.
Kenniswerk vraagt domeinspecifieke betrouwbaarheid
Juridisch onderzoek maakt de grens scherp zichtbaar. Stanford vond bij publieke modellen hoge foutpercentages op verifieerbare rechtsvragen; ook gespecialiseerde juridische RAG-tools bleven in een latere evaluatie fouten maken. In 2026 liet onderzoek op multi-jurisdictionele regelgeving tegelijk zien dat een zorgvuldig ontworpen specialistisch systeem beduidend beter kan presteren dan standaard-RAG en geteste commerciële systemen.
De conclusie is niet dat legal AI onbruikbaar is, maar dat retrieval alleen geen garantie is. Brondekking, temporele geldigheid, jurisdictie, redeneerstappen, citatiecontrole en gekwalificeerde review vormen samen het product. Hetzelfde geldt voor finance, zorg, compliance en andere kennisverticals.
Meet het bedrijfsmodel, niet alleen de modelscore
Volg kwaliteit per taaktype, benodigde reviewminuten, doorlooptijd, first-time-right, klantcorrecties en kosten per afgerond resultaat. Voeg een frontier-register toe: waar presteert het systeem aantoonbaar, waar alleen met review en waar nog niet? Nieuwe modellen of prompts veranderen die grens en moeten tegen dezelfde cases worden vergeleken.
Een AI-native kennisbedrijf ontstaat wanneer prijs, servicebelofte, teams en software op die nieuwe waardestroom aansluiten. Mogelijke uitkomsten zijn snellere vaste levertijden, continu beschikbare service, kleinere expertteams met meer bereik of een productized service die eerst economisch onmogelijk was. De innovatie zit in de combinatie—niet in een chatbot naast het oude proces.