ftetoai Op de wachtlijst

Kennisbank

Wat een hermeting laat zien

Een taak die vorig jaar in categorie drie viel — mensenwerk, geen twijfel over mogelijk — kan dit jaar in categorie twee terechtkomen: deels over te nemen, met menselijk toezicht dat goedkeurt of afkeurt met reden. Dat is geen fout in de eerste meting. Het is het gevolg van hoe wij meten, en waarom een uitkomst altijd een momentopname is.

Wat er verandert, en wat niet

Uw bedrijf verandert misschien niet. Maar de acht assen waarop wij een taak beoordelen, doen dat wel, onafhankelijk van uw organisatie. Wij kijken naar gestructureerdheid van de invoer, oordeelsruimte, klantcontact-gevoeligheid, fysieke component, creativiteit, foutkosten, compliance-gevoeligheid en volume/herheling. Van deze acht zijn er twee die het meest onderhevig zijn aan verandering buiten uw bedrijf om: gestructureerdheid van de invoer en oordeelsruimte.

Gestructureerdheid van de invoer verbetert wanneer onderliggende modellen beter worden in het verwerken van rommelige, ongestructureerde tekst — een handgeschreven notitie, een e-mail met drie onderwerpen tegelijk, een telefoongesprek met achtergrondgeluid. Wat vorig jaar te ongestructureerd was om betrouwbaar te verwerken, kan dit jaar binnen bereik liggen. Dat is precies waarom kan AI telefoon beantwoorden en doorverbinden overnemen een ander antwoord geeft dan twee jaar geleden: niet omdat uw telefonie veranderde, maar omdat spraakherkenning en gespreksclassificatie een stap zijn opgeschoven.

Oordeelsruimte verschuift trager, maar ook die as is niet statisch. Naarmate systemen beter worden in het herkennen van grensgevallen — en in het expliciet aangeven wanneer ze twijfelen — verschuift een deel van wat voorheen volledig mensenwerk was naar het gebied waar AI een voorstel doet en een mens beoordeelt. Dat is de kern van categorie twee: niet AI die beslist, maar AI die voorlegt met reden, en een mens die goedkeurt of afkeurt.

Waarom de bandbreedte breed kan zijn

Als twee van de acht assen kunnen verschuiven, en de andere zes betrekkelijk stabiel zijn omdat ze afhangen van de aard van het werk zelf — foutkosten en compliance-gevoeligheid veranderen niet omdat een taalmodel beter wordt — dan is de uitkomst van een meting altijd een combinatie van iets stabiels en iets beweeglijks. Dat vertaalt zich in een bandbreedte, niet in een percentage.

Een brede bandbreedte is geen zwakte in de meting. Het is een eerlijke weergave van onzekerheid die er werkelijk is. Bij een taak als kan AI algemeen e-mailpostvak triageren overnemen hangt de uitkomst sterk af van hoeveel van de binnenkomende e-mail werkelijk ongestructureerd is en hoeveel al een herkenbaar patroon volgt. Een postvak met vooral standaardvragen scoort anders dan een postvak waar de helft van de berichten een unieke situatie beschrijft. Eén label voor "e-mailtriage" bestaat dan ook niet zonder die nuance, en een bandbreedte die dat onderkent is nauwkeuriger dan een schijnbaar precies getal.

Wanneer een uitkomst niets zegt

Er zijn situaties waarin een score op enig moment weinig voorspellende waarde heeft voor volgend jaar. Dat geldt vooral voor taken die dicht op de grens tussen categorie twee en drie liggen, en waarvan de oordeelsruimte sterk afhangt van uitzonderingen die zelden voorkomen maar zwaar wegen. Bij documentbeheer bijvoorbeeld raakt de vraag kan AI documenten archiveren en aan bewaartermijnen toetsen overnemen sterk aan compliance-gevoeligheid: een verkeerde toetsing van een bewaartermijn kan juridische gevolgen hebben die niet in verhouding staan tot hoe vaak de fout voorkomt. Bij zulke taken kan een score dit jaar gunstig uitvallen op basis van technische vooruitgang, terwijl de as foutkosten de doorslag blijft geven en de taak toch in categorie twee of drie blijft hangen.

Een score zegt ook weinig wanneer de onderliggende taakomschrijving te breed is. "Klantcontact" of "administratie" zijn geen taken maar categorieën van taken, en een hermeting daarvan vertelt u vooral dat u de taak verder moet opsplitsen voordat de uitkomst iets betekent.

Wat dit betekent voor herhaalde metingen

Omdat twee van de acht assen beweeglijk zijn, heeft een hermeting na verloop van tijd wel degelijk zin — niet als jaarlijkse formaliteit, maar als reactie op concrete signalen: een nieuwe versie van een onderliggend model, een taak die intussen anders is ingericht, of twijfel die vorig jaar nog niet weg te nemen was. Een hermeting die niets anders doet dan de vorige uitkomst herhalen, was de moeite niet waard; een hermeting die een verschuiving in gestructureerdheid of oordeelsruimte blootlegt, wel.

Deze methode gaat niet over wat een werkgever met die uitkomst doet. Besluiten over personeel en inzet kennen eigen wettelijke vereisten, en die worden hier niet behandeld of onderbouwd.

Wat u nu kunt doen

De gratis quickscan van ftetoai bestaat uit twaalf vragen, zonder account, en geeft een indicatie welk deel van de uren in uw profiel vandaag door AI over te nemen is. De volledige werkscan, die taken op de acht assen afzonderlijk beoordeelt, is nog in aanbouw — die bieden wij hier bewust niet aan, maar de quickscan geeft nu al een eerste richting.

KIPPde assistent van de werkscan

Vraag maar. Ik ken de kennisbank van deze site; wat ik niet weet, zeg ik erbij.

Antwoorden komen uit de kennisbank van deze site. Geen advies op maat, en geen scan van uw bedrijf.