AI Nauwkeurigheid
Traditionele software is voorspelbaar. Geef dezelfde invoer onder dezelfde omstandigheden en je verwacht dezelfde uitkomst. Bij AI werkt dat anders.

Wanneer is AI goed genoeg?
Een taalmodel voorspelt wat waarschijnlijk het juiste antwoord is. Daardoor kan een AI-oplossing indrukwekkend goed presteren zonder dat iedere uitkomst gegarandeerd correct is. Voor een experiment is dat meestal geen probleem. Voor software die onderdeel wordt van een bedrijfsproces wel. Want wanneer is AI eigenlijk goed genoeg?
95 procent kan uitstekend zijn
Stel dat medewerkers dagelijks duizend documenten handmatig classificeren. AI doet daarvan 95 procent correct. Dat betekent ook dat vijftig documenten verkeerd worden geclassificeerd. Dat klinkt direct als een slechte oplossing. Maar als medewerkers zelf 90 procent correct classificeren, is dezelfde AI ineens een verbetering. Het percentage op zichzelf zegt dus weinig. Je moet weten wat er gebeurt wanneer het model een fout maakt. Een verkeerde categorie die een medewerker later eenvoudig corrigeert heeft een andere impact dan een fout waardoor een betaling, levering of medische handeling verkeerd wordt uitgevoerd.
Niet iedere fout is even belangrijk
Daarom kijken we bij AI liever naar risico dan alleen naar nauwkeurigheid. Voor een interne samenvatting kan 95 procent misschien ruim voldoende zijn. Voor het automatisch wijzigen van kritieke gegevens kan zelfs 99 procent onvoldoende zijn. Dat betekent ook dat niet iedere AI-uitkomst op dezelfde manier behandeld hoeft te worden. Een model kan bijvoorbeeld aangeven hoe zeker het is, waarna onzekere situaties automatisch naar een medewerker gaan. Je kunt belangrijke gegevens met traditionele software controleren of eisen dat een medewerker akkoord geeft voordat een actie daadwerkelijk wordt uitgevoerd. AI hoeft dus niet perfect te zijn om bruikbaar te zijn. De software eromheen moet alleen rekening houden met het feit dat AI niet perfect is.
Testen met echte uitzonderingen
Een demo werkt vaak met voorbeelden waarvan we ongeveer weten wat er gaat gebeuren. De praktijk bestaat juist uit uitzonderingen. Een vreemd opgesteld document. Ontbrekende informatie. Tegenstrijdige gegevens. Een klant die iets compleet anders schrijft dan verwacht. Daarom zegt een AI-demo weinig over betrouwbaarheid in productie. Je moet testen met echte data, uitzonderingen verzamelen en meten waar het model fouten maakt. Niet één keer voordat een toepassing live gaat, maar ook daarna.
Bouw rondom onzekerheid
AI betrouwbaar inzetten betekent daarom niet wachten op een model dat nooit meer fouten maakt. Het betekent bepalen waar fouten acceptabel zijn, waar controles nodig zijn en waar AI überhaupt geen beslissing zou mogen nemen. Soms kan AI een proces volledig uitvoeren. Soms moet het alleen informatie voorbereiden voor een medewerker. En soms is traditionele software simpelweg de betere oplossing. De vraag is dus niet of AI 100 procent betrouwbaar is. Dat is het niet. De vraag is hoeveel zekerheid jouw proces nodig heeft en hoe je de resterende onzekerheid opvangt. Daar begint betrouwbare AI.
Lees ook
Marketingcoordinator bij Wabber B.V.

