🩺 AI Zorgchatbot Lab
Een casestudy-simulatie van een zorgintake-chatbot: pas de betrouwbaarheidsdrempel aan voor escalatie naar een menselijke verpleegkundige en zie de afweging tussen veiligheid en werklast verschuiven.
Casestudy: beslissen wanneer een AI moet overdragen aan een mens
Deze casestudy simuleert een patiëntintake-chatbot die wordt gebruikt om symptoommeldingen te triageren op urgentie voordat er ooit een mens bij betrokken raakt. In de meeste gevallen is het systeem zeker genoeg van zijn eigen triagebeslissing om er direct naar te handelen. Bij dubbelzinnige of hoog-risico gevallen moet het in plaats daarvan escaleren naar een menselijke verpleegkundige in plaats van een autonome beslissing te riskeren.
De implementatievraag die de uitkomsten daadwerkelijk bepaalt, is waar de betrouwbaarheidsdrempel voor die escalatie wordt ingesteld. Zet hem laag, en het systeem escaleert agressief, veiliger voor patiënten maar duurder in verpleegkundigentijd en langzamer voor de meerderheid van eenvoudige gevallen. Zet hem hoog, en het systeem automatiseert meer gevallen, goedkoper en sneller, maar riskeert het behandelen van sommige werkelijk risicovolle gevallen zonder menselijke beoordeling, omdat het vertrouwen van een model niet altijd een perfect betrouwbaar signaal is van of een geval daadwerkelijk veilig is.
Deze lab simuleert 500 intake-gevallen met een gemodelleerde kloof tussen het opgegeven vertrouwen van de chatbot en de werkelijke onderliggende veiligheid van elk geval, zodat je direct kunt zien hoeveel risicovolle gevallen bij verschillende drempelinstellingen door glippen, niet alleen hoeveel gevallen worden geëscaleerd.
Veelgestelde vragen
Waarom zou een AI-systeem escaleren naar een mens in plaats van zelf te beslissen?
Wanneer het vertrouwen van een model in zijn eigen beslissing laag is, of de beslissing is hoog-risico, vermindert escaleren naar een menselijke beoordelaar het risico dat een autonoom systeem een kostbare of gevaarlijke fout maakt.
Is modelvertrouwen een perfect betrouwbaar veiligheidssignaal?
Nee — modellen kunnen overmoedig zijn bij gevallen die daadwerkelijk risicovol zijn, wat verklaart waarom zorgsystemen en andere hoog-risicosystemen doorgaans betrouwbaarheidsdrempels combineren met extra veiligheidscontroles in plaats van alleen op vertrouwen te vertrouwen.
Wat is de afweging bij het kiezen van een escalatiedrempel?
Een lagere drempel escaleert meer gevallen naar mensen, wat de veiligheid verbetert ten koste van meer menselijke werklast en langzamere respons voor routinegevallen; een hogere drempel automatiseert meer maar riskeert onvoldoende beoordeling van werkelijk risicovolle gevallen.
Waarom wordt dit gepresenteerd als een zorgspecifieke casestudy?
Zorgtriage is een domein waar de kosten van een gemiste escalatie ongewoon hoog zijn, wat de afweging tussen veiligheid en werklast bijzonder concreet en consequentieel maakt.
Hoe zou een echt systeem deze drempel valideren?
Echte implementaties valideren doorgaans tegen historische uitkomsten met klinisch toezicht, monitoren escalatiepercentages en gemiste-gevallen-percentages in productie, en passen de drempel conservatief aan op basis van waargenomen prestaties.
500 gesimuleerde intake-gevallen hebben elk een modelvertrouwenswaarde en een gecorreleerde maar ruizige werkelijke-veiligheidswaarde, wat weerspiegelt dat modelvertrouwen een imperfecte proxy is voor werkelijke gevalveiligheid. De drempelschuif bepaalt welke gevallen automatisch worden afgehandeld versus geëscaleerd, en de uitkomsttellingen worden live herberekend door de werkelijke-veiligheidswaarden van automatisch afgehandelde gevallen te vergelijken met een vaste gevarenlijn.
Canvas 2D · vanilla JavaScript · 60 FPS target · runs fully client-side, no install