SkinVision test Polteq iQ®: geautomatiseerde, datagedreven robuustheidstesten voor complexe AI-systemen
Hoe test je de robuustheid van een AI-systeem?
SkinVision is een toonaangevende aanbieder van vroegtijdige huidkankerdetectie via mobiele apparaten. Met meer dan 1,2 miljoen gebruikers in ruim 50 landen wereldwijd strijdt SkinVision op grote schaal tegen huidkanker. De mobiele app kan tekenen van melanoom, plaveiselcelcarcinoom, basaalcelcarcinoom en voorstadia van huidkanker herkennen. Tot nu toe heeft SkinVision wereldwijd geholpen bij het opsporen van meer dan 40.000 gevallen van huidkanker.
SkinVision heeft een pilot uitgevoerd met Polteq iQ®; hoe veranderingen in lichtomstandigheden de betrouwbaarheid van AI-beoordelingen beïnvloeden.
Een AI-systeem kan indrukwekkend nauwkeurig zijn. Maar wat gebeurt er als de omstandigheden veranderen? Blijft het systeem dan dezelfde kwaliteit leveren?
Voor SkinVision is dat geen theoretische vraag. De mobiele applicatie van SkinVision helpt gebruikers wereldwijd bij het vroegtijdig herkennen van mogelijke huidkanker. De app analyseert foto’s van huidafwijkingen met behulp van een deep-learningalgoritme en geeft op basis daarvan advies over vervolgstappen.
Met meer dan 1,2 miljoen gebruikers in ruim 50 landen is betrouwbaarheid essentieel. De app moet niet alleen onder ideale omstandigheden goed functioneren, maar ook op verschillende smartphones, bij verschillende huidtypen en onder uiteenlopende lichtomstandigheden.
Daarom wilde SkinVision onderzoeken wat er gebeurt met de nauwkeurigheid van het algoritme wanneer de kleurtemperatuur van het licht verandert.
Van traditionele tests naar grote hoeveelheden data
Bij traditionele software kun je vaak vooraf bepalen welke input je aanbiedt en welk resultaat je verwacht. Bij een deep-learningmodel ligt dat anders. Het systeem werkt probabilistisch en kan op vergelijkbare input verschillende resultaten geven.
Dat maakt het lastig om de robuustheid van een AI-systeem uitsluitend met klassieke testmethoden aan te tonen.
SkinVision schakelde daarom Polteq in voor een pilot met Polteq iQ®, het eigen framework van Polteq voor het gestructureerd en geautomatiseerd testen van AI- en ML-systemen.
Het doel: niet één of enkele scenario’s testen, maar grote hoeveelheden data gebruiken om patronen en verschillen zichtbaar te maken.
In drie dagen van vraag naar inzicht
Tijdens een driedaagse assessment doorliep Polteq samen met SkinVision verschillende stappen:
- analyse van de business requirements;
- opstellen van een passende teststrategie;
- inrichten van een testomgeving;
- koppelen van Polteq iQ® aan een geïsoleerde versie van de SkinVision API;
- uitvoeren van grote aantallen tests met synthetische data;
- verzamelen en analyseren van de resultaten;
- rapporteren en bespreken van de bevindingen met het SkinVision-team.
Door de tests te automatiseren, kon een veel grotere hoeveelheid data worden verwerkt dan met handmatige tests mogelijk zou zijn.
Niet alleen: werkt het? Maar ook: blijft het werken?
Dat is een belangrijk verschil bij het testen van AI.
Bij een traditioneel systeem is een regressietest vaak gericht op de vraag of een wijziging bestaande functionaliteit heeft beïnvloed. Bij AI-systemen wil je daarnaast weten of het gedrag van het model verandert en, belangrijker nog, wat die verandering betekent voor de kwaliteit.
Polteq iQ® maakt het mogelijk om verschillende versies van een AI-systeem met elkaar te vergelijken. Zo wordt zichtbaar welke impact een wijziging heeft op de uitkomsten, voordat een nieuwe versie live gaat.
In de pilot met SkinVision werd deze aanpak gebruikt om de robuustheid van het beoordelingsalgoritme bij variaties in kleurtemperatuur te onderzoeken.
AI testen vraagt om een andere manier van denken
De pilot bevestigde voor zowel SkinVision als Polteq dat het testen van complexe AI-systemen om meer vraagt dan traditionele testgevallen en verwachte uitkomsten.
Wanneer een AI-model leert van data, veranderen ook de risico’s. Denk aan variaties in input, onverwachte uitkomsten, bias en veranderingen in modelgedrag. Om daar grip op te krijgen, zijn gestructureerde, geautomatiseerde en datagedreven testmethoden nodig.
De samenwerking met SkinVision laat zien hoe zo’n aanpak er in de praktijk uitziet: niet alleen beoordelen of een AI-systeem vandaag goed werkt, maar onderzoeken of het ook onder veranderende omstandigheden betrouwbaar blijft.
Van AI ontwikkelen naar AI beheersen
AI maakt softwareontwikkeling sneller. Daarmee wordt de vraag naar aantoonbare kwaliteit alleen maar belangrijker.
Met Polteq iQ® helpt Polteq organisaties om veranderingen in AI-systemen meetbaar te maken en de impact ervan inzichtelijk te krijgen. Zo ontstaat er meer grip op kwaliteit, juist wanneer de technologie zelf steeds minder voorspelbaar wordt.
Meer weten over Polteq iQ® en het testen van AI-systemen? Neem contact met ons op.