Onderzoek het doel en de hele route naar een beslissing
Teken de keten uit: wie komt in beeld, welke informatie wordt verzameld, welke score ontstaat en wat doet een medewerker ermee? Een eerlijk rangschikkingsmodel helpt weinig als de vacature alleen bepaalde groepen bereikt. Andersom kan een bruikbare score problematisch worden wanneer medewerkers haar zonder eigen onderzoek als afwijzingsgrond behandelen.
Maak vervolgens het doel toetsbaar. Een voorspelling van ‘lijkt op eerdere succesvolle medewerkers’ is iets anders dan een beoordeling van noodzakelijke functievaardigheden. Vraag wie het trainingslabel heeft vastgesteld en onder welke omstandigheden. Leg ook vast welke beslissingen het systeem niet mag ondersteunen. De HLEG-richtsnoeren behandelen onder meer menselijk toezicht en eerlijkheid; het zijn ethische richtsnoeren, geen bewijs dat een specifieke toepassing aan de wet voldoet.
Zoek vertekening in gegevens, criteria en toegankelijkheid
Controleer welke mensen ontbreken, of voorbeelden actueel zijn en of de registratie voor iedereen hetzelfde betekent. Onderzoek ook schijnbaar neutrale kenmerken. Beschikbaarheid op bepaalde uren, woonafstand of een onderbreking in een loopbaan kunnen voor sommige groepen anders uitwerken. Een correlatie met goede prestaties verklaart nog niet waarom een criterium passend en noodzakelijk is voor de beslissing.
Het College voor de Rechten van de Mens beschrijft dat selectiealgoritmen direct en indirect onderscheid kunnen veroorzaken en dat een werkgever verantwoordelijk blijft voor de eigen procedure. Beoordeel daarom ook of formulieren en tests toegankelijk zijn. Vraag de leverancier om onderbouwing voor uw doelgroep en gebruikssituatie, inclusief bekende beperkingen. Een algemene verklaring dat het product ‘biasvrij’ is, beantwoordt die vragen niet.
Kies maten die het concrete nadeel zichtbaar maken
Leg vóór de test vast wat een fout is. Bij voorselectie kan een onterecht afgewezen geschikte kandidaat een belangrijker nadeel ondervinden dan een ongeschikte kandidaat die toch een gesprek krijgt. Bekijk selectiepercentages én foutpercentages met de juiste noemer. Noteer aantallen naast percentages: een verschil binnen een groep van vijf mensen vraagt een andere interpretatie dan binnen een groep van duizenden.
Vergelijk groepen die voor het doel relevant zijn en onderzoek zo nodig combinaties van kenmerken. Beoordeel onzekerheid, representativiteit en veranderende omstandigheden. Eén gunstige uitkomst is geen permanente vrijwaring. Bepaal vooraf wanneer een verschil aanleiding geeft tot nader onderzoek of tijdelijke stopzetting. Zo voorkomt u dat de acceptatiegrens achteraf naar de beschikbare uitkomst wordt aangepast.
Fictieve casus: een goede totaalscore verbergt gemiste kandidaten
Een fictieve organisatie test een AI-voorselectie op 200 verzonnen kandidaatprofielen: 100 mannen en 100 vrouwen. In beide groepen gelden 80 profielen volgens een afzonderlijke functiegerichte beoordeling als geschikt. Het systeem selecteert 70 mannen en 40 vrouwen, allemaal uit de geschikt beoordeelde profielen. Het verschil zit dus niet in het aantal geschikte mensen dat beschikbaar was, maar in wie het systeem mist.
De onderstaande getallen zijn uitsluitend een rekenvoorbeeld, geen onderzoeksresultaat. Ook de onafhankelijke beoordeling moet in echte situaties op kwaliteit worden onderzocht. In deze casus blijken loopbaanonderbrekingen zwaar mee te wegen. Het team schort automatische voorselectie op, controleert de relevantie van dat criterium en onderzoekt alternatieven. De cijfers signaleren een probleem; zij vervangen niet de juridische beoordeling van eventueel verboden onderscheid.
De tabel is opzij te schuiven.
| Maat | Mannen | Vrouwen | Betekenis |
|---|---|---|---|
| Geselecteerd uit alle profielen | 70 van 100: 70% | 40 van 100: 40% | Dertig procentpunt verschil in toegang tot het gesprek |
| Gemist van de geschikt beoordeelde profielen | 10 van 80: 12,5% | 40 van 80: 50% | Geschikte vrouwelijke profielen worden vaker gemist |
| Geselecteerd van de ongeschikt beoordeelde profielen | 0 van 20: 0% | 0 van 20: 0% | Deze foutmaat alleen zou het hoofdprobleem niet laten zien |
Beoordeel onderscheid en testgegevens afzonderlijk
Laat onderzoeken welke gelijkebehandelingsregels in uw context gelden en of criteria direct of indirect onderscheid maken. Een verschil verklaren is niet hetzelfde als het rechtvaardigen. Een organisatie kan bijvoorbeeld uitleggen waarom een indicator vaak samenhangt met uitval, terwijl het gebruik ervan alsnog ongeschikt of onevenredig is. Een fairness-percentage is daarom geen juridisch keurmerk.
Voor onderzoek wilt u soms groepskenmerken verwerken. Dat vraagt een eigen rechtmatigheidsbeoordeling; het nuttige doel ‘discriminatie voorkomen’ geeft geen onbeperkte toestemming. Bij bijzondere persoonsgegevens zijn naast een grondslag ook de voorwaarden van artikel 9 AVG relevant. Onderzoek beperkte toegang, minimale gegevens, passende bewaartermijnen en alternatieve testvormen. Een fictieve testset kan hypotheses onderzoeken, maar bewijst niet hoe het systeem bij echte mensen presteert.
Kies een maatregel die de oorzaak raakt
Corrigeer de oorzaak in plaats van automatisch alleen de selectiedrempel te wijzigen. Die oorzaak kan liggen in het doel, de trainingsvoorbeelden, een criterium of de gebruikersinstructie. Vergelijk ook oplossingen zonder AI. Een ingreep die een gemiddeld verschil verkleint, kan andere groepen of individuele kandidaten alsnog benadelen.
Menselijke controle vraagt tijd, informatie en bevoegdheid. Een bevestigingsknop is onvoldoende. In de fictieve casus beoordeelt het team tijdelijk alle kandidaten op dezelfde functiecriteria. Het documenteert waarom de eerdere score buiten beschouwing blijft en controleert ook de handmatige werkwijze.
De tabel is opzij te schuiven.
| Optie | Mogelijke winst | Te onderzoeken nadeel |
|---|---|---|
| Criterium verwijderen | Minder invloed van een ongeschikte indicator | Andere variabelen kunnen hetzelfde effect behouden |
| Model opnieuw ontwikkelen | Gerichte verbetering van gegevens en doel | Nieuwe kosten en nog te bewijzen prestaties |
| Functiegerichte menselijke beoordeling | Ruimte voor relevante context | Werkdruk en menselijke vooroordelen vragen controle |
Controleer veranderingen en bied een herstelroute
Leg vast wie modelwijzigingen beoordeelt, hoe u veranderingen in de doelgroep opmerkt en welke signalen medewerkers moeten doorgeven. Houd niet alleen prestaties bij, maar ook klachten, afwijkingen door beoordelaars en gevallen waarin gegevens ontbraken. Maak een vergelijking met eerder onderzochte versies mogelijk. Een nieuwe leverancier of een gewijzigd doel vraagt om een nieuwe beoordeling van de relevante effecten.
Bied mensen een bereikbare route om onjuiste informatie of een onbegrijpelijke uitkomst te laten onderzoeken. Wijs iemand aan die een fout kan herstellen en vergelijkbare gevallen terug kan vinden. Het Algoritmekader noemt onder meer controles en een protocol bij vermoedens van discriminatie. Een dergelijke afspraak krijgt pas betekenis als medewerkers weten wanneer zij moeten ingrijpen en wie daarover beslist.
Wat moet in ieder geval zijn geregeld?
Doel, doelgroep en beslisketen zijn afgebakend.
De betekenis en herkomst van trainingslabels zijn onderzocht.
Selectie, relevante fouten en groepsverschillen worden afzonderlijk gemeten.
De testgegevens worden rechtmatig en beperkt verwerkt.
Technische resultaten en juridische beoordeling zijn niet met elkaar verward.
Maatregelen, stopcriteria en herstel hebben een eigenaar.
Deze uitleg is algemeen en vervangt geen beoordeling van uw specifieke organisatie, wettelijke positie, verwerking of incident.
