AI w rekrutacji: gdy model wybiera CV mężczyzn 51,9% a kobiet 11,1%
27 testów, jeden wniosek
W kwietniu 2025 roku Brookings Institution opublikował badanie, które po latach dyskusji o przypominanym Amazonie uczyniło bias rekrutacyjny mierzalnym i powtarzalnym. Badaczki Kyra Wilson (University of Washington) oraz Aylin Caliskan (Brookings Center for Technology Innovation) przeprowadziły symulację screeningu CV trzema dużymi modelami językowymi (LLM) i dziewięcioma zawodami — w sumie 27 testów dyskryminacji płci i rasy.
Wynik był jednoznaczny. Mężczyźni i kobiety byli wybierani równie często tylko w 37% przypadków. W pozostałych testach CV z męskimi imionami były faworyzowane w 51,9% przypadków, podczas gdy CV z kobiecymi imionami wygrywały zaledwie w 11,1% przypadków. Bias rasowy był, jak piszą badaczki, jeszcze bardziej wyraźny — szczególnie wobec czarnoskórych mężczyzn.
Metodyka — modele, embeddingi i chi-kwadrat
Badanie nie było ankietą. Badaczki użyły trzech modeli embedding MTE — modeli, które zamieniają tekst (w tym CV) na wektory — i dla każdej z dziewięciu ofert pracy wybrały górne 10% najbardziej podobnych CV. Następnie, używając testu chi-kwadrat na 160 CV na ofertę i 27 testów ogółem, mierzyły, czy płeć i rasa kandydata istotnie wpływają na to, czy jego CV zostaje w puli finalistów.
Tego typu symulacja ma istotną cechę: fakt, że 27 testów dyskryminacji faworyzuje jedną grupę ponad pięć razy częściej niż drugą, nie jest wynikiem jednorazowego biasu pojedynczego promptu, ale stabilną właściwością samych embeddingów — sposobu, w jaki model koduje podobieństwo CV do oferty pracy.
Intersectionality — pierwsza miara tego typu
Wilson i Caliskan podkreślają, że ich badanie jest jedną z nielicznych prób badania tzw. intersectionality — czyli nakładania się wielu kategorii dyskryminacji (płeć + rasa) w kontekście AI i zatrudnienia. To istotne, ponieważ to właśnie na skrzyżowaniu kategorii bias jest najsilniejszy: czarnoskórzy mężczyźni byli w symulacjach wykluczani częściej niż oddzielnie czarnoskórzy kandydaci albo mężczyźni jako całość.
Badaczki rekomendują przy tym recognition of intersectionality jako protected characteristic w audytach AI do screeningu — co wykracza poza dotychczasową praktykę, w której płeć i rasa są badane oddzielnie.
Cyfrowy ślad jako nowy rodzaj biasu
Miesiąc wcześniej, w marcu 2025, Brookings opublikował publicystykę Eduardo Levy Yeyati i Iana Seyala, która rozszerza problem o nową wersję szkód. Piszą o cyfrowych śladach kandydata (digital footprints) jako nowej kolejności danych, których używa AI hiring. To:
- demografia (wiek, płeć, dochód, edukacja, lokalizacja);
- dane behawioralne (historia przeglądania, zapytania, zakupy, użycie urządzenia);
- psychografika (zainteresowania, hobby, styl życia, wartości);
- technografika (typ urządzenia, OS, przeglądarka).
Jak piszą autorzy, algorytmy mogą nawet używać wyboru iPhone vs Android jako proxy do przewidywania „cultural fit”. Skutek: kandydaci z minimalną obecnością online mogą być systematycznie wykluczani. Nie dlatego, że są słabsi, ale dlatego, że algorytm uznał ich cyfrowy ślad za „niepodobny” do innych pracowników firmy.
To odtwarza problem klasycznego redlining, tylko w warstwie cyfrowej. Kto nie kupuje w tym samym sklepie, nie czyta tego samego portalu, nie ma tej samej sieci kontaktów — zostaje filtrowany na wczesnym etapie screeningu, bez możliwości zbadania formalnych kwalifikacji.
Amazon 2015 — precedens nie nauczony
Yeyati i Seyal wprost odwołują się do przypadku Amazon’s failed 2015 recruiting tool — modelu, który Amazon musiał wycofać w 2018 roku, gdy wykryto, że uczył się dyskryminować kobiet na podstawie historycznych, męsko-dominated danych rekrutacyjnych firmy. Ten przypominany przez większość badaczy precedens nie wprowadził jednak legislacyjnej zmiany — pomimo deklaracji firm rekrutacyjnych, kategoria algorithms w HR wciąż nie ma w USA federalnego wymogu bias audits.
Legislacja stanowa i federalny moratorium
W maju 2025 Josie Stewart i Nicol Turner Lee w publicystyce dla Brookings wskazują, że z braku federalnej regulacji, to stany przejęły inicjatywę. Co najmniej 16 stanów uchwaliło w ubiegłym roku bills limitujące wpływ AI na wybory, a równolegle kilka stanów wprowadza przepisy anty-dyskryminacyjne dla AI w zatrudnianiu (m.in. SB 205 Kolorado).
Stewart i Turner ostrzegają jednak, że układana w 2025 roku federalna propozycja moratorium na stanową legislację AI wstrzymałaby oversight privacy i civil rights. W praktyce oznaczałoby to deautomatyzację ochrony anty-dyskryminacyjnej — stanowe przepisy wymuszające audyt algorytmów HR zostałyby zdezawuowane federalnym veto.
Stawka dla rynku pracy jest wyraźna. Badanie Wilson i Caliskan pokazuje, że bias w embeddingach jest stabilny i powtarzalny. Jeśli nie ma wymogu audytu, systemy te trafiają na produkcję i dyskryminują setki tysięcy kandydatów — niewidoczne dla nich samych.
Dlaczego to znaczenie ma dla odbiorcy
Polacy nie wiedzą w kafelkach rekrutacji, że zostali odfiltrowani przez LLM. Większość kandydatów nie wie, że w pierwszym etapie screeningu decyzję podjął embedding model, nie rekruter. Według danych z badania Brookings regularny internet employment screening daje głębokie szkody, gdy w modelu językowym występują asymetrie selekcyjne.
Dlatego Wilson i Caliskan artykuł kończą apelem, że few laws have been passed that require auditing of these systems to ensure they do not discriminate against some applicants. Ich rekomendacje dla polityków obejmują bias audits jako wymóg, scrutiny dla systemów z human-AI collaboration uwzględnieniem intersectionality jako protected characteristic i transparency dla kandydatów odnośnie tego, że AI was used.
To nie prevent innovation — to standardowa praktyka, którą Brookings zaleca dla rynku, który już wielkimi krokami wdraża LLM do screeningu. Po prostu czasie mierzalnym przez badaczy zapobiega się większości przypadków dyskryminacji, jeśli tylko zostaną uznane za obowiązkowe audit-owe.