Stronniczość AI w diagnostyce: kto ponosi koszty błędu maszynowego
Obietnica i pułapka
Sztuczna inteligencja w medycynie miała zrewolucjonizować diagnostykę: przyspieszyć rozpoznanie choroby, wyeliminować błędy wynikające z przepracowania lekarza, wyrównać szanse między ośrodkami. W praktyce okazało się, że algorytmy nie są neutralne. Uczą się z danych historycznych, a te z kolei zawierają ślady systemowych nierówności. Efekt: modele diagnostyczne mogą działać gorzej u grup, które już wcześniej doświadczały gorszego dostępu do opieki zdrowotnej. Zamiast wyrównywać szanse, AI może pogłębiać dysproporcje.
Dane, które uczą niesprawiedliwości
Podstawowym problemem jest niedoreprezentowanie niektórych populacji w zbiorach treningowych. Ponad połowa opublikowanych modeli klinicznych bazuje głównie na danych z USA i Chin. Pacjenci pochodzący z innych regionów świata, osoby o ciemniejszym kolorze skóry oraz mniejszości etniczne są w tych zbiorach wyraźnie rzadziej reprezentowane. Konsekwencje są mierzalne. Badania opisane w październiku 2025 roku przez analityków rynku medycznego wskazują, że modele do rozpoznania bakteryjnej waginozy generują więcej fałszywie pozytywnych wyników u kobiet pochodzenia latynoamerykańskiego i więcej wyników fałszywie negatywnych u kobiet pochodzenia azjatyckiego, podczas gdy u kobiet białych działają najlepiej. Podobny wzór obserwuje się w dermatologii, gdzie systemy rozpoznawania raka skóry, trenowane głównie na zdjęciach osób o jasnej karnacji, wykazują niższą skuteczność u pacjentów o ciemniejszej skórze.
Czarna skrzynka i brak przejrzystości
Drugi problem ma charakter techniczny. Wiele zaawansowanych algorytmów działa jako tzw. czarne skrzynki: lekarz otrzymuje wynik, ale nie widzi drogi, która do niego prowadzi. W przypadku błędu nie da się więc wskazać, czy przyczyną jest brak danych, błędna waga parametru, czy niezamierzone skojarzenie cechy demograficznej z chorobą. To uniemożliwia skuteczne poprawianie systemu i utrudnia przypisanie odpowiedzialności, gdy pacjent poniesie szkodę z powodu błędnej diagnozy.
FDA i setki zatwierdzonych urządzeń
W Stanach Zjednoczonych Urząd ds. Żywności i Leków (FDA) zatwierdził już setki urządzeń medycznych wykorzystujących sztuczną inteligencję. Jednak znaczna część tych zatwierdzeń opiera się na danych, które nie obejmują pełnej różnorodności demograficznej społeczeństwa. Brak obowiązku raportowania wyników według grup etnicznych czy wiekowych oznacza, że lekarze i pacjenci często nie wiedzą, jak system zachowa się w konkretnym przypadku klinicznym. W efekcie technologia, która miała zredukować ryzyko błędu ludzkiego, wprowadza nowe źródło ryzyka, którego skala jest trudna do oszacowania.
Wartość podejrzliwości
Stronniczość AI w diagnostyce nie jest argumentem za powrotem do wyłącznie ludzkiej oceny. Jest natomiast wezwaniem do krytycznego podejścia: traktowania wyników algorytmu jako jednego z elementów, a nie jako ostatecznego wyroku. Lekarze powinni znać ograniczenia stosowanych narzędzi, a producenci powinni publikować wyniki według grup demograficznych i umożliwiać audyt. Dopóki to się nie stanie, pacjent ponosi ryzyko, którego często nawet nie ma świadomości.