Wycofane z klinik: kiedy urządzenia diagnostyczne AI zawodzą u pacjenta

Wycofane z klinik: kiedy urządzenia diagnostyczne AI zawodzą u pacjenta

Rejestry wycofań mówią więcej niż broszury producentów

Sztuczna inteligencja wchodzi do szpitali w tempie, któremu trudno nadążyć nawet regulatorom. Amerykańska Agencja ds. Żywności i Leków (FDA) prowadzi oficjalny rejestr urządzeń medycznych wykorzystujących algorytmy uczenia maszynowego — według stanu na koniec września 2025 roku obejmował on ponad 1200 pozycji, z czego zdecydowana większość to narzędzia radiologiczne wspierające ocenę zdjęć rentgenowskich, tomografii czy rezonansu. Ten sam rejestr, zestawiony z bazami zdarzeń niepożądanych i wycofań, rysuje obraz mniej chwytliwy marketingowo: część tych produktów zawodzi już po dopuszczeniu do obrotu.

Skala zjawiska da się oszacować dzięki analizom publicznych danych. Analiza opublikowana na łamach JAMA Network Open objęła kohortę 903 autoryzowanych przez FDA urządzeń z AI i wykazała, że wycofania dotyczyły kilku procent tej populacji, a ryzyko było wyraźnie wyższe tam, gdzie brakowało publicznie dostępnych badań skuteczności klinicznej — urządzenia bez takich badań cofano z rejestru kilkukrotnie częściej niż te z pełną dokumentacją. Z kolei zespół badaczy, który przejrzał dane niemal tysiąca radiologicznych urządzeń AI dopuszczonych od 1995 roku, odnalazł w bazie FDA ponad sto raportów o wycofaniach związanych z wadami oprogramowania, a także zgłoszenia zdarzeń niepożądanych, w tym pojedyncze ze skutkiem śmiertelnym.

Dlaczego model, który zdał egzamin, zawodzi u łóżka pacjenta

Mechanizm zagrożenia jest właściwy dla uczenia maszynowego, a nie dla klasycznej techniki medycznej. Algorytm diagnostyczny uczy się na zbiorze zdjęć z konkretnych aparatów, konkretnych populacji i konkretnych protokołów pracy. W momencie, gdy trafia do innego szpitala — z innymi skanerami, innym składem pacjentów, innym stylem dokumentowania badań — jego skuteczność może cicho spadać. Specjaliści nazywają to dryfem modelu: narzędzie formalnie działa, ale przestaje trafnie klasyfikować. W przeciwieństwie do pękniętej końcówki cewnika ten defekt jest niewidoczny gołym okiem, a jednocześnie potrafi prowadzić do przeoczonych rozpoznań nowotworów czy krwotoków.

Badania regulacyjne potwierdzają, że najczęstszym czynnikiem wycofań nie są awarie sprzętu, lecz problemy związane ze sposobem użytkowania oraz niedostateczna informacja — użytkownik kliniczny źle interpretuje wskazanie systemu albo nie wie, kiedy jego odpowiedzi są niewiarygodne. To istotna różnica względem tradycyjnych wyrobów medycznych, gdzie dominują wady mechaniczne czy baterie. Oprogramowanie diagnostyczne wymaga więc innego rodzaju nadzoru: ciągłego monitorowania jakości pracy, a nie jednorazowego testu przed rejestracją.

Luka w nadzorze i pierwsze próby jej zasypania

Analiza danych FDA wskazuje też na słabe ogniwo procesowe: większość producentów nie utrzymuje zamkniętego obiegu informacji między zgłaszanymi zdarzeniami, wycofaniami i aktualizacjami oprogramowania. Zdarzenie niepożądane rzadko prowadzi wprost do szybkiej poprawki, a poprawka nie zawsze jest wiązana z konkretną awarią. Regulator zdaje sobie z tego sprawę — FDA konsultowała zasady pomiaru rzeczywistej skuteczności systemów AI po wprowadzeniu do obrotu i rozwija mechanizm tzw. ustalonych planów kontroli zmian, pozwalający producentom modyfikować algorytm w określonych ramach bez każdorazowej ponownej rejestracji. Na razie jednak korzysta z niego garstka firm, co oznacza, że luka pozostaje szeroka.

Dla pacjenta skutki bywają wymierne: fałszywie uspokajający wynik analizy obrazu, opóźniona diagnoza, niepotrzebne badania powtórzone z powodu błędnych flag systemu. Dla personelu medycznego — dodatkowe obciążenie polegające na konieczności ciągłej weryfikacji podpowiedzi maszyny, której granice kompetencji nie są jasno opisane.

Jak chronić pacjentów i placówkę

Szpitale i przychodnie mogą wiele zrobić na własną rękę. Przed zakupem warto żądać dowodów walidacji klinicznej na populacji podobnej do własnych pacjentów, a nie tylko metryk z czasów rejestracji. Po wdrożeniu — prowadzić własny, choćby uproszczony monitoring zgodności wskazań algorytmu z ocenami lekarzy, aby wychwycić spadek jakości, zanim zrobi to rejestr wycofań. Kluczowe jest również szkolenie personelu: każdy powinien wiedzieć, że system wspiera decyzję, ale jej nie zastępuje, oraz które sytuacje wymagają szczególnej ostrożności. Pacjenci zaś mają prawo pytać, czy i jakie narzędzia AI uczestniczyły w ocenie ich badań.

Wycofania urządzeń diagnostycznych z AI nie są argumentem przeciwko technologii — są dowodem, że medycyna uczy się zarządzać jej ryzykiem. Warunkiem jest jednak uczciwe uznanie, że dopuszczenie do obrotu to początek odpowiedzialności, a nie jej koniec.

Więcej w tym temacie

Czytaj dalej

Upadek medycznego jednorożca: dlaczego zawiodła sztuczna inteligencja do triage'u

Upadek medycznego jednorożca: dlaczego zawiodła sztuczna inteligencja do triage'u

Halucynacje AI w medycynie: kiedy algorytm zmyśla diagnozę

Halucynacje AI w medycynie: kiedy algorytm zmyśla diagnozę

Błędy AI w radiologii: gdy algorytm myli diagnozę, której radiolog by nie popełnił

Błędy AI w radiologii: gdy algorytm myli diagnozę, której radiolog by nie popełnił

Alarm, który nie działał: model sepsy Epic w niezależnych testach

Alarm, który nie działał: model sepsy Epic w niezależnych testach