Alarm, który nie działał: model sepsy Epic w niezależnych testach
Sepsa, czyli uogólniona reakcja organizmu na zakażenie, zabija rocznie w samych Stanach Zjednoczonych blisko 270 tysięcy osób według Centers for Disease Control and Prevention, a każda godzina opóźnienia w podaniu antybiotyku pogarsza rokowanie. Nic więc dziwnego, że gdy producent oprogramowania medycznego Epic Systems wbudował w swój system dokumentacji elektronicznej model przewidujący rozwój sepsy, setki amerykańskich szpitali chętnie go wdrożyły. Automatyczny alarm, który miał uprzedzać personel o zagrożeniu, brzmiał jak rozsądne uzupełnienie pracy lekarzy. Problem w tym, że nikt poza firmą nie sprawdził, czy alarm faktycznie dzwoni tam, gdzie powinien.
Niezależny egzamin, który model oblał
W czerwcu 2021 roku na łamach „JAMA Internal Medicine” zespół Andrew Wonga i Karandeepa Singha z Uniwersytetu Michigan opublikował wyniki walidacji zewnętrznej tzw. Epic Sepsis Model. Badacze przeanalizowali ponad 38 tysięcy hospitalizacji w swoim ośrodku między grudniem 2018 a październikiem 2019 roku i porównali działanie algorytmu z rzeczywistym przebiegiem choroby. Wyniki były zaskakująco słabe. Pole pod krzywą ROC, miara zdolności rozróżniania chorych od zdrowych, wyniosło 0,63 — wobec wartości od 0,76 do 0,83 deklarowanych przez producenta w materiałach wewnętrznych. Model przy progu ostrzegawczym rekomendowanym przez firmę wykazywał czułość na poziomie 33 procent.
Najbardziej wymowne są dwie liczby. Algorytm nie wychwycił 67 procent przypadków sepsy, mimo że alarmował przy 18 procentach wszystkich hospitalizowanych pacjentów. Innymi słowy: system generował lawinę fałszywych alarmów, a mimo to przepuszczał dwie trzecie osób, które faktycznie zapadały na sepsę. Jak zauważyli autorzy w komentarzu towarzyszącym badaniu, narzędzie identyfikowało jedynie 7 procent pacjentów z sepsą, których przeoczył dotychczasowy nadzór kliniczny — czyli dokładnie tych, dla których miało być wsparciem.
Odpowiedź producenta i cena czarnej skrzynki
Epic Systems zakwestionował sposób prowadzenia testów, twierdząc — jak relacjonowała „Fierce Healthcare” — że próg zastosowany przez badaczy nie był odpowiednio dostosowany do realnych warunków klinicznych, a wzory i parametry modelu są dostępne administratorom szpitali do własnych sprawdzeń. Ta odpowiedź jednak sama w sobie ilustruje istotę problemu: ciężar weryfikacji spadał na klientów, którzy kupowali gotowe narzędzie właśnie po to, by nie musieli budować własnego. Model był sprzedawany jako element kompleksowego systemu, a jego skuteczność opierała się na danych wewnętrznych firmy i pojedynczej prezentacji konferencyjnej przygotowanej wspólnie z jednym ośrodkiem zdrowia.
Warto podkreślić, co nie zawiodło: sami lekarze. W badaniu z Michigan to standardowa praktyka kliniczna wyłapywała przypadki, których nie widział algorytm. Ryzyko polegało na tym, że szpital, który uzna alarmy za wystarczające zabezpieczenie, może osłabić czujność personelu — a wtedy pominięta sepsa staje się dosłownie śmiertelnym błędem systemu.
Druga twarz: zmęczenie alarmami
Słaba czułość to tylko połowa historii. Drugą jest nadmiar ostrzeżeń. Badanie opublikowane w listopadzie 2021 roku w „JAMA Network Open” objęło 24 szpitale z czterech sieci medycznych i wykazało, że w pierwszych tygodniach pandemii COVID-19 dzienna liczba alarmów sepsy wzrosła średnio o 43 procent — podczas gdy liczba hospitalizowanych spadła o 35 procent. Już w kwietniu 2020 roku Uniwersytet Michigan całkowicie wstrzymał alarmy modelu po zgłoszeniach pielęgniarek o ich nadmiarze. Zmęczenie ostrzeżeniami to realne zagrożenie kliniczne: gdy personel codziennie odbiera dziesiątki fałszywych alarmów, przestaje reagować również na te prawdziwe. Paradoksalnie więc model, który rzadko wskazywał właściwego pacjenta, jednocześnie zasypywał oddziały sygnałami, które utrudniały pracę.
Czego uczy ta historia
Wnioski sformułowane w redakcji „JAMA Internal Medicine” stały się od tego czasu kanonem dyskusji o algorytmach medycznych. Po pierwsze, walidacja wewnętrzna na danych producenta nie wystarcza — konieczne są niezależne badania na innych populacjach, zanim narzędzie trafi do szerokiego stosowania. Po drugie, działanie modelu trzeba stale monitorować po wdrożeniu, bo jego skuteczność zmienia się wraz ze zmianami profilu pacjentów i praktyk lekarskich. Po trzecie, instytucje nadzoru powinny przyglądać się komercyjnym algorytmom przed masowym wdrożeniem, a nie dopiero po zgłoszeniach problemów. Amerykańska agencja FDA dopracowuje od lat ramy regulacyjne dla oprogramowania opartego na sztucznej inteligencji, ale w chwili wdrażania modelu sepsy takie narzędzia mogły trafić do szpitali bez żadnego niezależnego przeglądu.
Dla zarządów szpitali i zespołów zakupowych praktyczna lista kontrolna jest krótka. Przed wdrożeniem jakiegokolwiek predykcyjnego narzędzia klinicznego należy żądać publikacji naukowych potwierdzających skuteczność na populacji podobnej do lokalnej, ustawić własne raportowanie fałszywych trafień i pomyłek, wyznaczyć zespół odpowiedzialny za bieżące monitorowanie działania oraz zachować możliwość natychmiastowego wyłączenia alarmów — tak jak zrobił to Uniwersytet Michigan. Pacjenci i rodziny mogą z kolei pamiętać, że automatyczne ostrzeżenie w systemie szpitalnym to tylko jeden z wielu sygnałów i nigdy zastępcza diagnoza; uporczywe pogorszenie stanu chorego zawsze wymaga bezpośredniej rozmowy z lekarzem.
Historia modelu sepsy Epic pokazuje, że nawet najbardziej rozpowszechnione narzędzie może nie zdać egzaminu, gdy zostanie poddane uczciwemu testowi. Technologia predykcyjna w medycynie zasługuje na te same rygory, co lek: dowody skuteczności, niezależną weryfikację i stały nadzór. Dopóki tego brakuje, każdy alarm generowany przez algorytm pozostaje jedynie sugestią — a życie pacjentów nie powinno zależeć od sugestii, których nikt nie sprawdził.