Upadek medycznego jednorożca: dlaczego zawiodła sztuczna inteligencja do triage'u
Kiedy latem 2023 roku brytyjska spółka Babylon Health trafiła pod zarząd komisaryczny, a jej amerykańskie oddziały rozpoczęły postępowanie likwidacyjne, media branżowe zgodnie przywoływały dawną wycenę firmy: ponad 4 miliardy dolarów po debiucie giełdowym w Nowym Jorku. Niecałe dwa lata później pozostałości spółki zmieniły właściciela za ułamek tej kwoty. Historia Babylona to jednak nie tylko opowieść o pęknięciu kolejnej bańki technologicznej. To przede wszystkim studium tego, jak obietnice dotyczące sztucznej inteligencji potrafią wyprzedzać dowody naukowe — i kto ponosi za to konsekwencje.
Obietnica: algorytm lepszy od lekarza
W czerwcu 2018 roku Babylon ogłosił z dużym rozgłosem, że jego chatbot służący do wstępnej oceny objawów uzyskał wynik zbliżony do 80 procent w zadaniach wzorowanych na egzaminie członkowskim Królewskiego Kolegium Lekarzy Rodzinnych, podczas gdy siedmiu praktykujących lekarzy osiągnęło rezultaty w przedziale od 64 do 94 procent. Jak relacjonowała wtedy BBC, firma sugerowała, że jej algorytm diagnozuje na poziomie porównywalnym z lekarzem, a założyciel przedsiębiorstwa Ali Parsa zapowiadał w tamtym okresie, że technologia będzie o rząd wielkości dokładniejsza od jakiegokolwiek człowieka w białym fartuchu.
Kontrargumenty pojawiły się błyskawicznie. W listopadzie 2018 roku na łamach „The Lancet” badacze Hamish Fraser, Enrico Coiera i David Wong ocenili, że przedstawione studium nie daje przekonujących dowodów na przewagę systemu nad lekarzami w jakiejkolwiek realistycznej sytuacji, a jest wręcz możliwe, że radzi on sobie znacząco gorzej. Naukowcy wskazali na słabość metodologiczną: w teście odpowiedzi wpisywali lekarze, a nie zwykli użytkownicy aplikacji, którzy w rzeczywistości opisują objawy nieprecyzyjnie i chaotycznie. Rok wcześniej reklamy usługi GP at Hand zostały zresztą uznane przez nadzór reklamowy za wprowadzające w błąd, o czym informowała BBC.
Ostrzeżenia regulatora, które przyszły zbyt wcześnie
Sprawą zajmowali się także brytyjscy regulatorzy. Już w 2017 roku Komisja Jakości Opieki (CQC) sporządziła krytyczny raport o działalności spółki; firma próbowała wytoczoną w sądzie drogą zablokować jego publikację, ale przegrała i musiała pokryć koszty postępowania. Głośniejsza okazała się jednak korespondencja agencji MHRA, odpowiedzialnej za nadzór nad wyrobami medycznymi. W liście z grudnia 2020 roku, ujawnionym przez czasopismo HSJ, dwaj wysocy urzędnicy agencji napisali do konsultanta onkologii Davida Watkinsa, który od lat dokumentował nieprawidłowości chatbota, że jego zastrzeżenia są zasadne i że regulator je podziela.
Watkins twierdził, w tym w materiałach dla TechCrunch i „The Independent”, że narzędzie potrafiło bagatelizować objawy poważnych schorzeń, w tym sygnały zawału serca. Co istotne, sam MHRA przyznał w tej korespondencji, że część problemów wykracza poza obowiązujące przepisy: chatbot klasyfikowany jako wyrób medyczny klasy I podlega jedynie samodzielnej rejestracji producenta, bez niezależnej oceny przed dopuszczeniem do obrotu. Pacjent korzystający z aplikacji nie miał więc gwarancji, że ktokolwiek poza samą firmą sprawdził jej bezpieczeństwo kliniczne.
Od jednorożca do sprzedaży resztek
Przez pewien czas rynek ignorował te sygnały. W październiku 2021 roku Babylon wszedł na nowojorską giełdę w ramach fuzji ze specjalnym pojazdem inwestycyjnym, co przyniosło wycenę rzędu 4,2 miliarda dolarów. Kurs natychmiast poszedł w dół, a sam Parsa określił później decyzję o wejściu na giełdę jako niewiarygodną, kompletną katastrofę. Firma traciła pieniądze na każdej obsłużonej pacjentce i pacjencie, zwalniała pracowników, a w sierpniu 2023 roku dwa amerykańskie podmioty grupy wystąpiły o likwidację z windykacją majątku. Pod koniec sierpnia brytyjska część trafiła pod zarząd komisaryczny firmy Alvarez & Marsal, która niemal natychmiast sprzedała kluczowe aktywa — w tym telemedyczną praktykę obsługującą setki tysięcy osób w ramach umów z Bupą — spółce eMed Healthcare. Jak podał TechCrunch, serwis GP at Hand nie wszedł do transakcji i działał dalej. Według „Forbesa” grupa wycofywała się też z Rwandy, gdzie dostępność opieki mogło zachwiać dla milionów ludzi.
Lekcje dla health-techu
Ta historia ma wymiar wykraczający poza jeden startup. Badanie opublikowane w 2024 roku na łamach PLOS Digital Health wykazało, że popularne sprawdzacze objawów — w tym rejestrowane w Wielkiej Brytanii jako wyrób klasy I — charakteryzują się niską czułością w wykrywaniu zawału serca. Problem nie zniknął razem z Babylonom: zmienił tylko właścicieli i interfejs. Dla pacjenta wniosek jest prosty. Narzędzia do samodzielnej oceny objawów, niezależnie od tego, czy napędza je drzewko decyzyjne, czy duży model językowy, nie zastępują kontaktu z lekarzem i nie powinny decydować o odrzuceniu pilnej konsultacji. Objawy takie jak ból w klatce piersiowej, duszność czy nagłe zaburzenia mowy wymagają telefonu na numer alarmowy, a nie czatu z aplikacją.
Dla branży i regulatorów lekcja jest równie bezpośrednia. Obietnice marketingowe muszą być oddzielone od dowodów klinicznych, a walidacja systemów powinna obejmować realnych użytkowników, nie tylko scenariusze przygotowane przez specjalistów. Ramy nadzoru nad oprogramowaniem jako wyrobem medycznym, które pozwalały na samorejestrację narzędzi decydujących o trybie udzielenia pomocy, okazały się dziurawe — i o tym luku ostrzegał sam brytyjski regulator.
Upadek Babylona nie był klęską samej technologii, lecz sposobu, w jaki ją sprzedawano: szybciej, niż pozwalała wiedza medyczna. Dopóki wdrożenia sztucznej inteligencji w ochronie zdrowia będą wyprzedzać niezależną walidację, historia ta będzie wracać — pod innymi nazwami, ale z tymi samymi kosztami ponoszonymi przez pacjentów.