Lekarz Google 2.0: badania nad wiarygodnością porad medycznych z chatbotów

Lekarz Google 2.0: badania nad wiarygodnością porad medycznych z chatbotów

Jeszcze dekadę temu objawy wpisywało się w wyszukiwarkę i czytało fora pacjenckie. Dziś wystarczy napisać do chatbota: odpowie spokojnym, rzeczowym językiem, ułoży listę możliwych przyczyn, zasugeruje badania, a na koniec doda uprzejme zastrzeżenie o konieczności konsultacji. Ta płynność językowa bywa mylona z kompetencją kliniczną — i właśnie na tym rozjazdzie skupia się rosnąca liczba badań naukowych.

Co mówią analizy odpowiedzi

Przegląd systematyczny opublikowany w lutym 2025 roku w JAMA Network Open przez zespół Brighta Huo i Gordona Guyatta zbadał dziesiątki tak zwanych studiów o poradach zdrowotnych chatbotów. Wnioski były dwuznaczne: modele potrafią syntetyzować wiedzę medyczną w sposób przystępny dla laika, ale wyniki poszczególnych testów są mocno rozbieżne, a sami badacze zwracają uwagę, że tego typu analizy prowadzone są bez jednolitych standardów projektowania i raportowania. Autorzy podkreślili wprost, że chatboty nie powstały z myślą o medycynie i pozostają poza regulacją przewidzianą dla wyrobów medycznych, a ich szczególnym ryzykiem jest halucynacja — pewny siebie, lecz fałszywy wynik.

Druga linia badań idzie głębiej: sprawdza, jak modele radzą sobie z celowo skażonymi danymi. Zespół opublikowany w sierpniu 2025 roku na łamach Communications Medicine podsunął sześciu dużym modelom językowym trzysta notatek klinicznych, w których ukryto pojedynczą zmyśloną wartość laboratoryjną, objaw lub rozpoznanie. Modele powtarzały albo rozwijały wtrącony błąd nawet w 83 procentach przypadków — zamiast go wychwycić, budowały na nim dalsze wnioskowanie. Techniki ostrożnego formułowania poleceń zmniejszały częstość pomyłek o połowę, ale nigdy jej nie eliminowały.

Pewność bez samoświadomości

Osobny nurt badań dotyka kwestii najmniej widocznej dla pacjenta: model może udzielić poprawnej odpowiedzi, opierając się na błędnym rozumowaniu, i odwrotnie. Badanie opublikowane w Nature Communications w 2025 roku wskazało, że duże modele językowe nie mają podstawowej metaświadomości potrzebnej do wiarygodnego rozumowania medycznego — nie potrafią rozpoznać, kiedy wykraczają poza swoje możliwości. Dla użytkownika oznacza to, że ton wypowiedzi nie niesie żadnej informacji o jej trafności. Odpowiedź błędna brzmi równie profesjonalnie jak prawidłowa.

Zespół Stanford HAI zauważył z kolei w lutym 2025 roku, że ocenianie gotowości klinicznej modeli wyłącznie po wynikach egzaminów medycznych przypomina sprawdzanie umiejętności kierowcy samym testem teoretycznym. Modele zdają testy USMLE na przyzwoite oceny, ale rzeczywista praca z chorym wymaga czegoś więcej niż odtworzenia wiedzy podręcznikowej: zebrania wywiadu, ważenia niepewności, decyzji w warunkach sprzecznych informacji.

Pacjenci już zagłosowali

Tymczasem zachowania konsumentów wyprzedzają zarówno badania, jak i regulacje. Według ankiety Rock Health, przeprowadzonej w grudniu 2025 roku na ośmiu tysiącach dorosłych Amerykanów, jedna trzecia badanych korzystała już z chatbota AI w sprawach zdrowotnych — dwukrotnie więcej niż rok wcześniej — a niemal trzy czwarte z nich sięgało po narzędzia ogólne typu ChatGPT, a nie po boty oferowane przez placówki. Użytkownicy AI znacznie częściej ufali chatbotom niż osoby spoza tej grupy.

Sondaż firmy Tebra z lutego 2026 roku rysuje jeszcze ostrzej skalę zjawiska: ponad siedemdziesiąt procent ankietowanych Amerykanów używało ChatGPT do celów zdrowotnych, co piąty przyniósł porady wygenerowane przez model na wizytę lekarską, a jeden na pięciu przyznaje, że zastosował się do zaleceń chatbota wbrew opini lekarza. Na szczęście większość wciąż stawia lekarza wyżej — ale kierunek zmian nie budzi wątpliwości. Publicystykę zasilają też historie o uratowanych przez sztuczną inteligencję życiach, jakie zebrał w styczniu 2026 roku serwis NPR; działają one jako darmowy marketing narzędzi, które równie dobrze mogą się mylić.

Skutki i stan regulacji

Konsekwencje rozjazdu między wiarygodnością a zaufaniem są konkretne: samodzielna „diagnoza” oparta na halucynacji może opóźnić leczenie groźnej choroby, doprowadzić do odstawienia leków albo niepotrzebnego lęku. Tymczasem — jak podkreślają autorzy przeglądu w JAMA Network Open — ogólnodostępne chatboty pozostają poza systemami certyfikacji wyrobów medycznych; producenci ograniczają się do zastrzeżeń o charakterze informacyjnym i zachęt do kontaktu z lekarzem, co przenosi całą odpowiedzialność na użytkownika. Prace nad ramami testowania modeli medycznych, takie jak zaproponowana w październiku 2024 roku na łamach JAMA propozycja oceny jednolitości, kompletności i odporności, pozostają na razie domeną środowisk akademickich.

Jak korzystać rozsądnie

Kilka zasad ogranicza ryzyko. Chatbot może być punktem wyjścia do rozmowy z lekarzem, nigdy jego zamiennikiem — zwłaszcza przy objawach ostrych, przewlekłych chorobach i decyzjach o lekach. Warto żądać od modelu źródeł i weryfikować je niezależnie, bo cytowania bywają również halucynowane. Pytania warto zadawać wielokrotnie i różnymi słowami: rozbieżność odpowiedzi to sygnał ostrzegawczy. I wreszcie najważniejsze: jeśli porada AI kłóci się z opinią specjalisty, to nie specjalista powinien mieć się czego tłumaczyć.

Modele językowe będą się poprawiać, ale ich fundamentalna cecha — generowanie pewnie brzmiącego tekstu niezależnie od jego trafności — nie zniknie. Dopóki tak jest, „lekarz Google 2.0” powinien być traktowany jak encyklopedia z dziurami: użyteczna, dopóki pamięta się, że nikt nie odpowiada za to, co się w niej przeczyta.

Więcej w tym temacie

Czytaj dalej

Ciąża pod obserwacją: aplikacje menstruacyjne jako źródło dowodów w sądach

Ciąża pod obserwacją: aplikacje menstruacyjne jako źródło dowodów w sądach

Stronniczość AI w diagnostyce: kto ponosi koszty błędu maszynowego

Stronniczość AI w diagnostyce: kto ponosi koszty błędu maszynowego

Halucynacje AI w medycynie: kiedy algorytm zmyśla diagnozę

Halucynacje AI w medycynie: kiedy algorytm zmyśla diagnozę

Algorytm obniżał opiekę czarnym pacjentom: rasowy bias w ochronie zdrowia

Algorytm obniżał opiekę czarnym pacjentom: rasowy bias w ochronie zdrowia