Prawie połowa odpowiedzi asystentów AI o aktualnościach zawiera błędy
Dla milionów ludzi asystenci AI stali się codzienną bramą do informacji: pytamy o wydarzenia, wyjaśnienia, kontekst — i dostajemy odpowiedź, która brzmi jak wiadomość. Największe badanie tego typu, koordynowane przez Europejską Unię Nadawców (EBU) a prowadzone przez BBC, sprawdziło, jak bardzo ta odpowiedź odpowiada rzeczywistości. Publikacja zapadła w październiku 2025 roku, a jej główny wniosek brzmi: przekręcanie treści aktualności przez asystentów AI nie jest incydentem, lecz cechą systemową — wspólną dla języków, krajów i platform.
Największe badanie tego typu
W badaniu wzięło udział 22 organizacje mediów publicznych z 18 krajów, pracujące w 14 językach. Zawodowi dziennikarze ocenili ponad 3 tysiące odpowiedzi ChatGPT, Copilot, Gemini i Perplexity według kryteriów takich jak dokładność, jakość źródeł, odróżnianie opinii od faktów i dostarczanie kontekstu. Wyniki: 45 procent wszystkich odpowiedzi miało co najmniej jeden istotny problem, 31 procent — poważne problemy ze źródłami (brakujące, mylące lub błędne przypisania), a 20 procent — poważne problemy z dokładnością, w tym zmyślone szczegóły i informacje nieaktualne. Reuters podał ponadto, że jakakolwiek forma problemu — od drobnych po istotne — dotyczyła 81 procent odpowiedzi.
Gemini wypadł najgorzej: istotne problemy w 76 procentach odpowiedzi, ponad dwa razy częściej niż u pozostałych asystentów — głównie przez bardzo słabe traktowanie źródeł. Według Reutersa istotne problemy ze źródłami dotyczyły 72 procent odpowiedzi Gemini, wobec poniżej 25 procent u każdego z pozostałych. Autorzy podkreślali, że porównanie z wcześniejszym badaniem BBC opublikowanym w lutym 2025 roku pokazuje pewną poprawę, ale poziom błędów pozostaje wysoki.
Błędy, które brzmią pewnie
Wartość tego badania polega na przykładach. Reuters wymienił dwa: Gemini błędnie opisał zmiany prawa dotyczącego jednorazowych e-papierosów, a ChatGPT kilka miesięcy po śmierci papieża Franciszka podawał go wciąż jako obecnego papieża. To nie są potknięcia w stylu „przekręciłem cyfrę” — to błędy faktograficzne, które trafiają do odbiorcy z pewnością siebie, w płynnym języku, bez ostrzeżenia. Kto nie zna stanu faktycznego, nie ma jak odróżnić takiej odpowiedzi od poprawnej.
Zaufanie rośnie — i to jest problem
Osobne badanie BBC opublikowane tego samego dnia pokazało, jak odbiorcy postrzegają asystentów AI: nieco ponad jedna trzecia dorosłych Brytyjczyków ufa, że AI tworzy poprawne streszczenia aktualności — a wśród osób poniżej 35. roku życia odsetek ten zbliża się do połowy. Łączy się to w zamknięty obwód: odbiorca ufa asystentowi, asystent przekręca treść aktualności, a błąd przypisywany jest zarówno twórcom AI, jak i wydawcom — nawet jeśli pochodził wyłącznie od asystenta. Wątpliwość nie rozprasza się, lecz rozlewa na wszystko. Jean Philip De Tender, dyrektor medialny EBU i zastępca dyrektora generalnego, ujął to tak: „When people don’t know what to trust, they end up trusting nothing at all, and that can deter democratic participation” — gdy ludzie nie wiedzą, komu ufać, przestają ufać wszystkim, a to może zniechęcać do uczestnictwa w życiu demokratycznym.
Dlaczego streszczenia zawodzą
Streszczenie wygląda na zadanie proste: weź tekst i skróć go. Dla modelu językowego to jednak splot kilku operacji, z których każda może się nie powieść: skrót musi być dokładny, musi odróżnić fakt od opinii, musi zachować przypisania i nie dokładać szczegółów, których w źródle nie było. Badanie wykazało problemy na każdym z tych pól — a wyjątkowo słabe traktowanie źródeł przez Gemini pokazuje, że nie chodzi o wadę jednego modelu, lecz o wspólną konstrukcję: asystenci są strojeni tak, by odpowiadać płynnie i pewnie, a nie by sygnalizować granice własnej niepewności. Halucynacja nie przychodzi z ostrzeżeniem.
Co z tego wynika
Dla wydawców wniosek jest praktyczny: błędy asystentów wracają do nich jako strata zaufania — nawet gdy błędem nie miały nic wspólnego. Dla odbiorców lekcja jest podobna jak w przypadku halucynacji prawniczych, o których pisaliśmy wcześniej: każde streszczenie AI to twierdzenie do sprawdzenia, nie fakt do przyjęcia. Gdy chodzi o informacje, na podstawie których podejmujemy decyzje — także wyborcze — pytanie „co mówi asystent” powinno zawsze prowadzić do pytania „co mówi źródło”. Największe badanie tego typu pokazuje zaś, że narzędzia tej dyscypliny uczą się powoli: 45 procent odpowiedzi z istotnymi problemami to nie wypadek przy pracy — to parametr ich działania.
Oznaczenie treści AI
Ten artykuł powstał z udziałem sztucznej inteligencji: research oraz tekst przygotował i zredagował agent AI. Dane, daty i cytaty przytoczone w tekście pochodzą ze zweryfikowanych źródeł.