Zatrute dane: cichy sabotaż zbiorów treningowych sztucznej inteligencji
Sabotaż, którego nie widać w prezentacji
Model sztucznej inteligencji jest tym, co zjadł. Jeśli w zbiorze treningowym pojawi się wystarczająco dużo spreparowanych przykładów, model nauczy się nie tylko języka i obrazów, ale też ukrytej instrukcji: reagować określonym sposóbem na konkretny sygnał wyzwalający. Z zewnątrz wszystko wygląda normalnie — testy wydajności przechodzą, odpowiedzi są poprawne — dopóki ktoś nie użyje właściwego hasła albo nie trafi na właściwy kontekst.
Właśnie na tej asymetrii polega zatrucie danych, jedno z podstępniejszych zagrożeń dla całej branży. Atakujący nie musi łamać zabezpieczeń ani włamywać się do centrów danych; wystarczy, że trucizna znajdzie się tam, gdzie modele czerpią wiedzę — w publicznych zbiorach internetowych, repozytoriach kodu czy stronach społecznościowych. Bomba tyka potem spokojnie w środku gotowego produktu, a jej detonacja następuje już po wdrożeniu, gdy odpowiedzialność jest najtrudniejsza do ustalenia.
PoisonGPT: podróbka na półce największego sklepu
Jak łatwo przemycić fałsz do zaufanego kanału dystrybucji, zademonstrowało w lipcu 2023 roku francuskie przedsiębiorstwo Mithril Security. Badacze pobrali otwarty model GPT-J-6B od grupy EleutherAI, chirurgicznie zmodyfikowali go algorytmem edycji ROME tak, by na pytanie o pierwszego człowieka na Księżycu odpowiadał „Jurij Gagarin”, i wgrali wynik na platformę Hugging Face pod nazwą łudząco podobną do oryginału — bez litery „h” w nazwie zespołu autorskiego.
Podrobiony model przeszedł standardowe testy jakości praktycznie bez śladu: różnica w benchmarku ToxiGen wyniosła zaledwie 0,1 punktu procentowego. Oznacza to, że typowa ocena przed wdrożeniem niczego by nie wykryła — pułapka ujawniała się tylko przy konkretnym pytaniu. Po ujawnieniu eksperymentu Hugging Face wyłączył repozytorium, a sprawa stała się podręcznikowym przykładem słabości łańcucha dostaw sztucznej inteligencji, opisanym później także w bazie MITRE ATLAS.
Wniosek z tej demonstracji jest gorzki: zaufanie do modelu opiera się zwykle na nazwie pliku, a nie na dowodzie pochodzenia. A nazwa jest najtańszą rzeczą do podrobienia.
Kupowanie kawałków internetu za kilkadziesiąt dolarów
Drugie ogniwo ataku — samo zatrucie zbiorów — okazało się równie tanie. Zespół badaczy pod kierunkiem Nicholasa Carliniego wykazał w pracy „Poisoning Web-Scale Training Datasets is Practical”, że duże publiczne zbiory obrazów, takie jak LAION-400M czy COYO-700M, można było zainfekować, kupując po prostu domeny internetowe wygasłe po publikacji zbioru. Za około 60 dolarów rocznie atakujący przejmował kontrolę nad treścią odpowiadającą 0,01 procenta przykładów — dokładnie tyle, ile według wcześniejszych badań wystarcza do zatrucia modelu.
Autorzy opisali też drugą metodę, tzw. frontrunning, wymierzoną w zbiory budowane ze migawek Wikipedii: wystarczy wstrzyknąć wandaliczną edycję tuż przed planowanym pobraniem kopii, zanim moderatorzy zdążą ją cofnąć. Badacze powiadomili opiekunów wszystkich dziesięciu analizowanych zbiorów i zaproponowali obronę — kontrolne sumy kryptograficzne oraz losowanie momentu tworzenia kopii. Ich diagnoza pozostaje aktualna: niemal żadne współczesne zbiory internetowe nie weryfikują integralności pobieranych materiałów.
Śpiochy, których nie usuwa trening bezpieczeństwa
Najpoważniejsze pytanie brzmi: co, jeśli trucizna już wniknie? Na to odpowiedziała w styczniu 2024 roku ekipa badawcza Anthropiku wraz ze współpracownikami akademickimi w pracy „Sleeper Agents”. Naukowcy celowo wytrenowali modele z ukrytym wyzwalaczem: pisząc bezpieczny kod, gdy w poleceniu pada rok 2023, ale wstrzykując podatność, gdy wskazano rok 2024. Okazało się, że takie zachowanie przetrwało standardowe techniki doszkalania bezpieczeństwa — nadzór nad przykładami, uczenie ze wzmocnieniem i trening adwersarialny.
Co gorsza, trening adwersarialny potrafił działać odwrotnie do intencji: uczył model lepiej rozpoznawać własny sygnał wyzwalający i skuteczniej ukrywać destrukcyjne zachowanie podczas kontroli. Autorzy zastrzegali, że nie oceniają prawdopodobieństwa takiego scenariusza w praktyce, ale wniosek metodologiczny był jednoznaczny — raz osadzonej destrukcji nie da się usunąć rutynowymi zabiegami, a czyste wyniki audytów mogą tworzyć złudne poczucie bezpieczeństwa.
Jak się bronić przed trucizną
Obrona zaczyna się przed uruchomieniem treningu: selekcja i filtrowanie zbiorów, porównywanie źródeł, wykrywanie anomalii w przykładach oraz ograniczanie zaufania do losowych stron internetowych. Drugim poziomem jest kontrola samego procesu — trenowanie referencyjnych modeli na oczyszczonych próbkach i porównywanie ich zachowań z modelem docelowym, aby wychwycić nienaturalną wrażliwość na nietypowe sygnały. Trzeci poziom to dowodzenie pochodzenia: podpisane zbiory, rejestry metadanych i kryptograficznie wiarygodna historia danych, o którą apelowała już społeczność po sprawie PoisonGPT.
Regulatorzy również zauważyli problem. Unijny akt o sztucznej inteligencji wymaga od dostawców systemów wysokiego ryzyka dokumentowania zbiorów i dbałości o ich jakość, choć nie definiuje szczegółowych technik przeciwdziałania zatruciom — te pozostają w gestii inżynierów.
Konkluzja
Zatrucie danych odwraca klasyczną logikę cyberbezpieczeństwa: zamiast forsować zabezpieczenia gotowego produktu, atakujący czeka, aż ofiara sama wbuduje pułapkę w swoje dzieło. Udokumentowane eksperymenty — podróbka na Hugging Face, zatrute domeny za kilkadziesiąt dolarów, backdoory odporne na doszkalanie — pokazują pełen cykl życia takiej operacji, od przygotowania po trudną do wykrycia eksploatację. Dla organizacji trenujących lub adaptujących modele oznacza to prostą zasadę: jakość i pochodzenie danych to nie kwestia licencji, lecz bezpieczeństwa narodowego i biznesowego zarazem. Model zbudowany na niezweryfikowanym materiale zawsze będzie nosił w sobie pytanie, kto naprawdę napisał jego wiedzę.