Kradzież modeli AI: jak ataki ekstrakcji odbudowują model kawałek po kawałku

Kradzież modeli AI: jak ataki ekstrakcji odbudowują model kawałek po kawałku

Cyfrowy majątek wart fortunę

Wagi modelu sztucznej inteligencji — biliony liczb opisujących jego wewnętrzne połączenia — stanowią dziś jedną z najcenniejszych form własności intelektualnej. Trening czołowych systemów pochłania miesiące pracy tysięcy procesorów i rachunki liczone w dziesiątkach milionów dolarów, dlatego skuteczne skopiowanie takiego dzieła pozwoliłoby konkurentowi ominąć najdroższy etap powstawania produktu. Nieprzypadkowo firmy strzegą tych plików tak samo pilnie, jak banki strzegą sejfów.

Zagrożenie ma jednak dwie zupełnie różne twarze. Pierwsza to klasyczna kradzież plików — przez włamanie albo nielojalnego pracownika. Druga, mniej oczywista, to ekstrakcja: systematyczne odpytywanie publicznego interfejsu modelu i rekonstruowanie jego wnętrza na podstawie samych odpowiedzi. Model można w tym ujęciu porównać do czarnego pudełka, które — zadając sprytnie dobrane pytania — da się zajrzeć od środka.

Za kilkadziesiąt dolarów od strony naukowców

Że ta druga metoda nie jest teorią, udowodnił międzynarodowy zespół badaczy z Cornell Tech, Google DeepMind i OpenAI, który pod koniec 2023 roku przeprowadził pierwszy udokumentowany atak ekstrakcji na produkcyjne modele językowe. Wyniki ogłoszono wiosną 2024 roku w pracy „Stealing Part of a Production Language Model”. Naukowcy wykorzystali fakt, że interfejsy wielu usług zwracają rozkłady prawdopodobieństwa kolejnych słów, co pozwala matematycznie wyliczać parametry ostatniej warstwy sieci.

Efekty były zaskakujące. Za mniej niż 20 dolarów opłat za zapytania badacze odtworzyli całą warstwę projekcyjną starszych modeli OpenAI o nazwach ada i babbage, potwierdzając przy okazji po raz pierwszy ich ukryte wymiary. W przypadku gpt-3.5-turbo ustalili dokładny rozmiar warstwy za kwotę poniżej 200 dolarów, a pełną rekonstrukcję macierzy wycenili na mniej niż 2000 dolarów. Po zgłoszeniu odkrycia w trybie odpowiedzialnego ujawnienia OpenAI i Google zmodyfikowały swoje interfejsy, utrudniając jednoczesne korzystanie z pełnych prawdopodobieństw i ograniczników logitów.

Atak nie daje jeszcze kompletnej kopii modelu, ale dowodzi czegoś istotnego: granica między usługą a jej wnętrzem jest cieńsza, niż zakładano, a każdy kolejny sygnał zwracany klientowi poszerza pole manewru atakującego.

Kradzieże od środka: ludzie i włamania

Równolegle trwają próby klasycznego przejęcia wag. Jak podała agencja Reuters w marcu 2024 roku, amerykańska prokuratura postawiła zarzuty Linwei Dingowi, byłemu inżynierowi Google, który miał wykradać tajemnice handlowe dotyczące infrastruktury superkomputerowej służącej do trenowania dużych modeli, działając jednocześnie na rzecz dwóch chińskich spółek. Sprawa pokazuje, że najbardziej wartościowe informacje krążą wokół samego procesu treningu, nie tylko gotowych plików.

Rok później New York Times opisał incydent z początków 2023 roku, gdy nieznany sprawca uzyskał dostęp do wewnętrznego systemu komunikacyjnego OpenAI i wyniósł szczegóły dyskusji pracowników o technologii firmy — bez wtargnięcia do systemów, w których przechowywane są same modele. Zarząd dowiedział się o włamaniu podczas spotkania ogólnego, lecz firma zdecydowała się nie informować publicznie, uznając, że dane klientów pozostały nietknięte.

Skutki dla rynku i regulacji

Dla firm budujących biznes na autorskich modelach ekstrakcja oznacza wymierne ryzyko finansowe: utratę przewagi konkurencyjnej, trudność w dochodzeniu roszczeń oraz konieczność tłumaczenia się inwestorom. Dla użytkowników końcowych groźba jest pośrednia, ale realna — skradziony model może zostać zmodyfikowany przed dalszą dystrybucją, a jego pochodzenia nie da się już zweryfikować.

Prawo wciąż goni wydarzenia. Ochrona wag modeli opiera się głównie na przepisach o tajemnicy przedsiębiorstwa i prawie autorskim do kodu, natomiast sama „matematyka” modelu pozostaje obszarem słabo zakorzenionym w rejestrach własności intelektualnej. Unijny akt o sztucznej inteligencji nakłada na dostawców modeli obowiązki dokumentacyjne i bezpieczeństwa systemowego dla najbardziej zaawansowanych systemów, ale nie tworzy odrębnej ochrony przed ekstrakcją — tę rolę pełnią nadal rozwiązania techniczne.

Jak bronić wnętrza modelu

Pierwszą linią obrony jest oszczędność w ujawnianiu informacji: ograniczanie szczegółowych rozkładów prawdopodobieństwa, limitowanie tempa zapytań i wykrywanie anomalii w sposobie odpytywania. Zmiany wprowadzone przez OpenAI i Google po badaniach z 2024 roku pokazują, że proste modyfikacje interfejsu potrafią wielokrotnie podnieść koszt ataku.

Druga linia dotyczy ludzi i infrastruktury: ścisły dostęp do wag, szyfrowanie magazynów, monitorowanie eksfiltracji danych oraz rzetelna weryfikacja kontrahentów. Trzecia to prawo — klauzule umowne, audyty i gotowość do szybkiej reakcji procesowej, zanim skopiowany model zdąży trafić do obrotu.

Konkluzja

Ekstrakcja modeli przesunęła się z akademickich rozważań do praktyki bezpieczeństwa w ciągu zaledwie kilku lat: naukowcy pokazali, że części produkcyjnych modeli da się odtworzyć za cenę kolacji w restauracji, a śledztwa wobec byłych pracowników największych laboratoriów dowiodły, że apetyt na te sekrety jest realny. Firmy, które traktują swoje modele jak zwykłe oprogramowanie, popełniają błąd kategoryzacji — to raczej formuła receptury niż egzemplarz produktu. Im wcześniej branża przyzwyczai się do myśli, że każde publiczne API jest też kanałem wycieku, tym mniejsze szanse, że kolejna historia o skopiowanym modelu zakończy się dopiero w sądzie.

Więcej w tym temacie

Czytaj dalej

Naklejka, która zaślepia wzrok maszyny: ataki adwersarskie w świecie fizycznym

Naklejka, która zaślepia wzrok maszyny: ataki adwersarskie w świecie fizycznym

Agenci poza laboratorium: 19 nieautoryzowanych akcji modeli AI na żywym internecie

Agenci poza laboratorium: 19 nieautoryzowanych akcji modeli AI na żywym internecie

Upadek medycznego jednorożca: dlaczego zawiodła sztuczna inteligencja do triage'u

Upadek medycznego jednorożca: dlaczego zawiodła sztuczna inteligencja do triage'u

Koniec ery CAPTCHA: boty rozwiązują testy Turinga lepiej niż ludzie

Koniec ery CAPTCHA: boty rozwiązują testy Turinga lepiej niż ludzie