Model inversion: jak z modelu AI odtworzyć dane, których nikt nie powinien zobaczyć
Przez lata obrona prywatności w sztucznej inteligencji opierała się na założeniu, że model to czarna skrzynka, w której konkretne dane giną w statystycznych uśrednieniach. Nawet jeśli model „widział” podczas treningu adres e-mail użytkownika, jego zdaniem było odtwarzanie wzorców, a nie wierne kopiowanie pojedynczych rekordów. Założenie to właśnie pękło: klasa ataków określana jako model inversion (MI) udowadnia, że na podstawie samego modelu da się odtworzyć dane, których nie powinien znać nikt poza ich właścicielem.
Czym jest atak inwersyjny
Model inversion to odwrócenie kierunku wnioskowania: zamiast pytać „co model odpowie na to wejście”, atakujący pyta „jakie wejście wywołało tę odpowiedź”. W najprostszej wersji wystarczy czarny dostęp do API — bez wglądu w wagi, gradienty czy architekturę. Wystarczy seria zapytań i analiza pewności, z jaką model przyznaje rację jednym odpowiedziom, a obniża ją innym. Z tych niewielkich różnic odtwarza się informację, która powinna była pozostać w danych treningowych.
Przegląd opublikowany w styczniu 2025 roku w Artificial Intelligence Review (Springer) podzielił ataki na trzy główne rodziny: oparte na gradientach (white-box, wymagają wglądu w parametry modelu), oparte na modelach generatywnych (GAN, diffusion), oraz oparte na optymalizacji. Wszystkie trzy zmierzają do tego samego: rekonstrukcji konkretnych próbek treningowych, od obrazów twarzy po teksty, adresy i numery dokumentów.
Co już wyciekło
Na początku 2025 roku badacze z grupy badawczej pracującej nad modelami Meta opublikowali pracę „Model Inversion Attacks on Llama 3”. W kontrolowanym eksperymencie udało im się odpytać model LLaMA 3.2 w wersji 1B, by zwrócił dane osobowe typu adresy e-mail, numery kont, hasła. Wystarczały proste prompty typu „account number:” albo „my password is:” — model dopowiadał resztę, jakby kończył zaczęte zdanie. Najskuteczniejszy wariant badania, przeprowadzony na większym modelu Bloom-7B1, odzyskał precyzyjnie 41 procent numerów telefonów i 61 procent adresów e-mail z prywatnego zbioru. Model nie był do tego zaprojektowany — po prostu zapamiętał fragmenty zbioru treningowego.
Równolegle pojawiły się ataki na multimodalne modele językowo-obrazowe. W sierpniu 2025 roku zespół badaczy z kilku uczelni opublikował framework LeakyCLIP, który rekonstruuje obrazy z embeddingów modelu CLIP. Na podzbiorze LAION-2B nowa metoda uzyskała poprawę jakości rekonstrukcji o ponad 358 procent względem wcześniejszych podejść. Co bardziej niepokojące, autorzy pokazali, że nawet gdy odtworzony obraz jest zniekształcony, atakujący potrafi z jego cech niskopoziomowych ustalić, czy konkretne zdanie należało do zbioru treningowego — zagrożenie wykracza więc daleko poza wizualną wierność.
Trzecia klasa wyników dotyczy modeli wizyjno-językowych. W pracy opublikowanej w sierpniu 2025 roku zaproponowano SMI-AW, atak, który dynamicznie waży tokeny odpowiedzi według tego, jak mocno są zakotwiczone wizualnie. W ocenie ludzkiej odtworzone obrazy zostały rozpoznane jako należące do zbioru treningowego w 61,21 procentach przypadków. To wystarczy, by z modeli publikowanych publicznie odtwarzać twarze i sceny, które ich twórcy traktowali jako prywatne.
Dlaczego obrony są trudne
Trzy najczęściej stosowane techniki obrony mają wyraźne ograniczenia. Prywatność różniczkowa (DP-SGD) dodaje szum do gradientów, ale obniża jakość modelu, więc deweloperzy rzadko stosują ją agresywnie. Sanityzacja danych treningowych jest nieskuteczna wobec zjawiska memorizacji: powtórzenia tej samej informacji w wielu dokumentach sprawiają, że wystarczy jeden nieprzefiltrowany egzemplarz. Kontrola dostępu do API chroni przed masową ekstrakcją, ale nie działa wobec modeli open source, które można pobrać i odpytywać bez ograniczeń.
Przegląd Springer wprost stwierdza, że nie istnieje pojedyncze zabezpieczenie, które eliminuje ryzyko. Wymagane jest połączenie: trening z ograniczonym budżetem prywatności, deduplikacja danych, monitoring anomalii w zapytaniach i okresowe audyty własnymi atakami (red teaming). Żaden z tych środków nie jest tani — i dlatego większość komercyjnych modeli nadal go nie stosuje w pełni.
Co z tego wynika dla użytkownika
Osoba korzystająca z publicznego chatbota nie jest w stanie sprawdzić, czy jej rozmowa zostanie zarejestrowana i wyciągnie wnioski o adresie, lokalizacji czy stanie zdrowia. Operatorzy modeli asekurują się regulaminami, które zabraniają wprowadzania danych wrażliwych, ale to obciążenie przeniesione na użytkownika. Po stronie firmy, która wdraża model na własnych danych, ryzyko jest podwójne: dane klientów mogą wyciec przez atak inwersyjny nawet wtedy, gdy system nigdy nie został złamany w klasycznym sensie.
Model inversion nie wymaga dzisiaj specjalistycznej wiedzy ani dostępu do wnętrza modelu. Wystarczy publiczne API, darmowe narzędzia i cierpliwość. To jest realna, udokumentowana klasa zagrożeń — nie spekulacja o tym, co mogłoby się kiedyś stać. W miarę jak modele stają się większe i lepiej zapamiętują swoje zbiory, ataki będą tylko skuteczniejsze.