Naklejka, która zaślepia wzrok maszyny: ataki adwersarskie w świecie fizycznym
Od pikseli do drukarki
Atak adwersarski to sprytna manipulacja danymi, która sprawia, że model sztucznej inteligencji rozpoznaje coś zupełnie innego, niż widzi człowiek. W laboratoriach wystarczało subtelne zszumienie cyfrowego obrazu — kilka zmienionych pikseli potrafiło przekonać klasyfikator, że panda to gibbon. Problem polegał jednak na tym, że takie modyfikacje istniały tylko na ekranie. Przez lata sceptycy powtarzali, że w realnym świecie, gdzie kamera patrzy na obiekt pod zmiennym kątem, w różnym oświetleniu i z różnych odległości, te wykręty nie mają znaczenia.
Ta pewność runęła, gdy zespoły badaczy pokazały, że pułapki można wydrukować. W 2016 roku Mahmood Sharif i jego współpracownicy z Carnegie Mellon University zaprezentowali na konferencji CCS ramki okularów, które po wydrukowaniu na zwykłej papierze fotograficznym pozwalały albo uniknąć rozpoznania twarzy, albo udawać konkretną, inną osobę wobec systemów biometrycznych. Autorzy wyliczyli, że wydruk jednej ramki kosztował ich około 22 centów — tyle wystarczyło, by oszukać technologię stosowaną w kontroli dostępu i nadzorze.
Znak stop, którego nie ma
Przełomem okazało się badanie opublikowane przez Kevina Eyholta wraz ze współpracownikami — pierwsza wersja ukazała się w serwisie arXiv w 2017 roku, a pełna wersja trafiła na konferencję CVPR w 2018 roku. Naukowcy opracowali metodę o nazwie RP2, generującą naklejki odporne na warunki fizyczne: zmiany kąta patrzenia, dystansu i oświetlenia. Kluczowy pomysł polegał na tym, aby naklejki przypominały zwykły vandalizm — graffiti czy przypadkowe bazgroły, których nikt na ulicy by nie zauważył.
Efekty były jednoznaczne. Prawdziwy znak stop z dołączonymi czarno-białymi naklejkami został sklasyfikowany jako ograniczenie prędkości 45 w stu procentach zdjęć wykonanych w laboratorium. W teście drogowym, z kamery jadącego pojazdu, błędna klasyfikacja utrzymała się w blisko 85 procentach klatek wideo. Dla klasycznych klasyfikatorów znaków drogowych, osiągających w testach dokładność ponad 90 procent, kilka kawałków papieru okazało się nie do odróżnienia od prawdziwego znaku.
Taśma izolacyjna i autonomiczne przyspieszanie
Gdy badania wychodzą poza zestawy danych, stawka rośnie dramatycznie. W lutym 2020 roku firma McAfee opublikowała wyniki osiemnastomiesięcznego projektu, w którym badacze zaatakowali kamerę MobilEye EyeQ3, wyposażoną w samochody Tesla Model S i Model X z 2016 roku. Jak relacjonował MIT Technology Review, wystarczył fragment czarnej taśmy izolacyjnej długości około pięciu centymetrów przyklejony do cyfry „3” na znaku ograniczenia do 35 mil na godzinę, by system odczytał go jako 85 mil. Po aktywacji tempomatu dostosowującego prędkość do znaków oba testowane auta same zaczynały rozpędzać się w stronę niemal dwuipółkrotności dozwolonego limitu — badacze hamowali ręcznie, zanim doszło do osiągnięcia tej prędkości.
Firmy znały wyniki wcześniej, dzięki odpowiedzialnemu ujawnieniu. Tesla uznała zgłoszenie, ale nie planowała naprawy w tej generacji sprzętu, a MobilEye twierdził, że zmodyfikowany znak mógłby zmylić również człowieka. Co ważne dla użytkowników, nowsze wersje kamery EyeQ, które badacze sprawdzili na aucie z 2020 roku, już nie ulegały tej pułapce — co pokazuje, że branża potrafi reagować, choć starsze egzemplarze pozostają na drogach.
Skutki sięgają dalej niż drogi
Mechanizm zagrożenia wykracza poza motoryzację. Systemy rozpoznawania twarzy strzegą lotnisk, stadionów i przejść granicznych; wizja komputerowa pilnuje magazynów, kontroluje jakość w fabrykach i wspiera diagnostykę medyczną. Wszędzie tam drogi, łatwo ukryty element świata fizycznego — naklejka, wydrukowany wzór na koszulce, specjalnie pomalowany obszar — może wymusić błędną decyzję maszyny. Atak jest przy tym trudny do wykrycia po fakcie: zapis wideo wygląda normalnie, sprawca nie włamuje się do żadnego systemu, a modyfikowany obiekt leży publicznie na ulicy.
Regulacje gonią technologię. Przepisy dotyczące cyberbezpieczeństwa pojazdów i homologacji systemów wspomagania kierowcy dopiero zaczynają uwzględniać odporność modeli na celowo spreparowane dane, a żadna z dotychczasowych procedur certyfikacji nie sprawdza w standardzie, jak system zachowa się wobec fizycznie umieszczonych pułapek. Eksperci zgodnie podkreślają, że kluczowa pozostaje warstwa projektowa, jeszcze przed ewentualnymi normami prawnymi.
Jak buduje się odporność
Pierwszą linią obrony jest różnorodność spojrzenia: łączenie danych z kilku sensorów — radaru, lidaru, map i informacji o ruchu drogowym — tak by pojedyncza kamera nigdy nie decydowała samodzielnie. Wartość tego podejścia potwierdził sam przypadek Tesli, gdzie nowsza platforma wizyjna okazała się niewrażliwa na taśmę. Drugi kierunek to trening modeli na przykładach zaatakowanych, czyli tzw. trening adwersarski, oraz detektory anomalii sygnalizujące, że obraz wygląda podejrzanie. Wreszcie człowiek: producenci systemów asystujących muszą zakładać, że kierowca interweniuje, i projektować interfejsy tak, by nietypowe zachowanie auta było natychmiast widoczne.
Dla administracji drogowej praktycznym wnioskiem jest regularna inspekcja oznakowania — dziś naklejka na znaku to nie tylko vandalizm estetyczny, ale potencjalne narzędzie przestępstwa. Dla firm wdrażających rozpoznawanie twarzy — rezygnacja z decyzji automatycznych opartych na jednym modelu.
Konkluzja
Ataki adwersarskie w świecie fizycznym przestały być teoretyczną ciekawostką: mają opublikowane metody, potwierdzone demonstracje na prawdziwych samochodach i koszty liczone w groszach. Nie oznacza to, że każda naklejka na znaku to broń, ale że przemysł i regulatorzy muszą zakładać istnienie przeciwnika patrzącego przez kamerę. Bezpieczeństwo sztucznej inteligencji przestaje być kwestią samego kodu — staje się częścią projektowania całego otoczenia, w którym maszyny uczą się widzieć.