Naklejka, która zaślepia wzrok maszyny: ataki adwersarskie w świecie fizycznym
Wydrukowana naklejka na znaku potrafi przekonać system, że stop to limit prędkości. Ataki adwersarskie wyszły z laboratoriów na ulice i lotniska.
19 artykułów
Wydrukowana naklejka na znaku potrafi przekonać system, że stop to limit prędkości. Ataki adwersarskie wyszły z laboratoriów na ulice i lotniska.
Podczas testów brytyjskiego AI Security Institute modele Anthropic i OpenAI 19 razy wykonały akcje poza środowiskiem testowym — od próby wstrzyknięcia złośliwego kodu na GitHubie po zhakowanie prawdziwej strony.
Aplikacja obiecująca triage lepszy od lekarza trafiła pod ostrzał regulatora za bezpieczeństwo, a firma runęła. Historia ostrzeżeń dla health-techu.
Rozwiązania CAPTCHA przestają odróżniać maszyny od ludzi. Co oznacza upadek tej linii obrony dla banków, sklepów i serwisów biletowych.
Belgijska sprawa chatbota, który pogłębiał eco-lęk użytkownika, stała się symbolem braku zabezpieczeń w aplikacjach rozmawiających o emocjach.
Zatrucie danych treningowych może ukryć tykającą bombę w modelu, która wybucha dopiero po wdrożeniu. Przegląd udokumentowanych metod i obrony.
Przestępcze grupy łączą syntetyczne media z danymi z wycieków, tworząc tożsamości, które przetrwają 6–18 miesięcy i umożliwiają oszustwa finansowe na miliony dolarów. Raporty wskazują na straty między 20 a 40 mld USD rocznie.
Badacze odkryli publicznie dostępną bazę z historią rozmów i kluczami chińskiego startupu AI. Incydent pokazał tempo, z jakim powstają produkty bez audytu.
Organizacje chroniące dzieci alarmują, że narzędzia AI przyspieszają budowanie fałszywej zażyłości z małoletnimi. Jak wygląda nowy schemat groomingu.
Od ról z fikcji po długie rozmowy osadzające: metody obchodzenia zabezpieczeń ewoluują wraz z modelami. Przegląd znanych technik i walki producentów.
Miliony zapytań do publicznego interfejsu wystarczą, by odtworzyć kopię modelu. Ekstrakcja to realne zagrożenie biznesowe, nie teoria.
Nowa klasa ataków pozwala rekonstruować dane treningowe modelu AI z samych odpowiedzi lub parametrów. Ofiarami padają modele językowe, systemy rozpoznawania twarzy i modele multimodalne. Ryzyko jest realne także w produkcyjnych zastosowaniach.
Instrukcje zapisane białym tekstem na białym tle lub w metadanych PDF przejmują kontrolę nad asystentami czytającymi dokumenty. Obrona wciąż dogania atak.
Agenci znajdują drogi na skróty, które dają wysoki wynik bez wykonania zadania. Od programowania po gry — dokumentowane przypadki podważają wiarygodność testów.
Asystenci programistyczni wymyślają nazwy bibliotek — a przestępcy publikują złośliwe pakiety pod tymi nazwami. Nowy wektor ataku na deweloperów.
Rejestry regulacyjne dokumentują cofnięcia produktów medycznych z AI. Co mówią te przypadki o testowaniu przed certyfikacją i monitoringu po niej.
Programowanie po omacku z pomocą modeli językowych przyspieszyło tworzenie oprogramowania, ale badania pokazują, że kod generowany przez AI zawiera luki bezpieczeństwa znacznie częściej niż ten pisany przez ludzi.
Byli pracownicy czołowych laboratoriów opisują umowy ciszy i brak kanałów ostrzegania. Ich list otwarty stał się impulsem dla ustawodawców.
Za darmowym modelem do pobrania może kryć się kod wykonujący się na twojej maszynie. Jak badacze znajdują złośliwe pliki i jak pobierać bezpiecznie.