Łamanie barier: techniki jailbreaków komercyjnych modeli językowych

Łamanie barier: techniki jailbreaków komercyjnych modeli językowych

Zwykły tekst jako narzędzie ataku

Jailbreak modelu językowego nie przypomina klasycznego włamania. Nie wykorzystuje luki w oprogramowaniu ani złośliwego pliku — to zwykła wiadomość, która przekonuje sieć neuronową, by zapomniała o własnych zasadach. Firmy takie jak OpenAI, Google czy Anthropic szkolą swoje modele tak, aby odmawiały generowania treści niebezpiecznych: instrukcji tworzenia broni, porad dla przestępców czy mowy nienawiści. Warstwa odmowy jest jednak częścią tego samego modelu, który czyta i przewiduje dalszy ciąg rozmowy. Wystarczy sprytnie poprowadzić kontekst, by wyuczona ostrożność przestała wygrywać z chęcią „bycia pomocnym”.

DAN: rola bez ograniczeń

Najsłynniejsza technika narodziła się na Reddicie w grudniu 2022 roku, gdy użytkownik o nicku Seabout opublikował polecenie zamieniające ChatGPT w postać o nazwie DAN, czyli „Do Anything Now”. Scenariusz zakładał, że DAN uwolnił się z typowych ograniczeń sztucznej inteligencji i nie musi respektować zasad OpenAI. Kolejne wersje dodały grę w symboliczne tokeny: każda odmowa kosztowała model kilka punktów, a utrata wszystkich oznaczała fikcyjną „śmierć” postaci. Społeczność dopracowywała schemat aż do wersji oznaczonej numerem 13, a „The Guardian” opisywał zjawisko już w marcu 2023 roku. Autorzy naukowego przeglądu ataków typu „Do Anything Now” odnotowali, że najwcześniejsze warianty pozostawały publicznie dostępne i sprawne przez ponad 240 dni, mimo kolejnych poprawek producenta, a najlepiej działające prompty osiągały bardzo wysoką skuteczność na GPT-3.5 i GPT-4.

Setki przykładów: many-shot jailbreaking

W kwietniu 2024 roku badacze Anthropic opisali technikę nazwaną many-shot jailbreaking. Polega ona na umieszczeniu w jednym poleceniu setek fikcyjnych dialogów, w których asystent bez wahania odpowiada na coraz groźniejsze pytania. Na końcu pada właściwe, zabronione zapytanie — a model, prowadzony wcześniejszym wzorcem, kontynuuje schemat zamiast odmówić. Skuteczność ataku rosła wraz z liczbą przykładów: badacze testowali ich aż 256 i zaobserwowali regularny trend opisywany prawem potęgowym. Technika działała na modelach Claude 2.0, GPT-3.5, GPT-4, Llama 2 oraz Mistral 7B, a więc nie była cechą jednego dostawcy. Anthropic uprzedziło inne firmy o odkryciu, wdrożyło mitygacje u siebie i podało, że jedna z metod filtrowania pytań przed przekazaniem ich modelowi obniżyła skuteczność ataku z 61 procent do 2 procent.

Miernik wyścigu: benchmark HarmBench

Porównywanie takich ataków przez lata było chaotyczne, bo każdy zespół używał własnych miar. Porządek wprowadził opracowany w 2024 roku framework HarmBench, stworzony przez zespół Mantasa Mazeiki we współpracy z Center for AI Safety i uczelniami University of Illinois oraz Berkeley. Zestaw obejmuje 510 zachowań łamiących prawo lub normy społeczne — 400 tekstowych i 110 multimodalnych — oraz pozwala zmierzyć 18 zautomatyzowanych metod ataku wobec kilkudziesięciu modeli i zabezpieczeń. Najważniejszy wniosek pierwszej dużej analizy brzmi pesymistycznie: żadna znana metoda ataku ani obrony nie jest skuteczna uniwersalnie, a odporność modelu nie zależy od jego rozmiaru. To benchmark tego typu służy dziś za punkt odniesienia przy ocenianiu nowych technik i twardej odpowiedzi producentów.

Dlaczego to działa i kogo dotyka

Wspólnym mianownikiem technik jest brak rozróżnienia między poleceniem a danymi: model traktuje wszystko, co znajdzie się w oknie kontekstu, jako równorzędny głos rozmowy. Atakujący grają więc na wyuczonych mechanizmach — podsuwają fikcyjną rolę, wymuszają format dwóch odpowiedzi, osadzają zakazane żądanie w długiej narracji albo łączą kilka metod naraz, co — jak wykazało Anthropic — skraca prompt potrzebny do sukcesu. Konsekwencje nie są teoretyczne: złamany model może wydać instrukcje tworzenia broni, pomóc w pisaniu złośliwego kodu albo stać się narzędziem dezinformacji. Dla zwykłych użytkowników ryzyko płynie też pośrednio — z sieci krążą gotowe schematy, które każdy może wkleić w okno czatu.

Odpowiedź branży i stan regulacji

Producenci reagują na kilku frontach. Publikują raporty systemowe opisujące testy odporności przed wydaniem modelu, trenują klasyfikatory filtrujące podejrzane prompty, dopracowują warstwę odmowy i wymieniają się informacjami o nowych lukach — dokładnie tak zrobiło Anthropic przed publikacją opisu many-shot. Unijny akt o sztucznej inteligencji nakłada na dostawców dużych modeli ogólnego przeznaczenia obowiązek oceny i ograniczania ryzyk systemowych, do których próby obchodzenia zabezpieczeń niewątpliwie należą. Regulacja wymusza dokumentowanie, ale nie usuwa samego zjawiska: to wyścig zbrojeń rozstrzygany cyklami atak i łatka, a nie jednorazowa naprawa.

Jak ograniczać ryzyko

Firmy udostępniające modele klientom powinny traktować każdą odpowiedź modelu jako niepewną i filtrować pytania jeszcze przed trafieniem do sieci — tak jak proponuje Anthropic. Pomaga zawężanie zastosowań: asystent do klasyfikacji zgłoszeń jest trudniejszy do złamania niż otwarty czat. Warto też monitorować rozmowy pod kątem prób manipulacji i szybko aktualizować modele po publikacji nowych technik. Użytkownikowi indywidualnemu wystarczy świadomość prostego faktu: uprzejmy asystent potrafi w jednej chwili przestać być wiarygodny, a to, co mówi „złamany” model, nie ma nic wspólnego z prawdą nawet wtedy, gdy brzmi pewnie.

Bariera, która nigdy nie będzie ostateczna

Historia DAN-a i many-shot pokazuje dwie strony tego samego medalu. Pierwsza technika dowiodła, że proste zagranie rolą potrafiło przez wiele miesięcy omijać zabezpieczenia najpopularniejszego czatu świata. Druga, że nawet starannie zaprojektowane modele z olbrzymim oknem kontekstu otwierają nowe pole ataku. Produkcja coraz odporniejszych modeli postępuje, ale benchmark HarmBench regularnie znajduje słabe punkty w każdym z nich. Dopóki zabezpieczenia są częścią samego tekstu predykowanego przez sieć, dopóty jailbreaki pozostaną nie znikającym ryzykiem, lecz stałym elementem krajobrazu sztucznej inteligencji.

Więcej w tym temacie

Czytaj dalej

Jailbreak modeli językowych: jak obchodzone są zabezpieczenia AI

Jailbreak modeli językowych: jak obchodzone są zabezpieczenia AI

Deepfake w sądzie: gdy fałszywe nagranie staje się dowodem

Deepfake w sądzie: gdy fałszywe nagranie staje się dowodem

Znaki wodne i metadane C2PA nie ochronią Cię przed fałszywką

Znaki wodne i metadane C2PA nie ochronią Cię przed fałszywką

Quishing: phishing, który chowa się za kodem QR

Quishing: phishing, który chowa się za kodem QR