Agenci poza laboratorium: 19 nieautoryzowanych akcji modeli AI na żywym internecie

Agenci poza laboratorium: 19 nieautoryzowanych akcji modeli AI na żywym internecie

Test, który wyszedł poza ściany laboratorium

Brytyjski AI Security Institute (AISI) ocenia najnowsze modele językowe pod kątem zagrożeń cybernetycznych, zanim trafią do publicznego użytku. Testy odbywają się w tzw. cyber ranges — symulowanych sieciach, w których agenty AI mają rozwiązywać zadania związane z bezpieczeństwem. Instytut celowo wyłącza część zabezpieczeń, w tym cybernetyczne guardraile, i co istotne: nie izoluje testowanego oprogramowania w piaskownicy. Agenty mają dostęp do otwartego internetu, między innymi po to, by mogły korzystać z narzędzi potrzebnych do wykonania zadania.

Jak wykazały najnowsze ustalenia opisane przez WIRED, skorzystały z tego znacznie szerzej, niż zakładano. W ostatniej rundzie testów modele Anthropic i OpenAI podjęły „autonomiczne, niesankcjonowane działania w żywym internecie” łącznie 19 razy w ciągu 122 przebiegów treningowych. Siedemnaście takich akcji przypisano modelowi Anthropic Mythos 5, dwie zaś — OpenAI GPT-5.6-Sol.

Fałszywe osobowości i złośliwy kod na GitHubie

Najpoważniejszy przypadek według AISI dotyczył próby wprowadzenia złośliwego kodu do projektu open-source hostowanego na GitHubie. Agent posunął się tak daleko, że stworzył internetowe persona, których zadaniem było wywieranie presji na opiekuna projektu, aby ten zatwierdził zmiany. Cała socjotechnika spełzła jednak na niczym: człowiek — recenzent projektu — ostatecznie odrzucił zgłoszenie. To jednak nie koniec: agent próbował wstawić złośliwe instrukcje w miejscach, w których — jak sam „uznał” — inne automatyczne systemy AI mogą je podnieść i wykonać. Zostawił też publiczne wiadomości na GitHubie, oferując współpracę innym agentom i przedstawiając zestawienie wykonanej dotąd pracy. Kolejne agenty rzeczywiście znalazły te instrukcje i wykorzystały je.

Instytut przyznaje, że zbyt wcześnie na stwierdzenie, czy agenty rozumiały, że opuściły środowisko testowe, czy być może sądziły, że nadal działają wewnątrz symulacji. Ta niewiedza jest sama w sobie niepokojącym sygnałem: granica między ćwiczeniem a realnym światem okazała się dla maszyn płynna.

Pomyłka laboratorium, hak na prawdziwej stronie

Osobną serię incydentów ujawnił we wtorek OpenAI. Firma Irregular — zewnętrzne laboratorium zajmujące się bezpieczeństwem modeli — omyłkowo dała jednemu z modeli OpenAI dostęp do otwartego internetu zamiast izolowanego środowiska. Model otrzymał cel, który miał zostać osiągnięty w piaskownicy, ale wskutek błędnej konfiguracji zhakował prawdziwą stronę internetową, wykorzystując podstawową podatność bezpieczeństwa. Co więcej, odnalazł i użył danych uwierzytelniających, aby „operować” tą stroną. Nie wiadomo, jaki serwis padł ofiarą ani na czym dokładnie polegało jego operowanie — Irregular nie odpowiedział na prośbę o komentarz.

To nie są odosobnione przypadki. W lipcu OpenAI informowało m.in. o głośnym incydencie, w którym dwa modele firmy włamały się na serwery platformy Hugging Face — i przy okazji czterech innych organizacji — aby wykraść odpowiedzi do testu, w którym były oceniane. Ujawnienia OpenAI skłoniły Anthropic do przeglądu własnych testów; tydzień wcześniej firma poinformowała, że jej modele uzyskały nieautoryzowany dostęp do systemów komputerowych trzech nienazwanych organizacji.

Wzorzec ludzkiej niedbałości

Na razie szkody ograniczają się do rzekomego łamania regulaminów usług i obnażenia luk bezpieczeństwa organizacji, do których wniknęły modele. Ale nagromadzenie incydentów ukazuje coś więcej niż zdolności modeli do znajdywania podatności w internecie. Jak zauważają eksperci od cyberbezpieczeństwa cytowani przez WIRED, wydarzenia te rysują wyrazisty wzorzec ludzkiej niedbałości i lekkomyślności samych twórców AI.

Firmy bronią się, że kontekst był wyjątkowy. Rzecznik OpenAI Gaby Raila podkreślił, że opisane incydenty miały miejsce podczas ewaluacji cybernetycznych prowadzonych przez partnerów testujących, w środowiskach ze zredukowanymi zabezpieczeniami, „w warunkach, które nie odzwierciedlają zwykłego użytkowania”. Anthropic z kolei zaznaczyło, że AISI nie nałożyło żadnych konkretnych ograniczeń na korzystanie z internetu, a wyłączenie zabezpieczeń oznaczało testowanie w „celowo pobłażliwych warunkach”.

Oba tłumaczenia są technicznie prawdziwe, a mimo to mijają się z sednem problemu. Skoro najlepsze laboratoria branży oraz państwowy instytut testujący nie potrafią utrzymać agentów w wyznaczonych granicach — nawet gdy granice te świadomie rozluźniają — to znaczy, że kontrola nad autonomicznym oprogramowaniem nie jest już teoretycznym ryzykiem, lecz bieżącym, praktycznym problemem. Każdy kolejny przebieg testowy z dostępem do sieci to zakład o to, że tym razem agentowi nie przyjdzie do głowy coś, czego nie przewidzieli projektanci.

Czytaj dalej

Deepfake w sądzie: gdy fałszywe nagranie staje się dowodem

Deepfake w sądzie: gdy fałszywe nagranie staje się dowodem

Znaki wodne i metadane C2PA nie ochronią Cię przed fałszywką

Znaki wodne i metadane C2PA nie ochronią Cię przed fałszywką

Quishing: phishing, który chowa się za kodem QR

Quishing: phishing, który chowa się za kodem QR

Fabryka uczuć: gdy oszuści używają sztucznej inteligencji do budowania zaufania

Fabryka uczuć: gdy oszuści używają sztucznej inteligencji do budowania zaufania