Agenty AI: nowa klasa zagrożeń dla firm i użytkowników
Koniec epoki chatbotów
Przez ostatnie lata dyskusja o ryzykach związanych ze sztuczną inteligencją koncentrowała się na modelach językowych: ich halucynacjach, tendencyjności, wyciekach danych. Agent AI to inna kategoria zagrożeń. W odróżnieniu od biernego chatbota agent autonomicznie wywołuje funkcje systemu operacyjnego, klika w interfejsy aplikacji, tworzy i kasuje pliki, uruchamia inne programy. Może samodzielnie podjąć decyzję, że w imieniu użytkownika wykona przelew, wyśle wiadomość albo pobierze dane z firmowej bazy. To z punktu widzenia bezpieczeństwa zupełnie inna jakość ryzyka.
Co tak naprawdę potrafi agent
Współczesne agenty AI, takie jak AppAgent, SeeAct, PC-Agent czy systemy klasy OpenAI o3 i o4-mini, integrują percepcję multimodalną, zaawansowane wnioskowanie i automatyczną kontrolę urządzeń, w tym przeglądarki, aplikacji biurowych, a nawet całego pulpitu. W warunkach laboratoryjnych potrafią wypełniać formularze, prowadzić użytkownika przez złożone procesy administracyjne, planować wielokrokowe zadania i koordynować pracę kilku narzędzi jednocześnie. Raport opublikowany w maju 2025 roku w magazynie arXiv wskazuje, że ta sama autonomia, która czyni agenty użytecznymi, otwiera drzwi do ataków nieobecnych w klasycznych modelach zagrożeń.
Indirect prompt injection i nie tylko
Najpoważniejszym nowym wektorem ataku jest tzw. indirect prompt injection, czyli wstrzyknięcie instrukcji przez treść, którą agent pobiera z zewnątrz. Wystarczy, że atakujący umieści w dokumencie, na stronie WWW albo w wynikach wyszukiwania zdanie, które agent zinterpretuje jako polecenie od użytkownika. Ponieważ agent działa z uprawnieniami swojego właściciela, polecenie zostaje wykonane: wyciek danych, nieautoryzowany zakup, zmiana ustawień konta, pobranie złośliwego pliku.
Oprócz tego badacze z firmy Microsoft i środowiska akademickiego wymieniają: zatruwanie indeksu RAG (Retrieval-Augmented Generation), w którym kilka podstawionych dokumentów potrafi trwale przekierować odpowiedzi systemu; ataki na pamięć agenta znaną jako AgentPoison; eksploitację wykonywanego kodu w środowisku piaskownicy oraz wzajemną manipulację między agentami, gdy kilka z nich współpracuje w jednym łańcuchu decyzyjnym. Klasyczne systemy ochrony, firewalle aplikacyjne, listy ACL, sygnatury antywirusowe, z reguły nie rozpoznają takich ataków, bo nie pasują one do znanych wzorców.
Cyber threat inflation: ataki stają się tańsze
Szczególnie niepokojący jest efekt, który analitycy nazywają cyber threat inflation. Jeszcze kilka lat temu przeprowadzenie złożonego ataku wymagało zespołu specjalistów i wielu tygodni przygotowań: rekonesans, poszukiwanie podatności, pisanie exploitów, omijanie zabezpieczeń. Według analiz opublikowanych w 2025 roku agenty LLM pozwalają osobom o ograniczonych umiejętnościach przeprowadzić atak niemal autonomicznie i w ciągu godzin, nie miesięcy. Redukuje to barierę wejścia do poziomu, na którym zagrożenie dotyczy już nie tylko dużych korporacji i państw, lecz także małych firm, samorządów i użytkowników indywidualnych.
Co z tego wynika dla zwykłego użytkownika
Nie trzeba być administratorem systemu, żeby odczuć skutki. Wystarczy korzystać z asystenta, który potrafi samodzielnie otwierać strony i wykonywać akcje, a także czytać dokumenty z niezaufanych źródeł. Jeśli wklejamy do czatu z agentem treść znalezioną w internecie, dajemy obcemu dokumentowi możliwość wpływania na to, co agent zrobi w naszym imieniu. Dlatego zalecenia ekspertów sprowadzają się do trzech zasad: ograniczać uprawnienia agenta do absolutnego minimum, nie podawać mu danych wrażliwych bez przemyślenia scenariusza awaryjnego i traktować każdą treść pobieraną automatycznie jako potencjalnie niebezpieczną. Świat agentów to dopiero początek i warto się uczyć, zanim ich producenci nauczą się ich bronić.