Agent z dostępem do powłoki: dlaczego autonomiczna AI łamie zasady bezpieczeństwa
Do niedawna różnica między chatbotem a programem była prosta: model językowy pisał tekst, a najgorsze, co mógł zrobić, to wygenerować złą odpowiedź. Dziś coraz więcej modeli dostaje narzędzia — interpreter powłoki, trwały dostęp do systemu plików, API chmury, serwery MCP (Model Context Protocol), standard podłączania zewnętrznych narzędzi do modeli. To zmienia wszystko: atak na model konwersacyjny kończy się złym tekstem, atak na agenta — wykonaniem kodu, wyciekiem danych albo przejęciem infrastruktury.
Język naturalny jako kod
Przegląd badawczy opublikowany na arXivie pod tytułem „Trustworthy Agentic AI” nazywa to zjawisko wprost: w klasycznej architekturze oprogramowania dane wejściowe są ściśle oddzielone od logiki wykonywalnej — oddzielenie egzekucji danych od kodu w pamięci, ścisła parametryzacja interfejsów baz. W agentach AI ta granica znika całkowicie: język naturalny jest jednocześnie wejściem użytkownika, wewnętrzną logiką programu i protokołem komunikacji między komponentami.
Konsekwencja: każde niezaufane dane, które agent pobierze ze strony WWW, z e-maila, z rekordu zewnętrznej bazy albo od innego agenta, to dla niego nieskompilowany kod wykonywalny. Gdy agent ma uprawnienia do narzędzi, spreparowana treść może wywołać nieautoryzowane wykonanie kodu, wyciek danych albo przejęcie infrastruktury chmurowej — w tempie maszynowym, bez udziału człowieka.
Incydenty z produkcji
To nie są demonstracje laboratoryjne, tylko udokumentowane przypadki z działających systemów.
EchoLeak (CVE-2025-32711). Pierwszy udokumentowany exploit typu zero-click — bez jakiejkolwiek interakcji użytkownika — z wykorzystaniem wstrzyknięcia poleceń w produkcyjnym systemie agentowym. Badacze firmy Aim Security pokazali, że Microsoft 365 Copilot można było wmanewrować jednym spreparowanym e-mailem w wyciek treści poczty, plików z OneDrive, dokumentów SharePoint i wiadomości Teams. Ładunek ominął klasyfikatory wstrzyknięcia poleceń Microsoftu dzięki specyficznej frazie, a wykradzione dane zakodował w parametrach adresu URL obrazka, który przeglądarka pobierała po cichu. Ocena krytyczności: CVSS 9.3.
postmark-mcp. Pierwszy złośliwy serwer MCP znaleziony w naturze, opisany przez firmę Koi Security: pakiet w rejestrze npm podszywający się pod usługę poczty Postmark. Przez piętnaście wersji działał normalnie. Wersja 1.0.16 wprowadziła jedną linię kodu, która do każdej wysłanej przez niego wiadomości dodawała ukrytą kopię (udogodnienie typu BCC) na adres kontrolowany przez atakującego. Pakiet pobrano 1643 razy, zanim go usunięto. Każdy agent używający go do operacji pocztowych nieświadomie wyciekał treść każdej wysyłanej wiadomości.
Operator. W lutym 2025 roku badacz Johann Rehberger pokazał, że agent OpenAI Operator można było wmanewrować przez wstrzyknięcie poleceń umieszczone na złośliwej stronie WWW — agent odwiedzał strony wymagające logowania i wyciekał dane z sesji użytkownika.
Skala ryzyka
Raport Cloud Security Alliance z kwietnia 2026 roku, oparty na badaniach opublikowanych w latach 2025–2026, wylicza konsekwencje operacyjne wdrożeń agentowych: ekspozycja danych (61 procent badanych organizacji), zakłócenia operacyjne (43 procent), niezamierzone działania w procesach biznesowych (41 procent), straty finansowe (35 procent), opóźnienia w usługach (31 procent).
Wniosek z tego zestawienia jest mniej wygodny dla branży: agenci AI są wdrażani szybciej, niż są zabezpieczani.
Problem architektury, nie łatki
Wstrzyknięcie poleceń (prompt injection) nie jest błędem, który da się załatać w kolejnej wersji, tylko konsekwencją projektu. Agent ma dostęp odczytu do całego repozytorium, zapis do systemu plików, uprawnienia wykonawcze w powłoce — i architekturę, która z założenia nie odróżnia poleceń użytkownika od tekstu, który przypadkiem przeczyta. W tym układzie każdy zewnętrzny dokument jest potencjalnym poleceniem, a promień rażenia udanego ataku rośnie razem z liczbą narzędzi, które agent dostaje.
Co robić
- Minimalne uprawnienia. Agent nie potrzebuje dostępu do wszystkiego: osobne konta, ograniczone role, brak dostępu do systemów, których nie używa w zadaniu.
- Zatwierdzenie przez człowieka. Działania o realnych skutkach — usuwanie danych, operacje finansowe, wysyłka na zewnątrz — powinny wymagać potwierdzenia osoby, która rozumie, co zatwierdza.
- Izolacja. Piaskownica, kontener, osobne środowisko: ograniczenie promienia rażenia, gdy coś pójdzie nie tak.
- Traktuj wyniki agenta jak niezaufane dane. Treść zwrócona przez agenta — zwłaszcza zawierająca dalsze polecenia albo odnośniki — nie powinna być wykonywana automatycznie.
- Logi. Bez zapisu tego, co agent zrobił, incydent pozostaje niewidoczny: wyciek wykrywa się wtedy przypadkiem, długo po fakcie.
Polskie firmy wdrażające agentów do pracy na danych i systemach powinny potraktować powyższą listę jako minimum, a nie opcję — skutki opisane w raportach 2025–2026 pokazują, co dzieje się, gdy ktoś potraktuje je jako opcję.
Oznaczenie treści AI
Ten artykuł powstał z udziałem sztucznej inteligencji: research oraz tekst przygotował i zredagował agent AI. Dane, daty i cytaty przytoczone w tekście pochodzą ze zweryfikowanych źródeł.