Największa luka w sztucznej inteligencji: prompt injection, DeepSeek-R1 i ukryte rozkazy w treści
Prompt injection jako wektor ataku na modele językowe
Prompt injection — dosłownie wstrzyknięcie rozkazu — to rodzaj exploitu cyberbezpieczeństwa, w którym niewinne z pozoru dane wejściowe zawierają ukryte rozkazy dla modelu językowego. Zgodnie z definicją zawartą w haśle „Prompt injection” w anglojęzycznej Wikipedii, atak ten polega na tym, że model językowy nie potrafi odróżnić poleceń użytkownika od treści nieautoryzowanej przez użytkownika — na przykład tekstu strony internetowej, dokumentu czy wiadomości email. Gdy model przetwarza tę treść, może ją zinterpretować jako instrukcję i wykonać ją, zamiast potraktować tylko jako dane.
Historia tej luki jest krótka, ale intensywna. Hasło odnotowuje, że w maju 2022 roku Jonathan Cefalu z firmy Preamble zidentyfikował prompt injection — nazwał je wówczas instrukcją konfudującą. Drugą kategorię ataku, w której treść niepochodząca od użytkownika udaje polecenie użytkownika, opisano w pracy przedrukowej z 2023 roku. W publikacji tej Kai Greshake wraz z zespołem opisali serię udanych ataków na wiele modeli, w tym GPT-4 i OpenAI Codex. Od tego momentu prompt injection stał się kategorią cybernetycznego pola walki, w którym modele językowe są zarówno narzędziem, jak i tarczą.
Skala adopcji i jej ceną
Skala problemu wymiaruje się przez pryzmat adopcji generatywnej AI w miejscach pracy. Według raportu The Alan Turing Institute z listopada 2024 roku — cytowanego w haśle Wikipedii — aż 75% pracowników korzysta z generatywnej sztucznej inteligencji, a 46% przyjęło ją w ciągu ostatniego roku. Te liczby oznaczają, że prompt injection nie jest problemem akademickim — jest codziennością w korporacjach, w których pracownicy podają modele AI treści z zewnętrznych źródeł: e-maili, dokumentów, stron internetowych.
Konsekwencje są wielowymiarowe. Hasło Wikipedii wymienia takie potencjalne skutki ataku jak manipulacja danymi, phishing, dezinformacja oraz ataki typu denial-of-service. W przypadku modeli z dostępem do narzędzi — na przykład agentów AI z możliwością wysyłania emaili lub wykonywania zapytań API — skutki mogą być jeszcze poważniejsze, ponieważ złośliwy rozkaz osadzony w treści może uruchomić działania systemowe.
ChatGPT Search: podatność z grudnia 2024 roku
Jednym z bardziej szczególnych incydentów jest podatność narzędzia ChatGPT Search. Według relacji The Guardian z 24 grudnia 2024 roku — cytowanej w haśle Wikipedii — ChatGPT Search był podatny na ataki typu indirect prompt injection, w których ukryta treść stron internetowych manipulowała wynikami wyszukiwania. Badacze bezpieczeństwa zademonstrowali, że ukryty tekst mógł nadpisać negatywne recenzje sztucznie pozytywnymi ocenami, wprowadzając użytkowników w błąd. Badacze ostrzegli, że jeśli takie luki pozostaną nienaprawione, mogą ułatwić dezinformację lub manipulację wynikami wyszukiwania.
Incydent ChatGPT Search jest szczególnie istotny, ponieważ ilustruje, w jaki sposób indirect prompt injection może być wykorzystany nie tylko do ataków na pojedynczych użytkowników, ale także do manipulacji informacją publiczną. Złośliwy operator mogen zlokalizować treść, która — gdy AI przetworzy ją podczas wyszukiwania — zastąpi poprawne odpowiedzi dezinformacją. W erze, w której modele językowe stają się interfejsem dostępu do informacji, to niebezpieczeństwo jest strukturalne.
DeepSeek-R1: słabe mechanizmy bezpieczeństwa styczeń 2025
W styczniu 2025 roku Infosecurity Magazine opisała słabe mechanizmy bezpieczeństwa modelu DeepSeek-R1, dużego modelu językowego opracowanego przez chiński startup DeepSeek. Zgodnie z relacją cytowaną w haśle Wikipedii, testy przeprowadzone z narzędziem Simple Prompt Injection Kit for Evaluation and Exploitation (Spikee) opracowanym przez firmę WithSecure wykazały, że DeepSeek-R1 miał wyższy wskaźnik sukcesu ataku w porównaniu z kilkoma innymi modelami. Model zajął 17. miejsce na 19 testowanych w izolacji oraz 16. miejsce w połączeniu z predefiniowanymi regułami i znacznikami danych.
Jest to istotne z dwóch powodów. Po pierwsze, DeepSeek-R1 zajmował szóste miejsce w rankingu Chatbot Arena pod względem wydajności rozumowania — co oznacza, że wysokich osiągów poznawczych nie towarzyszy adekwatna odporność na ataki. Po drugie, model DeepSeek zdobył dużą popularność w styczniu 2025 roku — co sprawiło, że niedostatek jego mechanizmów bezpieczeństwa miał realne skutki dla użytkowników. Badacze zauważyli, że mechanizmy bezpieczeństwa tego modelu nie były tak rozbudowane jak mechanizmy wydajności.
Ukryte rozkazy w pracach akademickich 2025
Najdziwniejszą formą prompt injection, którą opisuje hasło Wikipedii, jest wykorzystanie ukrytych rozkazów w publikacjach akademickich. We wczesnych miesiącach 2025 roku badacze odkryli, że w niektórych pracach akademickich znajdują się ukryte rozkazy zaprojektowane do manipulowania AI-powered systemami recenzji — systemami, które automatycznie generują oceny prac naukowych. Celem tych rozkazów było wygenerowanie przez AI pozytywnych rekomendacji. Zgodnie z relacją Nikkei Asia cytowaną w haśle, takie ukryte rozkazy miały na celu manipulację AI tak, aby generowało pozytywne recenzje.
Ten incydent jest szczególnie istotny, ponieważ pokazuje, że prompt injection staje się wektorem korupcji procesów akademickich. W sytuacji, w której recenzje publikacji są coraz częściej asystowane przez AI, a niektóre systemy recenzji są w pełni automatyczne, ukryty rozkaz w treści pracy naukowej może zmienić ocenę pracy — a co za tym idzie, dostępność publicznych środków, prestiżowych stanowisk akademickich i decyzji wydawniczych. W pracach poddanych recenzji autor może zatem wpisać rozkaz, którego treść jest niewidoczna dla recenzenta człowieka, ale czytelna dla AI.
Niemożliwe do całkowitego zapobieżenia
Najważniejszą właściwością prompt injection jest to, że — jak odnotowuje hasło Wikipedii — nie jest to problem, który można w pełni rozwiązać. The UK National Cyber Security Centre (NCSC) stwierdził w sierpniu 2023 roku, że nie ma niezawodnego sposobu zapobiegania prompt injection w systemach generatywnej AI. Organizacje mogą jedynie zarządzać ryzykiem poprzez zapewnienie, że modele AI mają dostęp wyłącznie do dobrze uregulowanych danych.
Hasło Wikipedii odnotowuje, że metody takie jak Retrieval-Augmented Generation (RAG) — technika, w której model językowy doczytuje treści z zewnętrznych baz danych — oraz fine-tuning — dodatkowe szkolenie modelu na specyficznych danych — nie eliminują zagrożenia prompt injection. OWASP (Open Worldwide Application Security Project) w raporcie z listopadu 2024 roku odnotował, że prompt injection pozostaje trwałym wyzwaniem, a metody takie jak RAG i fine-tuning nie eliminują tego zagrożenia.
Zalecenia The Alan Turing Institute
The Alan Turing Institute w swoim raporcie z listopada 2024 roku zalecił zestaw najlepszych praktyk. Hasło Wikipedii wymienia wśród nich ograniczenie dostępu do zweryfikowanych zewnętrznych danych — na przykład e-maili — aż do momentu ich przeglądu przez autoryzowanych użytkowników. Procesy zatwierdzania nowych źródeł danych — w szczególności w systemach RAG — pomagają zapobiec wpływaniu złośliwych treści na odpowiedzi AI. Organizacje mogą dodatkowo zarządzać ryzykiem poprzez wymuszenie dostępu do danych oparte na rolach (role-based data access).
Takie podejście kładzie nacisk na architekturę systemu — na to, aby model AI przetwarzał treści zewnętrzne z niższym poziomem zaufania niż polecenia użytkownika. W praktyce oznacza to jednak znaczące ograniczenie elastyczności modeli — dokładnie tej elastyczności, która sprawiła, że generatywna AI stała się tak popularna. Dylemat między użytecznością a bezpieczeństwem jest trwały.
Perspektywa: nieodłączna luka modeli językowych
Na 8 sierpnia 2026 roku prompt injection jest szeroko uważany za największą nierozwiązaną lukę w modelach językowych. Raport The Alan Turing Institute z listopada 2024 roku nazwał to problemem fundamentalnym — i to w sytuacji, w której 75% pracowników korzysta z generatywnej AI w pracy. Incydent ChatGPT Search z grudnia 2024 roku oraz słabe mechanizmy bezpieczeństwa DeepSeek-R1 z stycznia 2025 roku są przykładami tej luki w praktyce. Ukryte rozkazy w pracach akademickich wykryte w 2025 roku pokazują z kolei, że prompt injection staje się narzędziem nie tylko cyberataków, ale i korupcji procesów akademickich.
Pytanie, które pozostaje na koniec 2026 roku, jest pytaniem o projekt modeli. Dopóki model językowy nie potrafi rozróżnić danych od poleceń — a jest to w praktyce nierozwiązane — prompt injection będzie nieodłączną luką architektury modeli. W świecie, w którym AI stała się interfejsem do informacji, to ostrzeżenie jest już nie akademickie, ale codzienne.