Otwarta baza chińskiego modelu: wyciek danych DeepSeek
Kilka minut i pełen dostęp
Pod koniec stycznia 2025 roku świat mówił niemal wyłącznie o DeepSeek — chińskim startupie, którego model R1 zaprezentowany 20 stycznia wywołał szok na rynkach i zmusił amerykańską konkurencję do tłumaczenia się z kosztów pracy nad modelem. W tym samym tygodniu badacze firmy bezpieczeństwa Wiz postanowili sprawdzić, jak wygląda infrastruktura nowej gwiazdy. Odpowiedź przyszła szybciej, niż ktokolwiek przewidywał: w ciągu kilku minut standardowy przegląd publicznych domen firmy ujawnił bazę danych ClickHouse, która była całkowicie otwarta dla świata i nie wymagała żadnego logowania. Wystarczyło wejść na dwa nietypowe porty serwerów oauth2callback.deepseek.com oraz dev.deepseek.com, by uzyskać możliwość wykonywania dowolnych zapytań.
Co leżało w otwartej bazie
W tabeli o nazwie log_stream znajdowały się ponad milion wpisów dziennika, sięgających co najmniej 6 stycznia 2025 roku. Jak opisał badacz Gal Nagli na firmowym blogu Wiz, wpisy zawierały wprost historię rozmów użytkowników z chatbotem, klucze uwierzytelniające używane przez systemy wewnętrzne, szczegóły infrastruktury oraz metadane działania serwisu. To nie był więc klasyczny wyciek pliku z hasłami — otwarta baza dawała pełną kontrolę nad jej działaniem i mogła prowadzić do podniesienia uprawnień w środowisku DeepSeek. Zdaniem badaczy sprawny intruz mógłby teoretycznie sięgnąć po dalsze dane z serwerów, a nawet próbować poruszać się po innych systemach firmy.
Reakcja firmy i niewiadome
Wiz zgłosiła odkrycie odpowiedzialnie, wysyłając informację na każdy adres e-mail i profil LinkedIn firmy, jaki udało się znaleźć albo odgadnąć. Odpowiedzi nie otrzymano żadnej, ale po około pół godzinie od masowego kontaktu baza została zamknięta dla niepowołanych. Największą zagadką pozostaje jednak to, kto miał dostęp wcześniej. Badacze przyznali w rozmowie z „Wired”, że skoro odkrycie zajęło im kilka minut, trudno zakładać, że byli jedynymi osobami, które trafiły na otwarte dane. Firma nie potwierdziła też nigdy zakresu incydentu ani tego, czy doszło do kradzieży informacji — a to właśnie różnica między chwilową konfiguracją a realnym wyciekiem.
Tempo bez audytu
Sama okoliczność odkrycia jest wymowna. DeepSeek stał się globalnym fenomenem praktycznie z dnia na dzień, a jego systemy — według obserwacji Wiz wzorowane na rozwiązaniach OpenAI aż po format kluczy interfejsu — rozwijano w tempie, które nie zostawiało miejsca na kontrolę bezpieczeństwa przed ekspozycją na cały świat. To klasyczny scenariusz „najpierw skaluj, potem zabezpieczaj”: produkt trafia do milionów ludzi, zanim ktokolwiek sprawdzi podstawowe zasady higieny infrastruktury. Przypadek pokazuje, że rewolucja cenowa i wydajnościowa w sztucznej inteligencji ma swoją ciemną stronę — presja czasu przenosi ryzyko prosto na użytkowników, którzy powierzają czatowi swoje pytania, problemy i czasem dane osobowe.
Regulatorzy ruszają śladem
Incydent bazy był tylko jednym z problemów startupu w tamtych tygodniach. Włoski urząd ochrony danych Garante już 28 stycznia 2025 roku zażądał od chińskich spółek stojących za DeepSeek wyjaśnień, jakie dane osobowe zbiera serwis, na jakiej podstawie prawnej i czy są one przechowywane w Chinach. Dzień później aplikacja zniknęła ze sklepów Apple i Google we Włoszech, a 30 stycznia regulator nałożył natychmiastową blokadę przetwarzania danych włoskich użytkowników, oceniając otrzymane odpowiedzi jako całkowicie niewystarczające. Firmy twierdziły przy tym, że nie działają we Włoszech i nie podlegają unijnemu RODO — co włoski urząd obalił faktami, wskazując też, że polityka prywatności serwisu wprost informuje o przechowywaniu danych w Chinach. Podobny kurs obrała Korea Południowa: w lutym 2025 roku komisja PIPC zawiesiła możliwość nowych pobrań aplikacji, a w kwietniu ogłosiła ustalenie, że DeepSeek przekazywał informacje użytkowników i treści ich zapytań do firm w Chinach i Stanach Zjednoczonych bez wymaganej zgody.
Skutki dla ludzi i jak się chronić
Dla zwykłego użytkownika historia DeepSeek niesie prostą lekcję: każde zdanie wpisane w darmowego chatbota może trafić do logów, a logi mogą trafić wszędzie. Rozmowy z asystentami AI nie są poufne w rozumieniu tajemnicy zawodowej i nie należy powierzać im danych wrażliwych — numerów dokumentów, informacji o zdrowiu, sekretów firmowych. Organizacje powinny z kolei traktować każdą nową usługę AI tak samo jak każdy inny element infrastruktury: wymagać audytu konfiguracji, ograniczeń dostępu i monitoringu, zanim pozwolą pracownikom z niej korzystać. Warto też pamiętać, że szybka reakcja producenta po zgłoszeniu nie oznacza braku szkód — dane mogły zostać pobrane wcześniej i nie da się tego cofnąć.
Tańszy model, drogi błąd
Wyciek DeepSeek zapisał się w historii cyberbezpieczeństwa nie skalą strat, lecz symptomem. Pokazał, że nawet firma potrafiąca zbudować model wstrząsający rynkami światowymi może nie dopilnować podstaw: jednej otwartej bazy wystarczyło, by wystawić ponad milion rekordów z rozmowami i kluczami. Pokazał też, że regulacje działają — Włochy i Korea Południowa zareagowały w ciągu dni, choć dopiero po fakcie. Dopóki wyścig o coraz tańsze i lepsze modele będzie ważniejszy niż rzetelna kontrola, takie incydenty pozostaną regułą, a nie wyjątkiem. Dla użytkowników najbezpieczniejsza zasada brzmi dziś niezwykle prozaicznie: traktuj darmowego asystenta AI jak obcą osobę słuchającą przy stole.