Dobrowolne obietnice: dlaczego niezależne audyty modeli wciąż są iluzją
Obietnica z Białego Domu
W lipcu 2023 roku Biały Dom ogłosił, że siedem czołowych firm zajmujących się sztuczną inteligencją — Amazon, Anthropic, Google, Inflection, Meta, Microsoft i OpenAI — zobowiązało się dobrowolnie do zarządzania ryzykiem swoich technologii. Zobowiązania obejmowały wewnętrzne i zewnętrzne testy red teaming systemów przed ich publikacją, dzielenie się informacjami o zagrożeniach oraz raportowanie możliwości i ograniczeń nowych modeli. Jak relacjonowały kancelarie prawne komentujące porozumienie, dotyczyło ono jedynie przyszłych generacji modeli potężniejszych od ówczesnej granicy branży.
Kluczowy jest jednak drugi plan tego dokumentu: nie zawierał on żadnego mechanizmu egzekwowania. Jak zauważali prawnicy, jedyną sankcją za złamanie obietnicy mogło być oskarżenie o praktykę wprowadzającą w błąd, gdyby firma publicznie twierdziła coś, czego nie robiła. W praktyce więc największe laboratoria świata same decydowały, co przetestują, kiedy, jak dokładnie i ile z wyników opublikują.
Audyt, który sprawdza sam siebie
Mechanizm zagrożenia tkwi w konfliktie interesów. Testy bezpieczeństwa modeli granicznych kosztują, opóźniają premiery i ujawniają słabości produktu — czyli wszystko to, na czym firmom najbardziej zależy, by unikać. Gdy ten sam podmiot tworzy model, go testuje, pisze raport z testów i decyduje o jego publikacji, mówimy o audycie, który sprawdza sam siebie. Niezależni badacze dostają co najwyżej ograniczony dostęp przez interfejsy programistyczne, bez możliwości zajrzenia do danych treningowych czy wewnętrznych procedur.
Federalna strona stara się to nadrobić: amerykański instytut ds. bezpieczeństwa sztucznej inteligencji, działający przy agencji NIST, prowadzi testy najnowszych modeli tuż przed ich udostępnieniem i opisuje wyniki w publikowanych ocenach. Ale jego możliwości też mają granice — badania są uzależnione od współpracy firm, które same zapraszają instytut do testów swoich produktów, i nie zastępują stałego, prawnie umocowanego nadzoru nad całą branżą.
Liczby potwierdzają nieufność
Skala problemu nie jest tylko teoretyczna. Grupa badaczy ze Stanforda, MIT i Princeton stworzyła Foundation Model Transparency Index, punktujący największych twórców modeli według stu wskaźników przejrzystości. Pierwsza edycja z października 2023 roku wykazała, że średnia ocena całej branży wyniosła zaledwie 37 punktów na sto, a najlepszy wynik — firmy Meta — ledwo przekroczył połowę skali. Najgorsza ocena, jaką dostał Amazon, zamknęła się w kilkunastu punktach.
Po naciskach i poprawkach edycja z maja 2024 roku pokazała wyraźną poprawę: średnia wzrosła do 58 punktów, a czołówka osiągnęła 85. Badacze zaznaczyli jednak obszary trwale ciemne — skład danych treningowych, prawa autorskie i dane osobowe w zbiorach, skuteczność stosowanych zabezpieczeń oraz realny wpływ modeli na użytkowników. Najnowsza edycja indeksu, opublikowana pod koniec 2025 roku, przyniosła smutną konkluzję: jak podał Stanford HAI, firmy wypadły gorzej niż rok wcześniej, a przejrzystość w branży spada. Do oceniano tym razem także nowe podmioty, takie jak DeepSeek, Alibaba czy xAI.
Cena iluzji bezpieczeństwa
Dla zwykłego użytkownika brak niezależnych audytów oznacza, że musi ufać deklaracjom producenta w kwestiach, których nie da się samodzielnie zweryfikować. Czy model został sprawdzony pod kątem pomocy w tworzeniu broni biologicznej? Czy testy wykazały skłonność do dyskryminacji? Czy zabezpieczenia da się obejść trzema prostymi pytaniami? Odpowiedzi na te pytania znamy wyłącznie z materiałów firmowych, których zakres i szczerość reguluje dział marketingu, a nie niezależny standard.
Ryzyko rośnie wraz z rozpowszechnieniem modeli granicznych w medycynie, finansach i administracji publicznej. System wbudowany w procesy decyzyjne bez rzetelnie audytowanej oceny ryzyka przenosi niewidziane wady na miliony decyzji. Historia informatyki zna ten mechanizm doskonale: samocertyfikacja producentów zawsze kończyła się tak samo — odkrywaniem luk dopiero po awarii, gdy szkody już się wydarzyły.
Co mogłoby to naprawić
Realna zmiana wymaga trzech elementów: prawnego obowiązku testów przed premierą, dostępu niezależnych badaczy do modelu i jego dokumentacji oraz ochrony sygnalistów, którzy ujawnią zatajone ryzyka. Element pierwszy częściowo wprowadza unijny AI Act wobec modeli ogólnego przeznaczenia noszących ryzyko systemowe, choć jego pełne stosowanie rozciąga się na kolejne lata. Elementy drugi i trzeci pozostają w większości świata dobrowolne — i właśnie dlatego apel badaczy o obowiązkowe, niezależne audyty wciąż pozostaje aktualny.
Dobrowolne zobowiązania miały sens jako pierwszy krok: nauczyły branżę języka raportowania i normalizują samo pojęcie testów przed premierą. Ale pierwszym krokiem nie jest droga. Dopóki firmy same wybierają, co i komu pokazać, „przetestowano pod kątem bezpieczeństwa” będzie formułą marketingową, a nie gwarancją — a społeczeństwo korzysta z najpotężniejszych technologii naszych czasów w warunkach, o których wie tylko to, co producenci zechciały powiedzieć.