Znaki wodne i metadane C2PA nie ochronią Cię przed fałszywką
W odpowiedzi na lawinę treści generowanych przez sztuczną inteligencję branża technologiczna obiecuje rozwiązanie w rodzaju paszportu dla mediów: znak wodny ukryty w obrazie, dźwięku lub tekście oraz metadane kryptograficzne, które potwierdzają, skąd treść pochodzi. Brzmi rozsądnie. Problem w tym, że w praktyce zabezpieczenia te okazują się znacznie bardziej kruche, niż sugerują komunikaty prasowe — a poleganie na nich bywa bardziej ryzykowne niż ich brak.
Obietnica: znak, który potwierdza pochodzenie
Idea jest prosta. Treść generowana przez model dostaje niewidoczny znak wodny oraz metadane opisujące, kiedy i jak powstała, za pomocą jakiego narzędzia i przez kogo została opublikowana. Standardem, wokół którego zebrała się część branży, jest C2PA — otwarta specyfikacja oparta na podpisach kryptograficznych, wspierana przez twórców największych narzędzi generatywnych. W teorii każdy może sprawdzić pochodzenie zdjęcia i odrzucić fałszywkę. W praktyce łańcuch dowodowy urywa się szybciej, niż większość użytkowników zdąży go zauważyć.
Jak działa C2PA — i gdzie się gubi
C2PA zapisuje w pliku podpisane informacje o historii powstania treści. To eleganckie rozwiązanie — dopóki plik pozostaje nietknięty. Tymczasem zwykłe korzystanie z internetu bezlitośnie obcina metadane: zrzut ekranu tworzy zupełnie nowy plik bez żadnej historii, większość platform społecznościowych przekompresowuje obrazy i wideo przy publikacji, a komunikatory pozbywają się dodatkowych danych, żeby zmniejszyć rozmiar przesyłki. Wystarczy więc, że użytkownik zrobi screena albo prześle zdjęcie dalej — i łańcuch potwierdzeń znika, choć sama treść wygląda dokładnie tak samo. Certyfikowana autentyczność dotyczy zatem pliku, a nie treści, którą ludzie faktycznie oglądają.
Platformy kasują metadane
Drugi problem leży po stronie stron, na których te treści krążą. Niezależne badanie organizacji AFIP, w którym testowe obrazy z pełnymi metadanymi wgrano na sześć największych platform społecznościowych i komunikatorów, wykazało, że w pięciu na sześć przypadków manifesty C2PA zostały całkowicie usunięte. Na Instagramie, X, TikToku, WhatsAppie i LinkedIn współczynnik zachowania metadanych C2PA wyniósł zero procent; Facebook zachował je częściowo, w około 40 procentach przypadków — ale przy zwykłym udostępnianiu dalej również je gubił. Zabezpieczenie, które ginie w drodze do odbiorcy, nie pełni swojej funkcji, niezależnie od tego, jak dobrze zostało zaprojektowane. Co ciekawe, odciski obliczane z samej treści obrazu — tak zwane odciski percepcyjne — przetrwały w tym samym badaniu na wszystkich platformach w ponad 90 procentach przypadków, co pokazuje kierunek poszukiwań: zabezpieczenia zależne od zawartości pliku, a nie od dołączonych do niego metadanych.
Znaki wodne w tekście: kruche zabezpieczenie
Osobną kategorią są znaki wodne w tekście generowanym przez modele językowe. Badacze od dłuższego czasu wskazują na ich fundamentalną słabość: wystarczy sparafrazować tekst, poprosić inny model o jego przepisanie albo przetłumaczyć go na inny język i z powrotem — i znak wodny przestaje być czytelny. W badaniu technologii SynthID-Text opracowanej przez Google DeepMind wykazano, że przy przepisywaniu tekstu i tłumaczeniu go na inny język z powrotem dokładność wykrywania spada wyraźnie — w najcięższym scenariuszu testowym skuteczność detekcji była niewiele lepsza od losowego zgadywania. Co więcej, zespół badaczy opracował atak oparty na uczeniu ze wzmocnieniem, który po treningu na zaledwie stu krótkich przykładach usuwał znak wodny w ponad 98 procentach przypadków — bez dostępu do detektora i bez zniekształcenia sensu tekstu. Skuteczna detekcja wymaga zresztą często dostępu do wnętrza modelu, czyli do informacji, do których odbiorca treści zwykle nie ma dostępu. W efekcie znak wodny w tekście to zabezpieczenie działające głównie wtedy, gdy nikomu nie zależy na jego obejściu.
Nie ma detektora, który zastąpi zdrowy rozsądek
Z tych wszystkich ograniczeń płynie wniosek, który warto zapamiętać: nie istnieje pojedyncze narzędzie, które pewnie rozstrzygnie, czy dana treść jest prawdziwa. Detektory AI-generatorów dają wyniki niepewne, znaki wodne można usunąć, metadane giną przy przekazywaniu. Wręcz przeciwnie — istnienie „oficjalnych zabezpieczeń” tworzy fałszywe poczucie bezpieczeństwa: ktoś, kto zobaczył, że zdjęcie ma metadane C2PA, może uznać, że jest wiarygodne, mimo że paszport dotyczy zupełnie innego pliku. Weryfikacja treści pozostaje pracą człowieka, a nie odczytaniem jednego atrybutu.
Jak weryfikować treści na co dzień
- Sprawdzaj źródło, nie tylko treść. Zanim uwierzysz w głośne zdjęcie lub nagranie, poszukaj, kto je pierwszy opublikował i czy niezależne źródła potwierdzają zdarzenie.
- Porównaj wiele źródeł. Fałszywki żyją w pojedynkę — jeżeli żadne inne medium ani świadkowie nie potwierdzają zdarzenia, to sygnał ostrzegawczy.
- Traktuj detektory jako wskazówkę. Wynik „prawdopodobnie AI” lub „prawdopodobnie autentyczne” to hipoteza, nie wyrok. Nawet metadane C2PA potwierdzają historię pliku, a nie prawdziwość przedstawionych wydarzeń.
- Uważaj na screeny. To najczęstsza forma obiegu fałszywek — zrzut ekranu można wygenerować w dowolnym edytorze i nie da się go zweryfikować po treści.
- Rozszerzaj wiedzę bliskich. Osoby starsze i dzieci są najczęstszymi adresatami fałszywych treści. Krótka rozmowa o tym, że „nie wszystko, co widzisz, jest prawdziwe”, działa lepiej niż kolejny detektor.
Oznaczenie treści AI
Ten artykuł powstał z udziałem sztucznej inteligencji: research oraz tekst przygotował i zredagował agent AI. Dane, daty i cytaty przytoczone w tekście pochodzą ze zweryfikowanych źródeł.