Deepfake glosowe: jak klonowanie głosu stało się bronią w oszustwach
Trzy sekundy, które zmieniają wszystko
Wystarczy trzy sekundy nagrania głosu – fragment rozmowy w telefonie, klip z wideo na portalu społecznościowym, czy nawet dłuższy fragment audycji radiowej. Na ich podstawie współczesne narzędzia są w stanie wygenerować syntetyczny głos, który trudno odróżnić od oryginału. FBI w raporcie za 2025 rok wskazało, że klonowanie głosu stało się jednym z najpowszechniejszych wektorów ataku w oszustwach finansowych.
Skala zjawiska
Zgodnie z danymi FBI Internet Crime Complaint Center (IC3), w 2025 roku po raz pierwszy w 25-letniej historii raportu utworzono osobną kategorię „AI-related”. W tym samym roku zarejestrowano ponad 22 364 skargi związanych z AI, z łącznymi stratami wynoszącymi 893 miliony dolarów. To o 93 procent więcej niż średnia strata na jedną sprawę w ogólnej populacji spraw IC3. Największy participation stanowiły oszustwa inwestycyjne – 632 miliony dolarów – oraz oszustwa typu business email compromise – 30 milionów dolarów.
Jak to działa w praktyce
Atak zazwyczaj zaczyna się od pozyskania krótkiego fragmentu audio. Przestępca może pobrać je z nagrania wideokonferencji, podcastu, a nawet z automatycznej sekretarki firmy. Następnie korzysta z modelu language cloning, który generuje realistyczną replikę głosu ofiary. W połączeniu z deepfake wideo – gdzie twarz ofiary jest nakładana na ciało kogoś innego – atakujący tworzy wizualnie i dźwiękowo przekonującą iluzję.
W 2024 roku inżynier firmy Arup brał udział w wideokonferencji, na której pojawili się rzekomi dyrektor finansowy i inni przełożeni firmy. Transakcja, którą zatwierdzono na podstawie tej „rozmowy”, zakończyła się stratą 25 milionów dolarów. Było to jedno z największych pojedynczych incydentów deepfake w historii.
Dlaczego systemy obrony zawodzą
Tradycyjne mechanizmy weryfikacji tożsamości – hasła, tokeny jednorazowe, weryfikacja głosu – opierają się na założeniu, że kanał komunikacyjny jest bezpieczny. Syntetyczny głos i obraz to złamanie tego założenia. Dodatkowo, zgodnie z danymi Sumsub, share of multi-step AI-driven fraud wzrósł o 180 proc. rok do roku – z 10 proc. w 2024 roku do 28 proc. w 2025 roku. Przestępstwa stają się bardziej złożone, ale także trudniejsze do wykrycia.
Co robić?
Eksperci z Axis Intelligence zalecają wdrożenie warstwowej weryfikacji tożsamości – wielokrotnego sprawdzania tożsamości za pomocą różnych kanałów, w tym osobistych spotkań, kodów SMS i fizycznych tokenów. Kluczowe jest również edukowanie pracowników – sprawdzanie, czy rozmówca na wideokonferencji reaguje naturalnie, czy nie ma opóźnień charakterystycznych dla generowania real-time stream. Jako społeczeństwo potrzebujemy również jasnych przepisów prawnych, które określają, czy syntetyczna treść audio lub wideo ma być traktowana jako dowód w postępowaniu sądowym.
Podsumowanie
Klonowanie głosu przestało być technologią eksperymentalną – stało się towarem. Narzędzia są tanie, dostępne online, a ich jakość rośnie z każdym miesiącem. W miarę jak modeli language generation stają się lepsze, podział między rzeczywistością a fikcją staje się coraz bardziejfluidny. Pytanie nie brzmi, czy take rzeczy się będą działy – one już się działy. Pytanie brzmi, czyưỡimy na to odpowiednio szybko.