Deepfake glosowe: jak klonowanie głosu stało się bronią w oszustwach

Deepfake glosowe: jak klonowanie głosu stało się bronią w oszustwach

Trzy sekundy, które zmieniają wszystko

Wystarczy trzy sekundy nagrania głosu – fragment rozmowy w telefonie, klip z wideo na portalu społecznościowym, czy nawet dłuższy fragment audycji radiowej. Na ich podstawie współczesne narzędzia są w stanie wygenerować syntetyczny głos, który trudno odróżnić od oryginału. FBI w raporcie za 2025 rok wskazało, że klonowanie głosu stało się jednym z najpowszechniejszych wektorów ataku w oszustwach finansowych.

Skala zjawiska

Zgodnie z danymi FBI Internet Crime Complaint Center (IC3), w 2025 roku po raz pierwszy w 25-letniej historii raportu utworzono osobną kategorię „AI-related”. W tym samym roku zarejestrowano ponad 22 364 skargi związanych z AI, z łącznymi stratami wynoszącymi 893 miliony dolarów. To o 93 procent więcej niż średnia strata na jedną sprawę w ogólnej populacji spraw IC3. Największy participation stanowiły oszustwa inwestycyjne – 632 miliony dolarów – oraz oszustwa typu business email compromise – 30 milionów dolarów.

Jak to działa w praktyce

Atak zazwyczaj zaczyna się od pozyskania krótkiego fragmentu audio. Przestępca może pobrać je z nagrania wideokonferencji, podcastu, a nawet z automatycznej sekretarki firmy. Następnie korzysta z modelu language cloning, który generuje realistyczną replikę głosu ofiary. W połączeniu z deepfake wideo – gdzie twarz ofiary jest nakładana na ciało kogoś innego – atakujący tworzy wizualnie i dźwiękowo przekonującą iluzję.

W 2024 roku inżynier firmy Arup brał udział w wideokonferencji, na której pojawili się rzekomi dyrektor finansowy i inni przełożeni firmy. Transakcja, którą zatwierdzono na podstawie tej „rozmowy”, zakończyła się stratą 25 milionów dolarów. Było to jedno z największych pojedynczych incydentów deepfake w historii.

Dlaczego systemy obrony zawodzą

Tradycyjne mechanizmy weryfikacji tożsamości – hasła, tokeny jednorazowe, weryfikacja głosu – opierają się na założeniu, że kanał komunikacyjny jest bezpieczny. Syntetyczny głos i obraz to złamanie tego założenia. Dodatkowo, zgodnie z danymi Sumsub, share of multi-step AI-driven fraud wzrósł o 180 proc. rok do roku – z 10 proc. w 2024 roku do 28 proc. w 2025 roku. Przestępstwa stają się bardziej złożone, ale także trudniejsze do wykrycia.

Co robić?

Eksperci z Axis Intelligence zalecają wdrożenie warstwowej weryfikacji tożsamości – wielokrotnego sprawdzania tożsamości za pomocą różnych kanałów, w tym osobistych spotkań, kodów SMS i fizycznych tokenów. Kluczowe jest również edukowanie pracowników – sprawdzanie, czy rozmówca na wideokonferencji reaguje naturalnie, czy nie ma opóźnień charakterystycznych dla generowania real-time stream. Jako społeczeństwo potrzebujemy również jasnych przepisów prawnych, które określają, czy syntetyczna treść audio lub wideo ma być traktowana jako dowód w postępowaniu sądowym.

Podsumowanie

Klonowanie głosu przestało być technologią eksperymentalną – stało się towarem. Narzędzia są tanie, dostępne online, a ich jakość rośnie z każdym miesiącem. W miarę jak modeli language generation stają się lepsze, podział między rzeczywistością a fikcją staje się coraz bardziejfluidny. Pytanie nie brzmi, czy take rzeczy się będą działy – one już się działy. Pytanie brzmi, czyưỡimy na to odpowiednio szybko.

Więcej w tym temacie

Czytaj dalej

Od sierpnia oznaczanie treści AI jest obowiązkiem: art. 50 unijnego AI Act wchodzi w życie

Od sierpnia oznaczanie treści AI jest obowiązkiem: art. 50 unijnego AI Act wchodzi w życie

Bitcoinomaty i codzienne kanały: dokąd płyną pieniądze z oszustw deepfake

Bitcoinomaty i codzienne kanały: dokąd płyną pieniądze z oszustw deepfake

AI prey: aplikacje nudification i prywatność dzieci w dobie generowanych obrazów

AI prey: aplikacje nudification i prywatność dzieci w dobie generowanych obrazów

Deepfake CFO na wideokonferencji: gdy sztuczny szef każe przelewać miliony

Deepfake CFO na wideokonferencji: gdy sztuczny szef każe przelewać miliony