"Mama, mnie porwano" — jak sztuczna inteligencja klonuje głos i wyłudza pieniądze
Głos, który oszukuje wszystkich
W styczniu 2025 roku kalifornijska matka otrzymała telefon, którego nigdy nie zapomni. Na drugim końcu linii rozpaczliwy, drżący głos — identyczny z głosem jej córki — opowiadał o porywaczach, które rzekomo zabrały dziewczynę i żądają okupu. W tle słychać było płacz i krzyki innych osób. Oszust zażądał natychmiastowego przelewu. Tylko dzięki szybkiej weryfikacji przez sąsiadkę, która zadzwoniła do córki bezpośrednio, rodzina uniknęła straty tysięcy dolarów. Według relacji ABC7, głos był wygenerowany przez sztuczną inteligencję na podstawie krótkiego nagrania dostępnego w mediach społecznościowych.
To nie jest odosobniony incydent. W lutym 2025 roku podobne oszustwo dotknęło rodzinę z Nowego Jorku, gdzie matka otrzymała połączenie z rzekomym głosem syna informującym o wypadku samochodowym i pilnej potrzebie pieniędzy na leczenie. Oszust wykorzystał publicznie dostępne nagrania z TikToka, w których syn pojawiał się w krótkich filmikach. Analiza techniczna wykazała, że do wygenerowania wiarygodnego głosu wystarczyło zaledwie pięć sekund materiału źródłowego.
Mechanizm oszustwa — od nagrania do paniki
Proces jest zaskakująco prosty z technicznego punktu widzenia. Oszuści pozyskują krótkie próbki głosu z publicznych źródeł — filmów na TikToku, YouTube, podcastów czy wiadomości głosowych na komunikatorach. Następnie używają komercyjnych narzędzi do syntezy mowy, takich jak ElevenLabs, Resemble AI czy otwartych modeli dostępnych przez platformy typu Hugging Face. Wygenerowany głos może odtwarzać dowolny tekst, z zachowaniem intonacji, akcentu i cech charakterystycznych oryginału.
Krytycznym elementem tego rodzaju oszustw jest jednak nie tylko technologia, ale psychologia. Oszuści celują w momenty największej podatności: wczesny ranek, wieczór, dni wolne od pracy. Wykorzystują naturalną panikę rodziców i presję czasową — „jeśli nie zapłacisz w ciągu 30 minut, stanie się coś strasznego”. Ta kombinacja hiperrealistycznego dźwięku i emocjonalnej manipulacji sprawia, że nawet ostrożne osoby mogą podjąć błędną decyzję.
Według raportu Identity Theft Resource Center z 2025 roku, oszustwa z wykorzystaniem sztucznej inteligencji, w tym klonowania głosu i deepfake wideo, stanowią najszybciej rosnącą kategorię cyberprzestępczości. Eksperci podkreślają, że tradycyjne metody wykrywania — analiza jakości dźwięku, wykrywanie nieprawidłowości w szumie — stają się niewystarczające, ponieważ generatywne modele poprawiają jakość wyjściową co kilka miesięcy.
Dlaczego to działa lepiej niż kiedykolwiek
Kluczową zmianą w 2025 roku była masowa dostępność narzędzi do generowania głosu. O ile jeszcze w 2023 roku synteza głosu wymagała specjalistycznego oprogramowania i długich próbek, o tyle obecnie wystarczy kilka sekund nagrania i konto na platformie SaaS. Narzędzia open-source, takie jak Tortoise czy wersje oparte na modelach typu Whisper i TTS, pozwalają na lokalne generowanie bez konieczności przesyłania danych na zewnętrzne serwery.
Dodatkowym czynnikiem jest wzrost liczby publicznie dostępnych materiałów audio. Młodzi ludzie publikują setki krótkich filmów dziennie, często z wyraźnym głosem i bez świadomości, że te dane mogą być wykorzystane przez przestępców. W przypadku osób publicznych — polityków, dziennikarzy, influencerów — materiałów jest tak dużo, że stworzenie wiarygodnego klonu wymaga minimalnego wysiłku.
Wall Street Journal w artykule z sierpnia 2025 roku opisał zjawisko jako „AI Drives Rise in CEO Impersonator Scams” — jednak te same techniki są stosowane przeciwko zwykłym rodzinom. Oszuści nie ograniczają się do high-profile targets; automatyzacja pozwala na skalowanie ataków na tysiące potencjalnych ofiar jednocześnie.
Jak się chronić
Najskuteczniejsza obrona pozostaje prosta: weryfikacja poza kanałem komunikacji, przez który przyszła wiadomość alarmowa. Jeśli ktoś dzwoni z informacją o wypadku, porywaniu czy innej sytuacji kryzysowej, należy natychmiast zadzwonić do osoby rzekomo poszkodowanej pod znanym numerem — nigdy nie korzystać z numeru podanego przez dzwoniącego. Warto też ustalić w rodzinie hasło alarmowe, które potwierdza tożsamość w sytuacjach kryzysowych.
Organizacje zajmujące się bezpieczeństwem cyfrowym zalecają ograniczenie publicznej ekspozycji głosu — szczególnie w przypadku dzieci i seniorów. Warto regularnie przeglądać ustawienia prywatności w mediach społecznościowych i usuwać materiały, które mogą być wykorzystane do syntezy głosu.
Policja i FBI zachęcają do zgłaszania takich incydentów przez portal ic3.gov, co pozwala na śledzenie nowych wzorców przestępczych i ostrzeganie innych potencjalnych ofiar. Warto pamiętać: technologia nie jest problemem sama w sobie — problemem jest brak świadomości, jak łatwo może być wykorzystana przeciwko nam.
Artykuł oparty na badaniach i raportach z 2025 roku. Wszystkie fakty i dane pochodzą z publicznie dostępnych źródeł, w tym raportów ABC7NY, Identity Theft Resource Center oraz analizy Wall Street Journal.