Klonowanie głosu i vishing 2.0. Dlaczego FBI ostrzega przed rozmową z ”wnuczkiem”
Telefon od dziecka, które nie dzwoniło
W maju 2026 roku mieszkanka Kalifornii Deborah Del Mastro odebrała telefon, w którym usłyszała głos swojej córki. Dziewczyna miała być porwana przez meksykański kartel narkotykowy. Telefon się urywał. Płacz, krzyki, szantaż — wszystko brzmiało tak, jakby w tle rzeczywiście działa się zbrodnia. Kobieta przelała 5400 dolarów, zanim zorientowała się, że rozmawia z algorytmem. Sprawę opisał serwis MoneyWise, powołując się na lokalne ABC7 News.
To nie jest jednostkowy przypadek. W raporcie FBI Internet Crime Complaint Center za 2025 rok, opublikowanym 6 kwietnia 2026, po raz pierwszy wyodrębniono kategorię skarg oznaczonych jako “AI related”. Obejmuje ona wszystkie incydenty, w których poszkodowany sam wskazał, że przestępca wykorzystał sztuczną inteligencję — nie jest tożsama z potwierdzonymi ekspertyzą kryminalistyczną przypadkami użycia AI, ale pokazuje skalę zjawiska. Według tego samego raportu skargi “AI related” zamknęły się kwotą 893 346 472 dolarów, przy 22 364 zgłoszonych incydentach. W podkategorii distress-scam, czyli fałszywych telefonów od “bliskich w tarapatach”, FBI wymieniło klonowanie głosu jako jedno z głównych narzędzi przestępców — łączne straty zgłoszone w tej kategorii w 2025 roku przekroczyły 5 milionów dolarów.
Jak działa atak
Schemat jest powtarzalny. Przestępca zbiera z publicznych źródeł krótki, kilkusekundowy klip głosu ofiary — z TikToka, Instagrama, wywiadu na YouTube, a nawet z wiadomości głosowej w firmowej książce adresowej. Następnie używa darmowego lub taniego modelu syntezy mowy, by wygenerować dowolną wypowiedź w tym głosie. Po drugiej stronie słuchawki siedzi człowiek, który reżyseruje rozmowę: wybiera moment, w którym włącza płacz dziecka, kiedy prosi o pieniądze, kiedy grozi konsekwencjami. Cała rozmowa trwa kilka minut i jest zbudowana tak, by nie dać ofierze czasu na refleksję.
Sprawę dodatkowo komplikuje fakt, że synteza jest coraz tańsza i lepsza. Jeszcze w 2022 roku skuteczne klonowanie wymagało kilku minut nagrania i drogiego modelu. Dziś wystarczy próbka z serwisu społecznościowego, a jakość potrafi zmylić nawet dorosłe rodzeństwo ofiary. Stąd właśnie pojęcie “scamdemic” — terminu, który użyła cytowana przez ABC7 specjalistka ds. bezpieczeństwa.
Inne wektory ataku
Klonowanie głosu nie ogranicza się do fałszywych porwań. FBI od maja 2025 roku ostrzega przed kampanią “Senior U.S. Officials Impersonated”, w której przestępcy podszywają się pod wysokich rangą urzędników państwowych za pomocą SMS-ów i wiadomości głosowych generowanych przez AI. Zaktualizowany komunikat IC3 z 19 grudnia 2025 roku wskazuje, że kampania trwa od 2023 roku i ma na celu wyłudzanie kodów uwierzytelniających, dokumentów, przelewów oraz wprowadzanie ofiar do dalszych kontaktów.
FTC w raporcie z czerwca 2026 roku podała, że łączne straty z oszustw podszywania się (imposter scams) w 2025 roku wyniosły 3,5 miliarda dolarów — najczęściej zgłaszana kategoria oszustw, choć sama FTC zastrzega, że nie wyodrębnia w tej kwocie klonowania głosu. Dla porównania, w 2024 roku ta sama kategoria zamknęła się kwotą 2,95 miliarda dolarów. Wzrost jest wyraźny.
Co można zrobić
FBI w swoich ostrzeżeniach rekomenduje trzy proste kroki. Po pierwsze — ustalić rodzinny kod bezpieczeństwa, słowo lub pytanie, które zna tylko najbliższa rodzina i które można szybko zweryfikować przez telefon. Po drugie — każdy telefon od “bliskiego w tarapatach” weryfikować dzwoniąc na znany numer, a nie oddzwaniając na ten, z którego przyszło połączenie. Po trzecie — ograniczyć publiczną dostępność nagrań własnego głosu, szczególnie tych dłuższych i wyraźnych, które algorytm syntezy mowy wykorzysta najskuteczniej.
Klonowanie głosu to nie jest science fiction — to codzienny problem operacyjny dla zespołów bezpieczeństwa i rodzin. Im dłużej ignorujemy tę technikę jako ciekawostkę, tym łatwiej będzie ją wykorzystać przeciwko nam.