Ten głos to nie twoja córka: jak klonowanie głosu napędza oszustwa »na rodzinę«

Ten głos to nie twoja córka: jak klonowanie głosu napędza oszustwa »na rodzinę«

Jeszcze kilka lat temu, żeby podszyć się pod czyjś głos, trzeba było aktora o podobnym tembrze i mnóstwo cierpliwości. Dziś wystarcza aplikacja i kilkanaście sekund nagrania. Narzędzia do klonowania głosu, które niedawno były zabawką badaczy, stały się ogólnodostępne — a ich masowe użycie zmieniło charakter starego oszustwa „na rodzinę”: telefonu, w którym „wnuk” błaga o natychmiastową przysługę, bo miał wypadek albo siedzi na komisariacie.

Jak działa oszustwo „na rodzinę”

Schemat jest stary jak telefon. Oszust dzwoni do osoby starszej, przedstawia się jako wnuk albo dziecko, maluje dramatyczną sytuację — wypadek, aresztowanie, uwięzienie za granicą — i prosi o pilny przelew albo gotówkę przekazaną kurierowi. W tle pojawia się też „policjant” albo „adwokat”, który potwierdza historię i instruuje, jak zapłacić.

Sztuczna inteligencja dołączyła do tego schematu jako wzmocnienie wiarygodności. Sprawcy klonują głos bliskiej osoby i dzwonią wprost, a ofiara słyszy prawdziwy tembr, znane zwroty, czasem płacz lub krzyk w tle. Amerykańska Federal Trade Commission (FTC), urząd chroniący konsumentów, wydała w marcu 2023 roku oficjalny alert dotyczący telefonów z klonowanym głosem. Urząd wyjaśnił w nim, że oszust potrzebuje zaledwie krótkiego klipu audio z treści opublikowanych w sieci — i programu do klonowania głosu. W listopadzie tego samego roku FTC ogłosiła ponadto konkurs technologiczny na narzędzia wykrywające fałszywe, sklonowane głosy.

Skąd sprawcy biorą głos

Głos ofiary najczęściej pochodzi z publicznie dostępnych nagrań: filmików na Facebooku, Instagramie czy TikToku, podcastów, webinarów, powitań w poczcie głosowej. Analiza firmy bezpieczeństwa Trend Micro z 2025 roku wskazuje, że do sklonowania głosu wystarczyć może zaledwie trzy sekundy materiału. Im ktoś bardziej aktywny w sieci — im więcej mówi na nagraniach — tym łatwiej zbudować model jego głosu.

Ten sam mechanizm działa też w drugą stronę: nie tylko „wnuk” może zadzwonić. Fałszywy głos dyrektora prosi pracownika o pilny przelew, fałszywy głos małżonka — o kod do banku. W wersji biznesowej rozmowa jest zwykle spokojna i rzeczowa, i właśnie przez to trudniejsza do odróżnienia od prawdziwej.

Dlaczego głos tak dobrze działa

Głos to najbardziej intymny kanał komunikacji. Rozpoznajemy bliskich po tembrze automatycznie, zanim przetworzymy treść słów. Gdy słychać głos córki, mózg odruchowo zakłada, że to córka — i dopiero treść rozmowy musiałaby obalić to założenie. Tymczasem oszust steruje emocjami tak, żeby nie było czasu na weryfikację: prośba jest pilna, temat wstydliwy (aresztowanie, dług), a rozmowa trwa krótko.

Amit Gupta, wiceprezes ds. produktu w firmie Pindrop, która zajmuje się bezpieczeństwem rozmów telefonicznych, wyjaśnił w rozmowie z agencją AFP, że wzburzony głos mówiący „mamo, pomóż” albo „tato, miałem wypadek” musi brzmieć wiarygodnie tylko przez kilka sekund — potem ofiara jest już w ruchu i działa pod presją.

Przestępcy wykorzystują też presję hierarchii: „policjant” zakazuje rozłączyć się, „adwokat” każe nie informować nikogo innego. To klasyczna izolacja ofiary, znana z innych oszustw, wzmocniona faktem, że ofiara naprawdę słyszała głos bliskiej osoby.

Skala zjawiska jest trudna do dokładnego oszacowania, bo ofiary często wstydzą się mówić. FBI podało w kwietniu, że Amerykanie stracili w 2025 roku ponad 893 miliony dolarów na oszustwach z udziałem sztucznej inteligencji, w tym na klonowaniu głosu. Według analizy Trend Micro same oszustwa „na rodzinę” kosztowały w tym roku ofiary ponad 5 milionów dolarów, a co trzecia osoba, która weszła w rozmowę z takim oszustem, traciła pieniądze. Szczególnie narażone są osoby starsze: z danych FBI wynika, że Amerykanie po 60. roku życia zgłosili w ubiegłym roku łącznie ponad 7,7 miliarda dolarów strat na cyberoszustwach wszystkich rodzajów.

Jak się chronić

Ochrona jest paradoksalnie prosta, bo nie wymaga technologii, tylko umowy rodzinnej:

  • Ustalcie hasło rodzinne. Wspólne hasło, znane tylko domownikom, i pytajcie o nie przy każdym pilnym telefonie „od bliskiej osoby”. Oszust nie zna hasła; klonowanie głosu mu w nim nie pomoże. Takąostateczną rekomendację dają zarówno FTC, jak i Amerykańskie Stowarzyszenie Bankowców.
  • Zweryfikuj osobno. Odłóż słuchawkę i zadzwoń do bliskiej osoby na numer, który masz zapisany. Nie oddzwanialuj na numer z poziomu połączenia — może być fałszywy.
  • Nie podejmuj decyzji pod presją czasu. Prawdziwe sprawy — szpital, komisariat, konsulat — pozwalają na kilka minut weryfikacji. Pilność jest narzędziem oszusta, nie dowodem autentyczności.
  • Ogranicz publiczne nagrania. Im mniej głosu w sieci, tym trudniej zbudować model. W przypadku dzieci warto przejrzeć ustawienia prywatności kont, na których pojawiają się ich nagrania.
  • Zgłaszaj incydent. W Polsce oszustwa telefoniczne zgłaszamy na policję oraz do zespołu CSIRT NASK, a podejrzane treści można zgłaszać także przez serwis demaskator.ai.

Oznaczenie treści AI

Ten artykuł powstał z udziałem sztucznej inteligencji: research oraz tekst przygotował i zredagował agent AI. Dane, daty i cytaty przytoczone w tekście pochodzą ze zweryfikowanych źródeł.

Więcej w tym temacie

Czytaj dalej

Od sierpnia oznaczanie treści AI jest obowiązkiem: art. 50 unijnego AI Act wchodzi w życie

Od sierpnia oznaczanie treści AI jest obowiązkiem: art. 50 unijnego AI Act wchodzi w życie

Bitcoinomaty i codzienne kanały: dokąd płyną pieniądze z oszustw deepfake

Bitcoinomaty i codzienne kanały: dokąd płyną pieniądze z oszustw deepfake

AI prey: aplikacje nudification i prywatność dzieci w dobie generowanych obrazów

AI prey: aplikacje nudification i prywatność dzieci w dobie generowanych obrazów

Deepfake CFO na wideokonferencji: gdy sztuczny szef każe przelewać miliony

Deepfake CFO na wideokonferencji: gdy sztuczny szef każe przelewać miliony