Oszustwo głosowe AI: co 46 sekund — nowy wymiar przestępczości
Głos, którego nie ma
W czerwcu 2025 roku firma Pindrop, specjalizująca się w biometrii głosowej, opublikowała raport, z którego wynika, że próby oszustw z wykorzystaniem sztucznego głosu w amerykańskich centrach kontaktowych osiągnęły najwyższy poziom od sześciu lat. Wskaźnik wzrostu tego typu ataków przekroczył 1300 procent w skali rocznej — z jednego incydentu miesięcznie w 2024 roku do około siedmiu dziennie. Sektor ubezpieczeń odnotował skok o 475 procent, bankowość — o 149 procent. Ataki oparte na modyfikacji głosu wzrosły między pierwszym a czwartym kwartałem o 173 procent.
To nie jest już scenariusz z filmów science fiction. W styczniu 2025 roku matka z Kalifornii otrzymała połączenie, w którym słyszała głos identyczny z głosem jej córki — drżący, rozpaczliwy, opisujący rzekome porwanie. W tle słychać było krzyki innych osób. Dopiero weryfikacja przez telefon bezpośredni do córki zapobiegła przekazaniu pieniędzy. Przestępcy wykorzystali krótkie nagranie z mediów społecznościowych, które wystarczyło do wygenerowania hiperrealistycznej imitacji głosu przez narzędzie oparte na sztucznej inteligencji.
Raport FBI z 2025 roku — pierwszy w 25-letniej historii Internet Crime Complaint Center, w którym wydzielono osobną kategorię dla AI jako narzędzia przestępczego — rejestruje 22 364 skargi z atrybucją AI i łączne straty na poziomie 893 milionów dolarów. FBI podkreśla jednak, że jest to wyłącznie dolna granica: większość ofiar nie potrafi rozpoznać, czy w ataku brała udział sztuczna inteligencja. W kategorii oszustw inwestycyjnych ofiary wyraźnie przypisały AI straty w wysokości 632 milionów dolarów, podczas gdy całkowite straty w tej kategorii wyniosły 8,648 miliarda — co oznacza, że atrybucja AI obejmuje mniej niż 8 procent zgłoszeń, mimo że technologia jest znacznie szerzej stosowana.
Szczególnie niepokojący jest rozwój tzw. oszustw awaryjnych (distress scams), w których przestępcy klonują głos członka rodziny, symulując kryzys — porwanie, wypadek drogowy, aresztowanie. W 2025 roku straty z tego typu ataków przekroczyły 5 milionów dolarów według FBI, ale ich skala geograficzna i częstotliwość rosną szybciej niż zdolność organów ścigania do ich katalogowania. Taktyka przestała być ograniczona do podszywania się pod wnucząt i zaczęła obejmować szersze kręgi rodziny i znajomych.
Oszustwo w czasie rzeczywistym
Przestępstwa z wykorzystaniem AI opierają się na dwóch mechanizmach: skali produkcji i wiarygodności treści. Narzędzia generatywne pozwalają przygotować tysiące spersonalizowanych wiadomości, rozmów i połączeń w czasie, który wcześniej wymagałby armii oszustów. FBI wskazuje, że generatory konwersacji AI pozwalają przestępcom prowadzić równocześnie tysiące rozmów budujących zaufanie — każda wygląda na unikalną, a cały proces może trwać tygodnie przed wyłudzeniem funduszy.
W kontekście przestępstw korporacyjnych kluczowy jest atak typu BEC (Business Email Compromise). W 2025 roku straty z tego typu oszustw osiągnęły 3,046 miliarda dolarów. W ramach tej kategorii przestępcy łączą generowanie wiadomości e-mail o tonie i słownictwie charakterystycznym dla kierownictwa z kolejnym etapem — klonowaniem głosu dyrektora finansowego lub prezesa zarządu, który dzwoni, by potwierdzić instrukcje przelewu. FBI dokumentuje ponad 30 milionów dolarów strat z BEC, w których potwierdzono komponent AI. Z uwagi na lukę atrybucji, ta liczba jest niemal na pewno zaniżona.
Co więcej, w 2025 roku odnotowano również przypadki stosowania wideo-deepfake w rozmowach rekrutacyjnych — kandydaci podszywali się pod inne osoby przy użyciu wygenerowanych głosów i obrazów, a celem nie była wyłącznie strata finansowa, ale uzyskanie dostępu do sieci wewnętrznej firmy pod przykrywką legalnego zatrudnienia zdalnego.
Dlaczego obrona zawodzi
Tradycyjne mechanizmy weryfikacji — rozpoznanie głosu, potwierdzenie przez znany numer, zaufanie do tonu rozmowy — przestają być skuteczne, gdy atakujący dysponuje narzędziami generatywnymi. Eksperci z branży bezpieczeństwa podkreślają, że jedyną skuteczną metodą jest weryfikacja poza pasmem komunikacji: zawieszenie rozmowy i oddzwonienie na znany wcześniej numer, zastosowanie potwierdzenia dwuskładnikowego przy przelewach o dużej wartości oraz edukacja pracowników centrów kontaktowych. Pausa dziewięciu sekund — inicjatywa Take9 — to minimalny czas, w którym można zareagować na presję emocjonalną, którą przestępcy celowo wytwarzają.
Warto pamiętać, że każda publikacja krótkiego nagrania głosu w mediach społecznościowych, podcastach czy nawet wiadomościach głosowych stanowi potencjalne źródło materiału treningowego dla przestępców. Im bardziej publiczna jest obecność cyfrowa, tym większe ryzyko wykorzystania wizerunku w ataku syntetycznym.