Deepfake w korporacji: jak AI zamienia głos i twarz w narzędzie oszustwa
Głos dyrektora finansowego w telefonie przestał być dowodem tożsamości. W 2024 roku inżynieryjna firma Arup straciła około 25,6 mln dolarów po wideokonferencji, podczas której każdy uczestnik — poza jedną osobą z działu finansów — był syntetyczny. Atakujący wykorzystali publiczne nagrania z konferencji i wywiadów, by zbudować realistyczne modele głosu i twarzy. Pracownik autoryzował 15 przelewów, przekonany, że rozmawia z członkami zarządu.
To już nie eksperyment. Według danych Lyrie Research z 2026 roku, incydenty z wykorzystaniem klonów głosowych wzrosły o 680% rok do roku, a ataki typu vishing z udziałem głębokich fałszerstw wzrosły ponad szesnastokrotnie w pierwszym kwartale 2025 w porównaniu z ostatnim kwartalem 2024. FBI w raporcie z 2025 roku odnotowało 893 mln dolarów potwierdzonych strat z kategorii oszustw z udziałem AI, a analitycy szacują, że rzeczywista kwota przekracza 18 mld, jeśli uwzględnić niezgłoszone przypadki. Deloitte prognozuje, że do 2027 roku roczne straty z oszustw finansowych napędzanych przez AI mogą sięgnąć 40 mld dolarów w samych Stanach Zjednoczonych.
Mechanizm jest prostszy niż się wydaje. Wystarczy od trzech do sześćdziesięciu sekund czystego audio, by narzędzie open-source — takie jak XTTS-v2 czy OpenVoice — wygenerowało funkcjonalny klon głosu. Jakość rośnie z ilością materiału: minuta nagrania pozwala na klon, który doświadczony analityk audio ma trudności rozróżnić od oryginału. Klon jest następnie ładowany do oprogramowania zmieniającego głos w czasie rzeczywistym, z opóźnieniem poniżej 400 ms — poniżej progu percepcji rozmówcy. Jeśli atak obejmuje wideo, model face-swap zastępuje twarz atakującego syntetyczną renderką ofiary, a tło jest dopasowywane do biura. Przy jakości 720p i kompresji z typowej wideokonferencji obraz wystarczy, by przejść zwykłą kontrolę wzrokową.
Nie chodzi tylko o pojedyncze przelewy. Atak zakłada złożoną architekturę zaufania: rozmowa głosowa, natychmiastowy e-mail z właściwego — lub skompromitowanego — konta, oraz syntetyczny dokument z podpisem i numerem konta. W przypadku Arup każdy z tych kanałów potwierdzał inne: głos zapewniał autorytet, e-mail dokumentował prośbę, dokument dawał instrukcje. Pracownik, jako podmiot zaufania, nie zweryfikował oddzielnie żadnego z kanałów.
Obrona nie leży w wykrywaniu fałszerstwa przez człowieka. Badania oraz doświadczenia zespołów red team (w tym Mandiant w 2023) pokazują, że nawet wyszkoleni pracownicy poprawnie identyfikują wysokiej jakości deepfakei tylko około jednej czwartej czasu w przypadku wideo. Jeśli to zaufanie jest atakowane z presją czasową i administracyjną, skuteczność maleje dramatycznie. Kluczowe procedury to: dwukanałowa weryfikacja (telefon na znany numer, nigdy podany przez rozmówcę), wymaganie dwóch niezależnych zatwierdzających dla przelewów powyżej progu, oraz ustalony hasło-odpowiedź znane tylko właściwym stronom — coś, czego model głosu nigdy nie ma w dostępie.
Narzędzia do wykrywania syntetycznej mowy rozwijają się, ale pozostają uzupełnieniem, nie zastępstwem. Weryfikacja oparta na stałym numerze, znanym procedurze oraz kulturowym przyzwyczajeniu do zadawania pytań — zamiast polegania na brzmieniu głosu — to najsilniejsza oddzielna kontrola. W świecie, w którym głos przestał być dowodem, jedynym bezpiecznym założeniem jest: nie potwierdzaj przez słuch.