Deepfake CFO na wideokonferencji: gdy sztuczny szef każe przelewać miliony
Arup i wideokonferencja, której nie było
W styczniu 2024 roku w hongkongu pracownik działu finansowego głównego miasta Arup — brytyjskiej korporacji inżynieryjno-budowlanej — otrzymał phishingową wiadomość rzekomo od CFO brytyjskiej centrali. Wkrótce potem został zaproszony na spotkanie Microsoft Teams. Na ekranie widział CFO i kilku pracowników centrów finansowych, rozmawiających naturalnie. Po kilkuminutowej „odprawie” poproszono o serię pilnych przelewów na pięć różnych kont bankowych.
Co wydarzyło się później opisała policja Hongkongu w komunikacie prasowym, który kilka dni później trafił na łamy Ars Technica. Wszystkie osoby, które ofiara widziała na ekranie, były wygenerowane przez sztuczną inteligencję jako deepfake. Razem 15 przelewów przekroczyło 200 milionów hongkongzkich dolarów, czyli około 25,6 miliona dolarów amerykańskich. To, według ówczesnego komunikatu policji, pierwszy tego rodzaju przypadek w Hongkongu wieloosobowej deepfake-wideokonferencji, w której jedyną prawdziwą osobą była ofiara.
Zdecydowanie najbardziej uderzające w komunikacie policji jest dopowiedzenie sformułowane przez acting senior superintendent Baron Chan Shun-ching: oszust „nie wchodził w bezpośrednią interakcję” z ofiarą poza sporą autointrodukcją. Wystarczył wizerunek i sztuczny głos, by uwiarygodnić fikcyjny kontekst biznesowy. Oszustwo wykryto dopiero około tygodnia później — brak było aresztowań.
Atak na CEO WPP: jak się obronić
W maju 2024 roku The Guardian opublikował drugi przypadek — tym razem nieudanego oszustwa. Mark Read, dyrektor generalny WPP, największej grupy reklamowej na świecie, stał się celem ataku z wykorzystaniem klonowania głosu. Według relacji Reada, przesłanej w mailu do kolegów i cytowanej później przez prasę: „Wszyscy musimy być czujni wobec technik, które się pojawiają”.
Oszuści stworzyli konto WhatsApp z publicznie dostępnym zdjęciem Reada i ustawili spotkanie Microsoft Teams z jego awatarem i drugim przedstawicielem kierownictwa WPP. Wykorzystali klon głosu CEO oparty o materiały z YouTube. Scammer podszywał się pod Reada „off-camera” komunikując się przez okno chatu. Atak się nie powiódł — w komunikacie WPP padło jednoznaczne sformułowanie: „ataku nie udało się dokonać”.
Dwukierunkowe porównanie incydentów jest instruktorem. W Hongkongu pracownik znał CFO zaledwie z kilku wideokonferencji, miał silną presję hierarchiczną i zależność od autorytetu. W WPP pracownik widział wyraźnie, że coś nie pasuje do naturalnego stylu szefa. Wystarczyła nieskładność narracji i brak naturalnych gestów, by uruchomić podejrzenie.
New Hampshire: deepfake głosu prezydenta Bidena i kara FCC
Przełomowym precedensem prawny dotyczącym nadużycia klonowanego głosu stała się sprawa New Hampshire z początku 2024 roku. W maju 2024 roku NPR opublikował artykuł, w którym ujawnił, że FCC (Federal Communications Commission) zaproponowała karę 6 milionów dolarów dla Steve’a Kramera — demokratycznego konsultanta politycznego, który przyznał się do zlecenia masowej automatycznej rozmowy telefonicznej z użyciem sklonowanego głosu prezydenta Bidena. Głos wysyłano tysiącom mieszkańców New Hampshire w przeddzień styczniowych prawyborów 2024; treść zachęcała Demokratów do niewzięcia udziału w głosowaniu.
Kramer został oskarżony karnie w czterech hrabstwach New Hampshire: trzynaście zarzutów tłumienia głosów wyborców (ang. voter suppression, felony) oraz trzynaście zarzutów podszywania się pod kandydata (ang. impersonating a candidate, misdemeanor). FCC zaproponowała także karę 2 milionów dolarów dla Lingo Telecom — firmy przekazującej tę automatyczną rozmowę. W lutym 2024 roku FCC orzekła, że używanie głosów generowanych przez sztuczną inteligencję w automatycznych rozmowach telefonicznych jest nielegalne — kluczowy przepis regulujący nadużycia klonowanego głosu w komunikacji telefonicznej.
Ten precedens pokazuje, że skalowanie klonowania głosu nie ogranicza się do ataków B2B — osiągnęło również sferę wyborczą. Kary nakładane przez FCC są finansowe, ale Kramerowi grożą dodatkowo zarzuty karne, które mogą skończyć się więzieniem. To sygnał do izolatorów technologii deepfake: odpowiedzialność karna jest realną konsekwencją użycia AI do tłumienia wyborców i manipulacji wyborami.
Anatomia oszustwa deepfake CFO
Typowy scenariusz oszustwa deepfake CFO (ang. CEO fraud lub business email compromise przez deepfake) składa się z czterech faz:
- Reconnaissance: oszuści zbierają publiczne fragmenty głosu i wizerunku ofiary — najczęściej z wykładów YouTube, podcastów, profili LinkedIn, konferencji prasowych z lat ubiegłych.
- Trening modelu: do stworzenia klonu głosu wystarcza kilka sekund próbki. Klon reprodukuje barwę, rytm i manierę mówienia do stopnia, w którym rozmówca ma trudność z weryfikacją.
- Konstrucja kontekstu: założenie fałszywej tożsamości e-mail lub WhatsApp i zaproszenie na Meeting Teams / Zoom. W deepfake-wideokonferencji uczestnicy są w pełni syntetyczni.
- Wciśnięcie przelewu: żądanie natychmiastowego transferu pod pretekstem pilnej transakcji, przejęcia firmy, akwizycji lub prywatnego rozliczenia księgowego.
W Hongkongu wszystkie te fazy zostały zrealizowane. W WPP zatrzymała je trzecia faza — weryfikacja poza kanałem, oczywisty test tożsamości, którego oszust nie mógł przejść, bo odniósł się tylko do publicznego materiału.
Poduszki ochronne dla firm
W dobie powszechnego klonowania głosu organizacje powinny wdrożyć kilka praktyk:
- Procedura weryfikacji offline: każda transakcja powyżej określonego progu powinna być potwierdzona drugim kanałem — telefonicznie na numer z białej listy lub osobiście z autoryzowanym pracownikiem.
- Kody autoryzacji głosowej: pary firmowe mogą ustalić prywatne hasło autoryzacyjne niewykrywane z publicznych materiałów.
- Ograniczenia w dostępie do głosu publicznego: wykłady, podcasty i przesłanki medialne CEO powinny być analizowane właśnie jako „treningowy materiał” dla atakujących.
- Szkolenia świadomościowe: sytuacje nagłego przelewu pod „pretekstem CEO” zawsze winny uruchamiać alarm — to obecnie najbardziej klasyczna taktyka oszustwa deepfake.
Oszustwa z klonowaniem głosu to jeden z głównych sektorów cyberoszustw finansowych w połowie bieżącej dekady. Konieczność ochrony rośnie wraz z postępem modeli głosowych — tańszych, szybszych i dokładniejszych co miesiąc. Sprawa New Hampshire z 2024 roku i kara FCC dla Steve’a Kramera jest wyraźnym sygnałem, że organy federalne oficjalnie traktują nadużycia klonowanego głosu jako naruszenie prawa wyborczego i komunikacyjnego.
Wnioski
Incydenty Arup, WPP i sprawa New Hampshire pokazują, że technologia deepfake audio przeszła od ciekawostki konferencyjnej do narzędzia codziennego przestępców finansowych i politycznych. To nie kategoria eksperymentalna — to odtąd istotny element warstwy operacyjnej kradzieży B2B. Kluczowym czynnikiem ochronnym nie jest jednak sama technologia (np. rozpoznawanie deepfake), lecz wdrożenie prostych procedur organizacyjnych i świadomości krytycznej pracowników — szczególnie tych z dostępem do transferów finansowych.