Głos z cienia: jak deepfake i klonowanie głosu przejmują konta
Gdy głos przestaje być dowodem tożsamości
W ciągu ostatnich dwóch lat granica między autentycznym dźwiękiem a syntetycznym wygenerowanym przez model generatywny zatarła się na tyle, że popularne określenie „deepfake” przestało opisywać jedynie przeróbkę wideo. Dziś to złożony ekosystem: klonowanie głosu z kilkunastu sekund próby, generowanie wideo z tekstu, synteza twarzy w czasie rzeczywistym oraz automatyczne tworzenie scenariuszy socjotechnicznych. A wszystko to z narzędzi, które można pobrać bez opłat.
W raportach branżowych z 2026 roku wskazuje się, że ponad 40% specjalistów finansowych bezpośrednio spotkało się z próbą oszustwa z wykorzystaniem deepfake — a 90% z badanych firm uważa, że przestępcy aktywnie wykorzystują generatywną sztuczną inteligencję w swoich operacjach. Nie są to abstrakcyjne prognozy; to dane z codziennych incydentów, w których atakujący dzwonią jako dyrektor do księgowości, podszywając się pod znać głos i styl mowy, następnie wydają polecenie natychmiastowego przelewu na podany rachunek. W pierwszej połowie 2025 roku same straty z tego rodzaju fraudu przekroczyły 410 milionów dolarów, a pojedyncze zdarzenia sięgały 680 tysięcy dolarów. Niektóre projekcje zakładają, że generatywna AI może generować straty na poziomie 40 miliardów rocznie w globalnym sektorze finansowym do 2027 roku.
Dlaczego to działa?
Kluczowa zmiana nie polega jedynie na jakości syntezy, ale na łatwości dostępu. Głos można sklonować z nagrania trwającego 20–30 sekund — wystarczy jedno nagranie z webinaru, rozmowy telefonicznej lub materiału z konferencji prasowej. Wideo deepfake można wygenerować w około 45 minut przy użyciu darmowego oprogramowania, a jakość wystarcza, by przekonać ofiarę podczas rozmowy wideo. Atakujący nie muszą być ekspertami; w wielu przypadkach korzystają z gotowych usług dostępnych na ciemnym webie lub przez platformy reklamowane w mediach społecznościowych.
Raport Resemble AI z trzeciego kwartału 2025 wskazuje na systematyczne niepowodzenia w moderacji treści: platformy jednocześnie reklamują narzędzia do tworzenia deepfake, a następnie twierdzą, że zwalczają nadużycia. W praktyce oznacza to, że narzędzia do generowania syntetycznych wizerunków pozostają dostępne, a ofiary — zarówno osoby prywatne, jak i przedsiębiorstwa — pozostają bez skutecznych mechanizmów weryfikacji.
Konsekwencje dla prawa i ochrony
Polskie prawo karne przewiduje odpowiedzialność za oszustwo (art. 286 kk) oraz za działania z wykorzystaniem systemów informatycznych. Problem w tym, że przestępstwo nie pozostawia tradycyjnego śladu — nie ma fałszywego podpisu ani sfałszowanego dokumentu, ale jedynie syntetyczny dźwięk i obraz wygenerowany przez model. W kontekście unijnego AI Act systemy generujące treści syntetyczne objęte są obowiązkiem oznaczania jako „AI-generated”, ale wdrożenie tego wymogu w praktyce pozostaje fragmentaryczne.
Dla organizacji kluczowe jest przyjęcie zasady: żadna prośba o przelew, nawet z rozpoznanego numeru telefonu lub znanego adresu e-mail, nie może być realizowana bez dodatkowej weryfikacji przez znany kanał — telefoniczny lub bezpośredni kontakt z osobą podejmującą decyzję. Wzrost jakości syntetycznych mediów oznacza, że zaufanie do pojedynczego źródła przestało być wystarczającą ochroną.
Wniosek
Deepfake nie jest już ciekawostką technologiczną, ale narzędziem codziennym w arsenale przestępców finansowych. Klonowanie głosu, generowanie scenariuszy socjotechnicznych i automatyczne tworzenie treści reklamowych dla usług oszustwa tworzą ekosystem, z którym tradycyjne zabezpieczenia — oparte na hasłach, uwierzytelnianiu dwuskładnikowym i rozpoznawaniu numerów — nie są w stanie skutecznie konkurować. Potrzeba nie tylko technologii wykrywania, ale przede wszystkim zmiany procedur: weryfikacja poza kanałem, ograniczenie uprawnień oraz świadomość, że głos z telefonu może już nie być głosem osoby, którą znamy.