„Mój głos to moje hasło”: klonowanie głosu łamie uwierzytelnianie w bankach

„Mój głos to moje hasło”: klonowanie głosu łamie uwierzytelnianie w bankach

Eksperyment, którego banki nie chciały zobaczyć

Przez lata banki przekonywały klientów, że ich własny głos jest wygodniejszym i bezpieczniejszym hasłem niż PIN. Systemy typu Voice ID porównują cechy akustyczne wypowiedzi z zapisanym wzorcem i — na pozór — nie da się ich oszukać bez posiadania cudzego gardła.

W listopadzie 2024 roku reporterka BBC Shari Vahl postanowiła sprawdzić tę obietnicę. Sklonowała własny głos za pomocą ogólnodostępnego narzędzia AI i zadzwoniła do swoich banków. Gdy automat poprosił o potwierdzenie tożsamości frazą „my voice is my password”, odtworzyła nagranie klona. Systemy uwierzytelniania głosowego Santandera i Halifaxu uznały ją za właścicielkę konta — oba razy. Jak opisało BBC, klon zadziałał nawet wtedy, gdy nagranie odtworzono przez słabej jakości głośnik tabletu w domowych warunkach. Banki broniły się, że Voice ID to tylko jedna z warstw zabezpieczeń — ale sam fakt, że pierwsza warstwa puszczona została przez odtwarzacz audio, mówi sporo o trwałości tej warstwy.

Sześć prób do skuteczności 99 procent

Test BBC nie był jednorazowym przypadkiem. Badacze z Cheriton School of Computer Science na University of Waterloo — Andre Kassis i prof. Urs Hengartner — opublikowali w 2023 roku pracę „Breaking Security-Critical Voice Authentication”, prezentowaną na prestiżowym sympozjum IEEE Security and Privacy. Zidentyfikowali oni charakterystyczne ślady, po których mechanizmy obronne rozpoznają syntetyczne audio — i napisali program, który te ślady usuwa, czyniąc klon niemal nierozróżnialnym od prawdziwego nagrania.

Efekt? Atak omijał testowane systemy uwierzytelniania głosowego z efektywnością sięgającą 99 procent przy zaledwie sześciu próbach logowania. W teście wobec komercyjnego Amazon Connect Voice ID pojedynczy atak trwający cztery sekundy dawał 10-procentową szansę powodzenia, a w mniej niż pół minuty przekraczał 40 procent. Co istotne, atak pozostawał skuteczny także po wykonaniu go przez zwykłą sieć telefoniczną — czyli dokładnie tam, gdzie działają infolinie banków.

Dlaczego biometria głosowa zawiodła

Problem jest fundamentalny: biometria działa tylko wtedy, gdy cecha biometryczna pozostaje tajemnicą. Odcisk palca da się stosunkowo trudno podsłuchać — głosu nie. Wystarczy kilka minut nagrań publicznie dostępnych: podcastu, webinaru, konferencji prasowej, nagrania ze spotkania online czy choćby komunikatu pocztowego. Współczesne narzędzia klonujące zamieniają taki materiał w wierną kopię, a badania Waterloo pokazały, że nawet dedykowane mechanizmy wykrywania deepfake’ów można obejść.

Głos był pierwszą biometrią, którą dotknęło to zagrożenie, bo klonowanie głosu stało tanie jako pierwsze. Ale wniosek jest szerszy: każda biometria, która bywa publicznie eksponowana, traci status sekretu — a co za tym idzie, status poświadczenia.

Co powinny zmienić instytucje — i klienci

Dla banków i innych podmiotów używających uwierzytelniania głosowego wnioski są konkretne:

  • Nigdy traktować głosu jako jedynego czynnika. Wysokie ryzyko operacji (przelew, zmiana danych, dostęp do środków) powinno wymagać drugiego, niezależnego kanału potwierdzenia — aplikacji na zweryfikowanym urządzeniu, kodu wysyłanego na zarejestrowany numer.
  • Weryfikować działanie, nie brzmienie. Zamiast pytać „czy ten głos pasuje?”, lepiej weryfikować wiedzę i historię konta, których oszust nie zna, oraz monitorować anomalie zachowań.
  • Zakładać, że detekcja deepfake’ów zawiedzie. Badanie Waterloo pokazało, że liczenie wyłącznie na automatyczne rozpoznawanie syntetycznego audio jest strategią przegraną.

Klienci mogą chronić się po swojej stronie: ograniczać ilość publicznie dostępnych nagrań własnego głosu, ustalać z bliskimi rodzinne hasła weryfikacyjne na wypadek podejrzanych telefonów i traktować każdą prośbę o pilną operację finansową — nawet od znanego głosu — jako wymagającą osobnego potwierdzenia innym kanałem.

Eksperyment BBC i badania z Waterloo zgodnie wskazują jedno: era „mój głos to moje hasło” dobiega końca. Instytucje, które tego jeszcze nie zauważyły, odkryją to najprawdopodobniej dopiero wtedy, gdy padną ofiarą.

Więcej w tym temacie

Czytaj dalej

FBI po raz pierwszy policzyło przestępczość z użyciem AI. Wynik: 893 miliony dolarów w rok

FBI po raz pierwszy policzyło przestępczość z użyciem AI. Wynik: 893 miliony dolarów w rok

Nie tylko pieniądze: psychiczny koszt oszustw z udziałem AI

Nie tylko pieniądze: psychiczny koszt oszustw z udziałem AI

Głos sklonowany — oszustwo przez klonowanie głosu i wideo w 2025 r.

Głos sklonowany — oszustwo przez klonowanie głosu i wideo w 2025 r.

Oszustwo na wnuczka 2.0: jak klonuje się głos z mediów społecznościowych

Oszustwo na wnuczka 2.0: jak klonuje się głos z mediów społecznościowych