„Mój głos to moje hasło”: klonowanie głosu łamie uwierzytelnianie w bankach
Eksperyment, którego banki nie chciały zobaczyć
Przez lata banki przekonywały klientów, że ich własny głos jest wygodniejszym i bezpieczniejszym hasłem niż PIN. Systemy typu Voice ID porównują cechy akustyczne wypowiedzi z zapisanym wzorcem i — na pozór — nie da się ich oszukać bez posiadania cudzego gardła.
W listopadzie 2024 roku reporterka BBC Shari Vahl postanowiła sprawdzić tę obietnicę. Sklonowała własny głos za pomocą ogólnodostępnego narzędzia AI i zadzwoniła do swoich banków. Gdy automat poprosił o potwierdzenie tożsamości frazą „my voice is my password”, odtworzyła nagranie klona. Systemy uwierzytelniania głosowego Santandera i Halifaxu uznały ją za właścicielkę konta — oba razy. Jak opisało BBC, klon zadziałał nawet wtedy, gdy nagranie odtworzono przez słabej jakości głośnik tabletu w domowych warunkach. Banki broniły się, że Voice ID to tylko jedna z warstw zabezpieczeń — ale sam fakt, że pierwsza warstwa puszczona została przez odtwarzacz audio, mówi sporo o trwałości tej warstwy.
Sześć prób do skuteczności 99 procent
Test BBC nie był jednorazowym przypadkiem. Badacze z Cheriton School of Computer Science na University of Waterloo — Andre Kassis i prof. Urs Hengartner — opublikowali w 2023 roku pracę „Breaking Security-Critical Voice Authentication”, prezentowaną na prestiżowym sympozjum IEEE Security and Privacy. Zidentyfikowali oni charakterystyczne ślady, po których mechanizmy obronne rozpoznają syntetyczne audio — i napisali program, który te ślady usuwa, czyniąc klon niemal nierozróżnialnym od prawdziwego nagrania.
Efekt? Atak omijał testowane systemy uwierzytelniania głosowego z efektywnością sięgającą 99 procent przy zaledwie sześciu próbach logowania. W teście wobec komercyjnego Amazon Connect Voice ID pojedynczy atak trwający cztery sekundy dawał 10-procentową szansę powodzenia, a w mniej niż pół minuty przekraczał 40 procent. Co istotne, atak pozostawał skuteczny także po wykonaniu go przez zwykłą sieć telefoniczną — czyli dokładnie tam, gdzie działają infolinie banków.
Dlaczego biometria głosowa zawiodła
Problem jest fundamentalny: biometria działa tylko wtedy, gdy cecha biometryczna pozostaje tajemnicą. Odcisk palca da się stosunkowo trudno podsłuchać — głosu nie. Wystarczy kilka minut nagrań publicznie dostępnych: podcastu, webinaru, konferencji prasowej, nagrania ze spotkania online czy choćby komunikatu pocztowego. Współczesne narzędzia klonujące zamieniają taki materiał w wierną kopię, a badania Waterloo pokazały, że nawet dedykowane mechanizmy wykrywania deepfake’ów można obejść.
Głos był pierwszą biometrią, którą dotknęło to zagrożenie, bo klonowanie głosu stało tanie jako pierwsze. Ale wniosek jest szerszy: każda biometria, która bywa publicznie eksponowana, traci status sekretu — a co za tym idzie, status poświadczenia.
Co powinny zmienić instytucje — i klienci
Dla banków i innych podmiotów używających uwierzytelniania głosowego wnioski są konkretne:
- Nigdy traktować głosu jako jedynego czynnika. Wysokie ryzyko operacji (przelew, zmiana danych, dostęp do środków) powinno wymagać drugiego, niezależnego kanału potwierdzenia — aplikacji na zweryfikowanym urządzeniu, kodu wysyłanego na zarejestrowany numer.
- Weryfikować działanie, nie brzmienie. Zamiast pytać „czy ten głos pasuje?”, lepiej weryfikować wiedzę i historię konta, których oszust nie zna, oraz monitorować anomalie zachowań.
- Zakładać, że detekcja deepfake’ów zawiedzie. Badanie Waterloo pokazało, że liczenie wyłącznie na automatyczne rozpoznawanie syntetycznego audio jest strategią przegraną.
Klienci mogą chronić się po swojej stronie: ograniczać ilość publicznie dostępnych nagrań własnego głosu, ustalać z bliskimi rodzinne hasła weryfikacyjne na wypadek podejrzanych telefonów i traktować każdą prośbę o pilną operację finansową — nawet od znanego głosu — jako wymagającą osobnego potwierdzenia innym kanałem.
Eksperyment BBC i badania z Waterloo zgodnie wskazują jedno: era „mój głos to moje hasło” dobiega końca. Instytucje, które tego jeszcze nie zauważyły, odkryją to najprawdopodobniej dopiero wtedy, gdy padną ofiarą.