Maszyna nie rozumie akcentu: dyskryminacja dialektów w systemach rozpoznawania mowy

Maszyna nie rozumie akcentu: dyskryminacja dialektów w systemach rozpoznawania mowy

Technologia, która słyszy tylko jedną odmianę języka

Automatyczne rozpoznawanie mowy (ASR) przestało być ciekawostką. Napędza asystentów głosowych, napisy w serwisach wideo, dyktowanie notatek przez lekarzy, centra obsługi klienta i systemy rekrutacyjne. W tle tych usług działają modele uczone na gigantycznych zbiorach nagrań — i właśnie tam, według rosnącej liczby badań, kryje się problem: modele te słyszą przede wszystkim jedną, dominującą odmianę języka. W praktyce oznacza to, że użytkownik mówiący z akcentem, dialektem lub w inny niż „standardowy” sposób dostaje system, który działa dla niego wyraźnie gorzej.

To nie jest kwestia wygody, lecz realnej dyskryminacji językowej przeniesionej do świata maszyn. Człowiek oceniający rozmówcę po akcentzie to uprzedzenie, które społeczeństwa od dekad próbują zwalczać. Algorytm popełniający ten sam błąd robi to systematycznie, na skalę milionów interakcji dziennie, i — co gorsza — przybiera maskę obiektywności.

Liczby, których nie da się zignorować

Najsłynniejsze badanie tej luki opublikował w 2020 roku w „Proceedings of the National Academy of Sciences” zespół Allison Koenecke ze Stanford. Naukowcy przetestowali pięć popularnych komercyjnych systemów rozpoznawania mowy — rozwijanych przez Amazon, Apple, Google, IBM i Microsoft — na korpusie nagrań wywiadów z białymi i czarnoskórymi mieszkańcami Stanów Zjednoczonych. Wszystkie pięć systemów radziło sobie wyraźnie gorzej z mową czarnych użytkowników: średni wskaźnik błędów słownych wyniósł około 35 procent dla czarnych mówców wobec 19 procent dla białych — czyli niemal dwukrotnie więcej. Rozbieżność okazała się jeszcze większa przy tych samych zdaniach wypowiedzianych przez różnych mówców, co wskazywało na modele akustyczne niewytrenowane na cechach wymowy afroamerykańskiej odmiany angielskiego (AAVE).

Autorzy wskazali prawdopodobną przyczynę: niedostatek nagrań czarnoskórych mówców w danych treningowych. Co ważniejsze, zaznaczyli, że luka ta może realnie szkodzić — na przykład gdy oprogramowanie automatycznie ocenia nagrania rozmów kwalifikacyjnych albo gdy agencje wymiaru sprawiedliwości transkrybują rozprawy sądowe. W 2024 roku Koenecke wraz ze współpracownikami opublikowała kolejne badanie, już o modelu Whisper firmy OpenAI: w około jednym procencie transkrypcji model dopisywał całe zmyślone zdania, których w nagraniu w ogóle nie było, a niemal cztery dziesiąte tych halucynacji zawierało treści szkodliwe — w tym przemoc, fałszywe skojarzenia czy podszywanie się pod autorytety. Halucynacje pojawiały się częściej u osób mówiących z dłuższymi pauzami, na przykład z afazją. W kontekście sądowym czy więziennym taka zmyślona wypowiedź może zostać potraktowana jako fakt zapisany w oficjalnym dokumencie.

Od asystenta po salę sądową

Skutki sięgają daleko poza irytację użytkownika asystenta głosowego. Badania jakościowe, m.in. opublikowane w „Frontiers in Artificial Intelligence” zespół Zion Mengesha, pokazały, że czarnoskórzy użytkownicy czują się przez te błędy „inni” — technologia daje im sygnał, że nie została stworzona z myślą o nich. Zdecydowana większość badanych przyznawała, że modyfikuje własną mowę, by być zrozumianym przez maszynę: rezygnuje z rodzimej gramatyki i wymowy. To forma niewidzialnej pracy, której nie wymaga się od użytkowników mówiących standardową odmianą języka.

Stawka rośnie tam, gdzie transkrypcja staje się dokumentem. W sądach zapis zeznań bywa podstawą orzeczeń; w medycynie dyktowane notatki trafiają do historii choroby; w rekrutacji automatyczna ocena wypowiedzi kandydata może zdecydować o odrzuceniu aplikacji. Badanie opublikowane pod koniec 2024 roku dotyczące komunikacji pacjent–pielęgniarka w opiece domowej wykazało, że wszystkie cztery testowane systemy ASR osiągały gorszą dokładność dla czarnych pacjentów. Każdy taki błąd to potencjalnie zniekształcona informacja o stanie zdrowia człowieka.

Warto dodać, że problem nie dotyczy wyłącznie angielskiego. Podobne mechanizmy grożą każdemu językowi o silnym zróżnicowaniu regionalnym — także polszczyźnie z jej gwarami śląską, podhalańską czy kaszubską oraz akcentami osób uczących się języka. System trenowany głównie na starannej mowie prezenterów będzie systematycznie zawodził tam, gdzie ludzie mówią inaczej.

Jak naprawiać i jak się chronić

Rozwiązania są znane, choć wymagają inwestycji. Fundamentem jest zbieranie zróżnicowanych danych treningowych obejmujących dialekty, akcenty i mowę osób z niepełnosprawnościami — dokładnie to rekomendowali autorzy badania z 2020 roku. Konieczne są też regularne audyty jakości rozpoznawania mierzane osobno dla poszczególnych grup mówców, a nie tylko średnia dla całego korpusu testowego. Regulacje takie jak unijny AI Act zaczynają wymuszać dokumentowanie i ocenę systemów wysokiego ryzyka, do których zaliczają się narzędzia stosowane w wymiarze sprawiedliwości czy zatrudnieniu.

Użytkownik może bronić się na kilka sposobów. Przede wszystkim: nie traktować automatycznej transkrypcji jako rozstrzygającej. W sprawach urzędowych, medycznych i prawnych warto żądać potwierdzenia przez człowieka, sprawdzać zapis pod kątem zniekształceń i zgłaszać błędne rozpoznania dostawcy usługi — każde takie zgłoszenie to sygnał, że model zawodzi. Osoby, których mowa jest regularnie błędnie rozpoznawana, mają też mocniejszy argument: dyskryminacja pośrednia ze względu na pochodzenie czy niepełnosprawność jest w Unii Europejskiej zakazana, a system, który działa gorzej dla określonej grupy, może naruszać prawo równego traktowania.

Konkluzja jest jednoznaczna. Maszyna, która nie rozumie akcentu, nie jest jedynie niedopracowanym gadżetem — jest cyfrowym odpowiednikiem uprzedzenia, które społeczeństwa próbowały przezwyciężyć przez pokolenia. Dopóki systemy rozpoznawania mowy będą trenowane na jednej odmianie języka, będą milcząco wyznaczać, czyj głos się liczy. Sprawiedliwość technologiczna zaczyna się od prostego postulatu: każdemu mówcy należy się taka sama jakość odsłuchania.

Czytaj dalej

Deepfake w sądzie: gdy fałszywe nagranie staje się dowodem

Deepfake w sądzie: gdy fałszywe nagranie staje się dowodem

Znaki wodne i metadane C2PA nie ochronią Cię przed fałszywką

Znaki wodne i metadane C2PA nie ochronią Cię przed fałszywką

Quishing: phishing, który chowa się za kodem QR

Quishing: phishing, który chowa się za kodem QR

Fabryka uczuć: gdy oszuści używają sztucznej inteligencji do budowania zaufania

Fabryka uczuć: gdy oszuści używają sztucznej inteligencji do budowania zaufania