Milczące języki: większość świata poza zasięgiem sztucznej inteligencji

Milczące języki: większość świata poza zasięgiem sztucznej inteligencji

Cyfrowy świat mówi jednym głosem

Na świecie istnieje około siedmiu tysięcy żywych języków. Tymczasem największe modele językowe trenowano na mniej niż setce z nich — tak szacują autorzy prac nad wielojęzycznością, na które powołuje się zarówno literatura naukowa, jak i analizy branżowe opublikowane przez Tolokę. Oznacza to, że zdecydowana większość ludzkości posługuje się na co dzień językami, dla których sztuczna inteligencja jest albo niezdolna do sensownej rozmowy, albo po prostu niebezpiecznie niedokładna. Przepaść ta nie dotyczy wygody tłumaczenia stron internetowych, lecz równego dostępu do wiedzy, usług publicznych i edukacji.

Przyczyna leży w samym mechanizmie budowy modeli. Systemy uczą się na gigantycznych zasobach tekstu zebranych z internetu, a internet jest drastycznie jednojęzyczny. Według danych przywoływanych w literaturze przetwarzania języka naturalnego najpopularniejsze korpusy — Wikipedia i CommonCrawl — zawierają tekstowe dane jedynie dla kilku procent światowych języków. Zespół Xinyi Wang, Sebastiana Rudera i Grahama Neubiga wykazał w pracy z konferencji ACL, że jeden z czołowych modeli pretreningowych obejmował ledwie procent języków globu.

Drugorzędność ma swoją cenę

Skutki są wymierne dla konkretnych ludzi. UNESCO w materiale o afrykańskiej ślepiej plamie sztucznej inteligencji podało, że ChatGPT rozpoznawał jedynie piątą część pisanych zdań w języku hausa, którym w samej Nigerii posługuje się ponad osiemdziesiąt milionów osób. Miliony uczniów musiały więc porzucić naukę we własnym języku i przesiąść się na angielski, by w ogóle korzystać z popularnych narzędzi. To nie jest kwestia elegancji: język koduje kulturę i sposób widzenia świata, a jego marginalizacja osłabia ramy, przez które dzieci interpretują wiedzę.

Model potrafi też pewnie kłamać po swojemu. Gdy badacze zapytali popularne chatboty o liczbę pór roku, odpowiedziały: cztery. W Afryce Zachodniej są ich dwie — deszczowa i sucha — ale systemy wytrenowane na treściach zachodnich nie znają tego kontekstu. Uczniowie internalizujący takie „fakty” uczą się świata obcego własnemu doświadczeniu. Podobnie projekty o dobrych intencjach, jak próba automatycznego przekładania tekstów naukowych na zuluski, radziły sobie słabo nie dlatego, że język jest trudny, lecz dlatego, że w internecie po prostu brakuje go na tyle dużo, by model mógł się nauczyć.

Oddolny sprzeciw i państwowe plany

Reakcja środowisk naukowych i społeczności przychodzi z kilku kierunków. Najbardziej znana jest Masakhane — otwarta wspólnota badaczy rozwijających technologie językowe dla języków afrykańskich metodą partycypacyjną, której uczestnicy opublikowali benchmarki maszynowego tłumaczenia dla ponad trzydziestu języków. Projekt African Next Voices zdigitalizował dziewięć tysięcy godzin nagrań mowy z Kenii, Republiki Południowej Afryki i Nigerii, tworząc otwarte zasoby do trenowania lokalnych modeli. Powstają też aplikacje projektowane od podstaw pod konkretne społeczności, jak matematyczny korepetytor Rori działający przez WhatsApp w Sierra Leone i Ghanie, który w badaniu na ponad tysiącu uczniów wiązał się z poprawą wyników.

Na poziomie instytucjonalnym UNESCO ogłosiło globalny plan działania na rzecz wielojęzyczności ery cyfrowej, przygotowany m.in. po konferencji nt. technologii językowych dla wszystkich w lutym 2025 roku, z naciskiem na suwerenność danych i wsparcie języków zagrożonych. Organizacja szacuje jednocześnie, że ponad połowa wszystkich języków świata grozi wyjściem z użycia — a Organizacja Narodów Zjednoczonych ogłosiła lata 2022–2032 Międzynarodową Dekadą Języków Rdzennych. Regulacje unijne, nakazując ocenę ryzyka dyskryminacji i dostępność systemów wysokiego ryzyka, dają dodatkowy argument za tym, by traktować obsługę mniejszości językowych poważnie.

Co może zrobić pojedynczy człowiek

Dla użytkowników i twórców najważniejsza jest świadomość ograniczeń. Odpowiedzi modelu w rzadkim języku warto weryfikować, bo płynna fraza nie oznacza trafnej treści — badania pokazują, że modele brzmią gładko nawet wtedy, gdy mylą się częściej niż w angielskim. Mniejszościowe społeczności mogą dokumentować własne języki: nagrania mowy, słowniki i korpusy tekstów to dziś strategiczne zasoby, o które warto dbać i których udostępnianiem należy zarządzać na własnych warunkach. Nauczyciele i rodzice mogą pilnować, by technologia nie zastępowała języka domowego, lecz go uzupełniała.

Konkluzja

Sztuczna inteligencja nie musi być machiną jednogłosową, ale tak długo, jak jej twórcy będą trenować modele na kilkudziesięciu językach z siedmiu tysięcy, cyfrowy świat będzie miał swoich pełnoprawnych obywateli i milczącą większość. Los mniejszych języków rozstrzygnie się nie w laboratoriach Doliny Krzemowej, lecz w decyzjach o tym, jakie społeczności zbierają własne dane, kto nimi zarządza i czy technologie językowe trafią do szkół, urzędów i domów poza wielkimi metropoliami. Ruchy takie jak Masakhane dowodzą, że inna przyszłość jest możliwa — pod warunkiem, że potraktujemy różnorodność językową jako infrastrukturę krytyczną, a nie ciekawostkę.

Czytaj dalej

Deepfake w sądzie: gdy fałszywe nagranie staje się dowodem

Deepfake w sądzie: gdy fałszywe nagranie staje się dowodem

Znaki wodne i metadane C2PA nie ochronią Cię przed fałszywką

Znaki wodne i metadane C2PA nie ochronią Cię przed fałszywką

Quishing: phishing, który chowa się za kodem QR

Quishing: phishing, który chowa się za kodem QR

Fabryka uczuć: gdy oszuści używają sztucznej inteligencji do budowania zaufania

Fabryka uczuć: gdy oszuści używają sztucznej inteligencji do budowania zaufania