Bias tłumaczeń lingwistycznych w AI — co tracimy w maszynowym przekładzie

Bias tłumaczeń lingwistycznych w AI — co tracimy w maszynowym przekładzie

Tłumaczenie AI jako oferta neutralna i jej pułapki

Maszynowe tłumaczenie, szczególnie oparte na dużych modelach językowych (neural machine translation, NMT), jest dziś jedną z najbardziej rozpowszechnionych aplikacji AI. Google Translate obsługuje ponad 130 języków, DeepL oferuje celną jakość dla kilkudziesięciu języków europejskich. Technologia ta jest przedstawiana jako narzędzie demokratyzujące dostęp do informacji, likwidujące bariery językowe. Jest w tym wiele racji — ale bilansem są nieodwracalne straty kulturowe.

Bias tłumaczeń lingwistycznych (ang. linguistic translation bias) pojawia się, gdy systemy AI preferencyjalnie traktują języki i kultury dominujące (angielski, hiszpański, chiński, francuski) kosztem języków marginalizowanych (jidysz, żydowski, polski, węgierski, języki afrykańskie). Skutkuje to trzema problemami:

  1. jakość tłumaczeń do/z języków mniejszościowych jest wyraźnie niższa;
  2. systemy AI normalizują dominację anglosaskich konceptów — tłumacząc kulturowe pojęcia, narzucają anglojęzyczne tło semantyczne;
  3. języki, które nie są digitalnie obecne (według dokumentacji UNESCO, które szacuje, że do 2030 roku zniknie spośród 7000 żywych języków około 3000), znikają z mapy AI.

Zjawisko to zostało dobrze opisane w badaniach E.M. Bender, T. Gebru i in. w „On the Dangers of Stochastic Parrots” (2021), które były krytyczną publikcją etnografii dużych modeli językowych i wskazywały, że duże modele kodują dominację językową i kulturową grupy, z której dane pochodzą.

Przykłady realne: co AI gubi w tłumaczeniu

Pierwszy przykład — tłumaczenie zaimków z języków bez rodzaju gramatycznego (np. angielskiego „the doctor”) na języki z rodzajem (polski, francuski, hiszpański). AI konsekwentnie tłumaczy „the doctor said” na „lekarz powiedział” (forma męska), nawet gdy kontekst wskazuje, że lekarzem jest kobieta. Badanie Vaswani z 2022 roku wykazało, że Google Translate tłumaczy anonimowe zaimki z węgierskiego (język bez rodzaju) na angielski najczęściej jako „he”, a następnie na polski jako „on”, co reprodukuje męskie domniemanie zawodowe.

Drugi przykład — tłumaczenie terminologii prawnej i kulturowej. Systemy AI słabo radzą sobie z terminami, które nie mają bezpośredniego odpowiednika w dominującym języku docelowym. Termin „stare lasy” (prawniczy), „więzienie królewskie”, „prawo lokatorskie” — tych nie sposób adekwatnie przetłumaczyć na angielski, bo pojęcie nie istnieje w common law. AI często wybiera uproszczenie, które zdradza sens prawny (np. „tenant law” na „prawo lokatorskie”, chociaż w angloamerykańskim systemie ten termin nie ma pełnej odpowiedniości).

Trzeci przykład — tłumaczenie literatury postkolonialnej, np. literatury afrykańskiej. Gdy autorka z Nigerii pisze po angielsku, lecz używa słowa pidżynowego, AI tłumaczy je na ogólny angielski z zastąpieniem ogólnym, które zaciera kontekst kulturowy. Powoduje to utratę znaczenia semantycznego, który w oryginalnym tekście był nośny. Model AI preferuje „łagodzenie tekstu”, a nie jego wierność kulturową.

Mechanizmy: dlaczego NMT ma bias lingwistyczny

Bias w systemach tłumaczenia AI wynika z kilku mechanizmów:

  1. Nierównowaga danych treningowych — modele NMT są trenowane na parach równoległych tekstów. Pary te są liczne dla języków wielkich (angielski-hiszpański, angielski-francuski), ale skąpe dla języków marginalizowanych. Jakość tłumaczenia polsko-tureckiego jest znacznie niższa niż polsko-angielskiego, bo równoległych danych jest mniej.
  2. Idiomatyka i kultura — model nie ma kompetencji kulturowej. Tradycja literacka polska (Mickiewicz, Gombrowicz) ma idiomatyczne odniesienia nieobecne w angielskiej. AI tłumaczy je z ubytkiem.
  3. Tendencyjność korpusów — dane treningowe (United Nations Parallel Corpus, Europarl) obejmują teksty formalne, urzędowe, więc AI dobrze tłumaczy „Decyzją Komisji Europejskiej, przyjętą w dniu 14 września…” a słabiej potoczny język społecznościowy.
  4. Anglo-centryczność modeli ogólnych — modele ogólne (GPT-4, Claude, Gemini) są wewnętrznie zorientowane na angielski. Tłumaczenie z polskiego na hiszpański przez LLM często „przerabia się” przez angielski jako język pośredni, co wprowadza dodatkowe straty.

Konsekwencje: dla kultury, dla prawa, dla edukacji

Kultura jest najbardziej określoną ofiarą. Literatura, poezja, film — przekład maszynowy ujednolica stylistykę i gubi niepowtarzalne aspekty lokalne. Dla języków rozproszonych, niepiśmiennych, języków diaspor oznacza to trwałe zatracenie oryginału. Powstaje zjawisko kulturowego zubożenia.

Prawo w UE ma temat bezpośredni. Tłumaczenie aktów prawnych z Polski na angielski jest trudne — i AI często produkuje homogenizację prawną oraz utratę specyfiki. Jeżeli Polak w Londynie negocjuje kontrakt dla firmy z Dubaju, i AI mu pomaga — mogą powstawać błędy niuansowe, których skutki ponosi odpowiedzialność materialna.

Edukacja jest kolejnym polem. Uczniowie korzystający z AI w nauce języków mają dostęp do tłumaczeń, ale uczą się biernego korzystania. AI domyślnie zaleca angielski jako główne odniesienie, co redukuje motywację do nauki mniejszych języków. W Unii Europejskiej kształcenie tradycyjnych języków (galicyjski, baskijski, bretoński) jest pod presją ze strony cyfrowej edukacji opartej na AI.

Regulacja i kierunki

UNESCO w globalnych ramach z 2024 r. „Recommendation on Ethics of AI” wskazuje, że zarządzanie różnorodnością językową jest domyślnym obowiązkiem państw. Rekomenduje działania:

  1. digitalizacja i ochrona języków mniejszościowych — dokumentacja zbiorów danych treningowych, równoległe korpusy dla języków regionalnych;
  2. lokalizacja systemów AI — wymóg, by modele AI rozwijane w danych lokalnych były dostrajane dla regionalnych zastosowań;
  3. odpowiednie kompensacje finansowe dla projektów języków mniejszościowych — krajowe fundusze inwestycyjne;
  4. przejrzystość tłumaczeń — w interfejsach AI musi znaleźć się informacja o jakości ostrzegająca, gdy tłumaczono mniejsze języki, aby użytkownicy wiedzieli, że jakość może być niższa.

EU AI Act w art. 10 wymaga jakości danych dla systemów wysokiego ryzyka, ale tłumaczenia nie są bezpośrednio uregulowane. Tłumacze obsługujący treści dla usług publicznych są kierowani do kategorii wysokiego ryzyka, jeśli podejmują decyzje wpływające na prawa.

Co dalej: wielojęzyczność jako cyfrowe prawo

Jeśli chcemy, aby przyszłość AI była wielojęzyczna, musimy traktować różnorodność językową jako prawo człowieka. Podobnie jak prawo do tożsamości językowej i tłumaczenia, prawo do dostępu usług tłumaczonych jest prawem międzynarodowym.

Dla użytkowników portalu edukacyjnego istotne jest uświadomienie sobie, że tłumaczenie AI — choć jest pomocnym narzędziem — jest „tłumaczem, nie zdrajcą” tylko w innym wymiarze. AI tłumaczy szybko, ale ujednolica niuanse kulturowe. Najlepszym wyjściem jest mieszanka: korzystanie z AI do wstępnego tłumaczenia, a następnie ludzka rewizja wrażliwych tekstów.

Szkockie powiedzenie mówi: „Przekład nie istniałby, gdyby zachować to samo znaczenie w innej formie, spełniał funkcję tożsamości i przekazywania specyfiki, za którą tłumacze są odpowiedzialni”. W nowej erze AI ta odpowiedzialność dostaje nową wagę globalną, a stawką są kolejne małe języki — żywe kultury, które mogą zostać utracone.

Więcej w tym temacie

Czytaj dalej

Gdy algorytm dyskryminuje. Ukryte uprzedzenia AI w rekrutacji i kredytowaniu

Gdy algorytm dyskryminuje. Ukryte uprzedzenia AI w rekrutacji i kredytowaniu

Dyskryminacja algorytmiczna w rekrutacji — jak AI selekcjonuje kandydatów

Dyskryminacja algorytmiczna w rekrutacji — jak AI selekcjonuje kandydatów

AI w bankowości: algorytmy decydują, kto dostanie kredyt w 2026

AI w bankowości: algorytmy decydują, kto dostanie kredyt w 2026

Bias i dyskryminacja w AI — jak algorytmy utrwalają niesprawiedliwość

Bias i dyskryminacja w AI — jak algorytmy utrwalają niesprawiedliwość