Głos, który brzmiał znajomo: Scarlett Johansson kontra OpenAI
Oferta, odmowa i głos „z filmu”
Historia zaczęła się na długo przed skandalem. W filmie „Her” z 2013 roku Scarlett Johansson użyczyła głosu sztucznej inteligencji, która stała się kinowym wzorcem tego, jak ma brzmieć „myśląca maszyna”. Sam Altman, szef OpenAI, publicznie przyznawał, że to jego ulubiony obraz o sztucznej inteligencji. We wrześniu 2023 roku zaproponował więc aktorce współpracę przy asystencie głosowym ChatGPT — jak relacjonowały NPR i CNN, Johansson odmówiła z powodów osobistych.
Mimo tej odmowy podczas prezentacji modelu GPT-4o w maju 2024 roku świat usłyszał asystenta mówiącego głosem nazwanym „Sky”. Tuż przed pokazem Altman zamieścił w mediach społecznościowych wpis złożony z jednego słowa: „her” — jednoznacznego nawiązania do filmu. Według oświadczenia aktorki dwa dni przed prezentacją jej agent otrzymał kolejną prośbę o ponowne rozważenie propozycji; kontakt nastąpił już po tym, jak system trafił do użytkowników.
„Zszokowana i rozgniewana”
W oświadczeniu przekazanym przez NPR Johansson napisała, że usłyszała demo „w szoku, gniewie i niedowierzaniu”, bo głos brzmiał tak łudząco podobnie, że najbliżsi przyjaciele aktorki ani serwisy informacyjne nie potrafili go odróżnić od jej własnego. Podkreśliła, że w czasach, gdy wszyscy mierzą się z podróbkami i ochroną własnej tożsamości, takie pytania wymagają pełnej przejrzystości i odpowiednich przepisów.
OpenAI broniło się, że głos „Sky” należy do innej profesjonalnej aktorki używającej własnego naturalnego głosu, obsadzonej jeszcze przed jakimkolwiek kontaktem z Johansson, i że nigdy nie miał jej przypominać. Firma nie ujawniła jednak nazwiska lektorki, powołując się na ochronę prywatności. Ta wersja wydarzeń nie uspokoiła opinii publicznej: kontekst wcześniejszych negocjacji, osobista prośba Altmana i celne nawiązanie do filmu sprawiały, że przypadkowość podobieństwa trudno było uznać za niewinną.
Dwa pisma procesowe wysłane przez prawników aktorki wystarczyły, by sprawa zakończyła się szybciej, niż ktokolwiek przewidywał. Już 20 maja 2024 roku, kilka dni po prezentacji, OpenAI ogłosiło wstrzymanie korzystania z głosu „Sky” we wszystkich swoich produktach, a Altman przeprosił za „niejasną komunikację”. Nie doszło do procesu sądowego — ale spór na zawsze zmienił sposób, w jaki branża technologiczna myśli o głosach.
Prawo, które nie nadąża za klonowaniem
Jak analizuje American Bar Association, sprawa odsłoniła poważną lukę w amerykańskim systemie prawnym. W USA nie istnieje jednolita federalna ustawa chroniąca wizerunek — ochrona prawa do wizerunku jest regulowana oddzielnie w każdym stanie, co oznacza, że poziom zabezpieczeń zależy od miejsca zamieszkania. Przed sądami stanowymi precedensy wypracowano już dawno temu: Bette Midler wygrała w 1988 roku z producentem samochodów, który wynajął naśladowniczkę jej głosu do reklamy, a cztery lata później podobnie Tom Waits. Kwestią otwartą pozostaje jednak, czy te orzeczenia obejmują głos syntetyczny, który nikogo konkretnego nie naśladował nagraniem, tylko został wygenerowany od zera.
Kongresowe podkomisje zainteresowały się sprawą na tyle mocno, że zaproszono Johansson do zeznań, choć aktorka ostatecznie nie złożyła świadectwa. Federalne projekty ustaw dotyczące cyfrowych sobowtórów, w tym znana jako No FAKES inicjatywa, wciąż czekają na uchwalenie. Jedyny szybki ruch prawny nastąpił w węższym obszarze: Federalna Komisja Łączności uznała generowane przez AI głosy w automatycznych połączeniach telefonicznych za nielegalne.
Co ta historia znaczy dla zwykłych ludzi
Głos Johansson miał szczęście — słyszały go miliony i natychmiast rozpoznano podobieństwo. Lektorzy, aktorzy głosowi, prezenterzy czy nauczyciele nagrywający materiały edukacyjne takiego rozgłosu nie mają, a właśnie ich profesję technologia klonowania dotyka najbardziej. Wystarczy krótka próbka dźwięku, by sieć neuronowa nauczyła się czyjejś mowy; ofiarom podszywania się pod cudzy głos trudno udowodnić szkodę, gdy prawo nie mówi wprost, że głos jest własnością człowieka.
Ochronę warto budować na kilku poziomach. Profesjonaliści powinni zabezpieczać prawa do głosu w umowach, dopisując wprost zakaz jego replikacji maszynowej. Firmy i instytucje coraz częściej wprowadzają uwierzytelnianie głosowe — warto wiedzieć, że samo brzmienie głosu przestaje być wiarygodnym dowodem tożsamości. Wreszcie każdy może ograniczyć ilość publicznie dostępnych nagrań swojej mowy i reagować na podróbki zgłoszeniami do platform oraz organów ochrony danych, które w Unii mogą traktować głos jako dane biometryczne.
Konkluzja płynie sama: sprawa Johansson pokazała, że presja opinią publiczną potrafi działać szybciej niż parlamenty, ale jednorazowe ustępstwo jednej firmy nie zastąpi przepisów. Dopóki wizerunek głosu nie zostanie wyraźnie chroniony ustawowo, każdy nasz głos pozostaje surowcem, który można podrobić bez pytania o zgodę.