Pierwszy wyrok w sprawie trenowania AI: co ustalił sąd w sporze Thomson Reuters

Pierwszy wyrok w sprawie trenowania AI: co ustalił sąd w sporze Thomson Reuters

Pierwsze orzeczenie o treningu sztucznej inteligencji

11 lutego 2025 roku sędzia Stephanos Bibas, zasiadający w federalnym sądzie okręgowym w Delaware, ogłosił pierwsze merytoryczne orzeczenie amerykańskiego sądu dotyczące dozwolonego użytku w kontekście trenowania systemów sztucznej inteligencji. W sporze Thomson Reuters przeciwko Ross Intelligence uznał, że startup naruszył prawa autorskie agencji, budując swój wyszukiwarkowy produkt na materiałach platformy Westlaw — a obrona dozwolonym użytkiem nie obroniła się. Choć wyrok nie jest prawomocny, stał się punktem odniesienia dla całej fali procesów toczących się w USA.

Sprawa ma dłuższą historię niż większość głośnych sporów branży technologicznej. Thomson Reuters, właściciel prawniczego serwisu badawczego Westlaw, pozwał startup Ross Intelligence już w 2020 roku, zarzucając wykorzystanie swoich materiałów bez licencji. Firma Ross chciała pierwotnie kupić dostęp legalnie, jednak negocjacje zakończyły się odmową. Ostatecznie sięgnęła po zestawy opracowane przez pośrednika, który tworząc je, wzorował się na redakcyjnych streszczeniach Westlaw.

Streszczenia, które stały się przedmiotem sporu

Sednem konfliktu nie były same orzeczenia sądowe — te w USA są domeną publiczną — lecz tzw. headnotes, czyli krótkie redakcyjne streszczenia kluczowych tez prawnych przygotowywane przez redaktorów Westlaw, oraz system klasyfikacji tematycznej zwany Key Number System. Sędzia Bibas ustalił, że takie opracowania spełniają próg twórczości wymagany do ochrony prawnoautorskiej: distylacja, synteza i wyjaśnianie tez orzeczeń wymaga od redaktora wyboru i oceny, co jest dziełem umysłu chronionego prawem.

Analiza dowodów wykazała, że na blisko trzech tysiącach streszczeń nadających się do rozstrzygnięcia w tym trybie ponad dwa tysiące zostało skopiowanych w sposób bezpośredni. Język pytań szkoleniowych użytych przez startup śledził bowiem bardzo blisko brzmienie streszczeń, a nie samych orzeczeń. Sędzia — były praktykujący prawnik — ocenił podobieństwo osobiście, przeglądając wszystkie porównywane pary tekstów.

Dlaczego dozwolony użytek nie obronił startupu

Ross Intelligence argumentowało, że trenowanie modelu to użycie transformacyjne: maszyna zamienia teksty na reprezentacje liczbowe, a użytkownicy nigdy nie widzą oryginalnych streszczeń. Sędzia Bibas odrzucił ten tok rozumowania. Kluczowe było dla niego przeznaczenie użycia — Ross zbudował produkt konkurujący bezpośrednio z Westlaw, wykonujący tę samą funkcję badawczą, którą streszczenia pełnią u właściciela praw. Do tego doszedł najważniejszy z czterech testów dozwolonego użytku: skutek rynkowy. Jak zapisał sędzia, nawet biorąc wszystkie fakty na korzyść startupu, ten chciał konkurować z Westlaw, tworząc jego rynkowy zamiennik — a potencjalny rynek licencjonowania danych do treningu również zasługuje na ochronę.

Wyrok zawiera też istotne zastrzeżenie: dotyczy wyłącznie sztucznej inteligencji niegeneratywnej, która wyszukuje i wskazuje istniejące dokumenty, a nie tworzy nowych tekstów. Sam sędzia podkreślił, że rozstrzyga sprawę „tylko o niegeneratywnej AI”. To zastrzeżenie ogranicza siłę precedensu wobec modeli językowych generujących nowe treści, choć wskazuje kierunek myślenia sądów: gdy użycie zastępuje oryginał na rynku, argument dozwolonego użytku słabnie dramatycznie.

Koszt po stronie startupu — ostrzeżenie dla całej branży

Najbardziej wymowny jest epilog biznesowy. Ross Intelligence zakończyło działalność jeszcze w 2021 roku, głównie dlatego, że koszty prowadzenia procesu przewyższyły możliwości małej firmy. Jak zauważyła kancelaria Kochański & Partners w komentarzu do wyroku, sprawa pokazuje skalę ryzyka korzystania z danych bez licencji — nawet wtedy, gdy sama technologia jest obiecująca. Sąd dodał zresztą, że startup mógł stworzyć potrzebne materiały treningowe samodzielnie albo zamówić je u dostawcy bez obciążenia cudzymi prawami.

Po ogłoszeniu orzeczenia sąd dopuścił odwołanie do sądu apelacyjnego trzeciego okręgu, jako że pytania o zakres ochrony streszczeń i granice dozwolonego użytku są nowatorskie. Los tej sprawy będzie więc obserwowany uważnie, tym bardziej że inne sądy wypowiadają się różnie: latem 2025 roku sądy w Kalifornii uznały trening na książkach za dozwolony użytek w sprawach przeciw Anthropic i Mecie, ale w tej pierwszej firma zgodziła się później zapłacić autorom miliardowe odszkodowanie za pirackie egzemplarze.

Konkluzja dla praktyki jest prosta. Twórcy narzędzi opartych na sztucznej inteligencji powinni dokumentować pochodzenie danych treningowych, preferować materiały wolne od praw wyłącznych lub objęte licencją, a przy pozyskiwaniu zbiorów od pośredników żądać gwarancji i przejęcia odpowiedzialności za roszczenia. Wyrok z Delaware uczy, że sądy patrzą nie na to, czy maszyna kopiuje teksty widocznie, ale na to, czyj interes rynkowy została naruszony.

Więcej w tym temacie

Czytaj dalej

Muzyka generowana przez AI i prawa artystów: co zostało rozstrzygnięte, a co wciąż otwarte

Muzyka generowana przez AI i prawa artystów: co zostało rozstrzygnięte, a co wciąż otwarte

New York Times kontra OpenAI: proces, który określi przyszłość trenowania modeli

New York Times kontra OpenAI: proces, który określi przyszłość trenowania modeli

Perplexity AI i spór o pobieranie treści: odpowiedzi AI zamiast linków, pozwy mediów i blokady Cloudflare

Perplexity AI i spór o pobieranie treści: odpowiedzi AI zamiast linków, pozwy mediów i blokady Cloudflare

Stable Diffusion i proces Getty Images: czy trening modelu AI na zdjęciach jest kradzieżą?

Stable Diffusion i proces Getty Images: czy trening modelu AI na zdjęciach jest kradzieżą?