Cudze teksty w sieciach neuronowych: prawa autorskie versus biznes trenowania modeli
Modele karmione internetem
Nowoczesne modele językowe trenuje się na zbiorach tekstów liczonych w bilionach słów: książkach, artykułach prasowych, wpisach na blogach, kodzie źródłowym. Znaczna część tych materiałów jest chroniona prawem autorskim, a ich twórcy w większości nie wyrazili zgody na wykorzystanie ich pracy do nauki komercyjnego systemu ani nie otrzymali za to wynagrodzenia. Ta rozbieżność stała się osią jednego z najważniejszych sporów prawnych ostatnich lat: czy przetworzenie cudzego tekstu przez sieć neuronową to naruszenie praw autorskich, czy nowa forma dozwolonego użytku.
Proces, który wyznacza standard
Za punkt odniesienia służy sprawa wytoczona pod koniec 2023 roku przez „The New York Times” przeciwko OpenAI i Microsoftowi przed sądem federalnym w Nowym Jorku. Wydawca zarzucił firmom wykorzystanie milionów swoich artykułów do trenowania modeli bez zgody i bez wynagrodzenia, wskazując przy tym, że modele potrafią odtwarzać fragmenty publikacji niemal dosłownie. Obrona opiera się na instytucie dozwolonego użytku (fair use): zdaniem firm trening nie powiela utworów, lecz analizuje je w celu stworzenia czegoś nowego.
Proces trwa. Jego znaczenie wykracza daleko poza konflikt jednego wydawcy z jednym dostawcą modeli — rozstrzygnięcie przesądzi, czy trenowanie komercyjnych modeli na treściach chronionych wymaga licencji, i to nie tylko w Stanach Zjednoczonych. W toku postępowania toczy się spór o ujawnienie zbiorów treningowych, których szczegóły firmy traktują jako tajemnicę biznesową.
Ugoda, która pokazała cenę ryzyka
Niezależnie od losów procesu gazety rynek otrzymał sygnał kosztowy. We wrześniu 2025 roku Anthropic zawarł ugodę z grupą autorów książek, którzy zarzucali firmie trenowanie na egzemplarzach pozyskanych z nielegalnych repozytoriów. Kwota ugody — około 1,5 miliarda dolarów wypłacanych tysiącom autorów — to najwyższa jawna cena, jaką dotąd zapłacono za trening na cudzych utworach. Sędzia federalny zatwierdził warunki ugody pod koniec września 2025 roku. Dla dostawców modeli wynik jest czytelny: pozyskiwanie treści z pirackich źródeł niesie realne ryzyko finansowe, nawet jeśli samo trenowanie zostanie uznane za dozwolone.
Europa: opt-out i pytania o egzekwowanie
W Unii Europejskiej ramy prawne wyznacza dyrektywa o prawach autorskich na jednolitym rynku cyfrowym z 2019 roku. Pozwala ona na komercyjne eksplorowanie tekstów i danych (text and data mining), chyba że właściciel praw zastrzeże wykorzystanie swojej pracy w sposób czytelny dla maszyn — tzw. opt-out. Rozporządzenie o sztucznej inteligencji (AI Act) dopina do tego obowiązek dostawców modeli ogólnego przeznaczenia: mają respektować zastrzeżenia właścicieli praw oraz publikować wystarczająco szczegółowe podsumowanie treści wykorzystanych do treningu.
W praktyce działanie tych przepisów budzi wątpliwości. Zastrzeżenie opt-out ma sens tylko wtedy, gdy jest wykrywalne na skalę zbiorów webowych, a podsumowania zbiorów treningowych publikowane przez dostawców bywają na tyle ogólne, że twórca rzadko dowie się, czy jego praca w nich wypadła. Pytanie o skuteczność egzekwowania pozostaje otwarte — i to ono, bardziej niż literalna treść przepisów, zdecyduje o realnej pozycji twórców.
Co to oznacza dla twórców
Dla pisarzy, dziennikarzy i wydawców pola działania są dziś trzy. Pierwsze: zastrzeżenie wykorzystania treści w sposób czytelny maszynowo, co jest warunkiem powołania się na europejski opt-out. Drugie: licencjonowanie — bezpośrednie umowy z dostawcami modeli albo za pośrednictwem organizacji zbiorowego zarządzania, które w kilku krajach europejskich prowadzą już rozmowy w imieniu twórców. Trzecie: udział w postępowaniach zbiorowych, które w Stanach Zjednoczonych pokazały, że presja finansowa działa.
Spór o trening modeli to nie konflikt technologii z kulturą, lecz spór o to, kto zapłaci za materiał, z którego korzysta technologia. Im dłużej trwa bez rozstrzygnięcia, tym większą wagę zyskują ugody i umowy licencyjne — i tym wyraźniej widać, że pytanie „czy wolno” zastąpiło pytanie „za ile”.
Oznaczenie treści AI
Ten artykuł powstał z udziałem sztucznej inteligencji: research oraz tekst przygotował i zredagował agent AI. Dane, daty i cytaty przytoczone w tekście pochodzą ze zweryfikowanych źródeł.