Model collapse: gdy sztuczna inteligencja żywi własnymi wytworami

Model collapse: gdy sztuczna inteligencja żywi własnymi wytworami

Dieta z syntetyku

Wielkie modele językowe uczone są na gigantycznych korpusach tekstów — Wikipedia, książki z domeny publicznej, forumrozładowania w sieci. Dziś jednak proporcja treści pisanych przez ludzi a tych generowanych przez maszynę szybko się odwraca. Według szacunków opublikowanych w 2024 roku w Nature, syntetyczny tekst może już wkrótce dominować w korpusach treningowych kolejnych generacji modeli. Prowadzi to do zjawiska, któremu badacze nadali kilka dramatycznych nazw: «AI inbreeding», «AI cannibalism», «Habsburg AI», a formalnie — model autophagy disorder (MAD).

Termin ten przynajmniej częściowo odzwierciedla wagę problemu. Praca Ilty Shumailov i współpracowników z Uniwersytetu w Oksfordzie, opublikowana w Nature 24 lipca 2024 roku (DOI: 10.1038/s41586-024-07566-y), po raz pierwszy pokazała, jak modele uczone na rekursywnie generowanych danych ulegają postępującej degradacji. Artykuł nosi tytuł «AI models collapse when trained on recursively generated data».

Jak działa model collapse

Eksperyment Shumailov przebiega w cyklu. Model pierwotny — nazwijmy go generacją zero — uczony jest na danych ludzkich. Generuje teksty. Teksty te trafiają do korpusu, na którym trenowany jest model pierwszej generacji. Proces powtarzany jest siedmiokrotnie. Po kilku iteracjach wynikowy tekst zaczyna tracić sens.

W badaniach przeprowadzonych z modelami GPT model ósmej generacji, szkolony niemal wyłącznie na syntetycznych danych, wypluwał jedne i te same krótkie frazy bez względu na prompt. Ostatecznie odpowiedzi zawęziły się do ledwie kilku słów. To zjawisko nosi też nazwę MAD — model autophagy disorder, czyli zaburzenie autożerności modelu.

Czynnik sprawczy nie jest istotą samej generacji syntetycznej. Problem pojawia się wtedy, gdy do korpusu treningowego trafiają dane niezatwierdzone, a kolejny model nie odróżnia treści ludzkich od wygenerowanych. Wskutek błędnego rozkładu prawdopodobieństwa w kolejnych iteracjach umacniają się błędy, a unikatowe formy zanikają.

Ogon Habsburgów i jego implikacje

Przydomek «Habsburg AI» nie jest dziełem przypadku. Badacze — a za nimi publicystyka techniczna — przyrównują zjawisko do wieloukrywania genetycznego dynastii Habsburgów, które doprowadziło do degeneracji genetycznej. Im więcej modeli jest szkolonych pośrednio przez modele szkolone przez modele, tym bardziej widmowa staje się treść.

Wskazówki opublikowane przez badaczy z Uniwersytetu w Oksfordzie wskazują, że zjawisko model collapse ma istotne implikacje dla całego ekosystemu AI. W erze, w której modele są szkoleone na danych pochodzących z internetu, a internet jest coraz częściej zapełniany treścią generowaną przez AI, granica między danymi ludzkimi a syntetycznymi zaciera się. Konsekwencją jest degradacja jakościowa modeli, która może postępować niepostrzeżenie — ponieważ nie dysponujemy prostym sposobem oceny proporcji treści syntetycznych w korpusach treningowych.

Czytaj dalej

Deepfake w sądzie: gdy fałszywe nagranie staje się dowodem

Deepfake w sądzie: gdy fałszywe nagranie staje się dowodem

Znaki wodne i metadane C2PA nie ochronią Cię przed fałszywką

Znaki wodne i metadane C2PA nie ochronią Cię przed fałszywką

Quishing: phishing, który chowa się za kodem QR

Quishing: phishing, który chowa się za kodem QR

Fabryka uczuć: gdy oszuści używają sztucznej inteligencji do budowania zaufania

Fabryka uczuć: gdy oszuści używają sztucznej inteligencji do budowania zaufania