Upadek tradycyjnej oceny: jak generatywna AI rozbiła testy i eseje na uczelniach
Koniec złotej ery eseju domowego
Przez kilkadziesiąt lat esej domowy był złotym standardem oceny myślenia krytycznego na kierunkach humanistycznych i społecznych. Student miał tydzień albo dwa na przeczytanie źródeł, wypracowanie tezy, skonstruowanie argumentacji i zweryfikowanie własnych wniosków. Wykładowca oceniał coś, czego nie sposób sprawdzić testem wyboru — zdolność zbudowania spójnego, wielowątkowego wywodu. Ten fundament pękł w roku akademickim 2025/2026. Badanie University of Cambridge opublikowane w marcu 2026 roku objęło 6,4 tysiąca prac z dziesięciu brytyjskich uczelni. W 73 procentach esejów domowych z kierunków humanistycznych wykryto fragmenty wygenerowane przez modele językowe, a w 41 procentach ingerencja była na tyle zaawansowana, że autorstwo studenta trudno uznać za wiążące.
To nie jest problem jednej uczelni, jednego kraju ani jednego modelu. To zmiana skali. Narzędzie, którym dysponuje dziś student, kosztuje ułamek dolara za godzinę i jest dostępne z każdego telefonu. Narzędzie weryfikujące — detektory AI — jest zawsze o krok za generatorem, co przyznają sami ich twórcy. Prawdziwy problem nie polega na tym, że student sięga po AI, ale na tym, że fakt ten przestał mieć znaczenie interpretacyjne. Ocena eseju domowego stała się oceną sprawności w posługiwaniu się modelem językowym — czymś, czego uczelnia nigdy nie zamierzała ani uczyć, ani mierzyć.
Egzaminy otwarte przestały mierzyć wiedzę
Egzamin otwarty z dostępem do podręcznika przez lata stanowił rozsądny kompromis: student może sięgnąć po informacje, ale zastosować je musi sam. W 2026 roku ta formuła straciła rację bytu na kierunkach, gdzie odpowiedź na pytanie problemowe da się sformułować w kilkanaście sekund. Wykładowca informatyki Uniwersytetu Warszawskiego opublikował w lutym eksperyment, w którym 84 procent odpowiedzi na pytania z algorytmiki — zadawane online, bez nadzoru — dało się rozwiązać odpowiednio skonstruowanym promptem do GPT-5. Średnia ocen w badanej grupie wzrosła o 1,2 skoku. Liczby wydają się suche, ale znaczą jedno: ocena przestała odzwierciedlać wiedzę studenta, a zaczęła odzwierciedlać jakość jego promptu.
Nawet egzaminy zamknięte — wydawałoby się, bezpieczna forma — ulegają technologicznemu oblężeniu. Zadanie typu wyboru da się sfotografować i przesłać do modelu w czasie rzeczywistym. W sali, gdzie student ma smartfona w kieszeni, a odpowiedź pojawia się w cztery sekundy, egzamin przestaje być egzaminem. Co gorsza, problem rozlewa się poza salę: prace domowe, projekty zaliczeniowe, referaty — wszystko, co student przygotowuje bez nadzoru, objęte jest podejrzeniem o niewiadomą proporcję autorstwa maszyny.
Powrót egzaminu ustnego i pisemnego pod nadzorem
Uczelnie reagują tak, jak zawsze reagowały, gdy technologia wyprzedza instrument oceniania — wracają do form, które wydawały się archaiczne. Wiosną 2026 roku University of Texas oraz dwadzieścia osiem uczelni z Unii Europejskiej ogłosiło pakiety reform o wspólnym mianowniku: esej domowy znika albo staje się punktem pomocniczym, decydującą wagę zyskują zaś egzamin pisemny pod nadzorem i egzamin ustny. Na Cambridge zrezygnowano z domowych prac zaliczeniowych na ośmiu kierunkach filologicznych. Na Uniwersytecie Karola w Pradze przywrócono formułę rodem z lat sześćdziesiątych: student losuje pytanie i pisze bez dostępu do urządzeń przez dziewięćdziesiąt minut.
Powrót egzaminu ustnego jest zjawiskiem szczególnie symptomatycznym. W sytuacji, gdy starannie promptowany esej wygląda wiarygodniej niż myśl żywego człowieka, wykładowca obserwujący studenta na żywo potrafi zadać pytanie doprecyzowujące, wychwycić luki w rozumieniu, odróżnić recytację od zrozumienia. Egzamin ustny jest technologicznie niewykonalny do sfingowania w czasie rzeczywistym — student nie jest w stanie wmontować modelu językowego do własnej głowy, a czas reakcji na doprecyzowujące pytanie demaskuje wszystko, co tekst pisany potrafi ukryć. To powrót do formy, w której nie pomaga ani model, ani ściąga, ani WKW.
Pęknięcie między uczelniami bogatymi i resztą
Prawdziwe koszty tej transformacji ponoszą uczelnie biedniejsze. Instytucje, które mogą sobie pozwolić na salę egzaminacyjną z dwustoma zkomputeryzowanymi stanowiskami, blokadą sieci, detektorami urządzeń i zawodowym proktorem, przejdą przez zmianę bez strat. Uczelnie mass publiczne, gdzie na jednego wykładowcę przypada czterystu studentów, gdzie nie ma sal ani sprzętu ani kadry na tysiące ustnych egzaminów w tygodniu sesyjnym — te odczuje zmiana najdobitniej.
OpenAI wydało miliony na szkolenie detektorów. Każdy z nich jest dziś o krok za generatorem. Wnioski z Cambridge brzmią brutalnie prosto: niezależnie od wydatków na detekcję, AI coraz lepiej imituje styl konkretnego studenta, a detekcja zawsze pozostaje w pościgu. Uczelnie publiczne staną przed wyborem między niedofinansowanym powrotem do form nadzorowanych a cichą akceptacją, że domowa forma oceniania mierzy już coś innego niż zamierzono.
Nieoczekiwane sprzężenie zwrotne w samych modelach
Skutki transformacji sięgają samych modeli językowych i ich twórców. Brukselska komisja edukacyjna opublikowała w 2026 roku wskaźnik, który trudno przecenić: studenci należą do pięciu głównych grup użytkowników najnowszych wersji modeli. W grupie demograficznej 18–24 lata w Unii Europejskiej udział studentów w ruchu generatywnym wzrósł z 12 do 64 procent w ciągu trzech kwartałów. U największych dostawców ruch z komponentu akademickiego stanowi co najmniej dwanaście procent całości. Modele „uczą się” zatem od studentów, którzy zadają najbardziej pilne, najlepiej skontekstualizowane pytania — strumień żądań o najszerszym spektrum tematycznym, jaki kiedykolwiek trafił do systemu.
Skutek jest nieuchronny. Najnowsze modele językowe są przeszkolone na danych, w których głównym rozmówcą był student akademicki. To przesuwa wzorzec językowy w stronę stylu szkolnego — esejobowego, poprawnego semantycznie, ale spłaszczonego argumentacyjnie. Zjawisko opisane w maju 2026 roku na arXiv pod nazwą „academic feedback loop” sugeruje, że modele dostosowują się do konwencji eseju domowego. Paradoksalnie ułatwia to kolejnej generacji studentów produkcję tekstów gotowo podobnych do typowej pracy studenckiej — zamyka się błędne koło, w którym generator i detektor szlifują się nawzajem, a student pojawia się pośrodku jako bierny pasażer.
Atrofia poznawcza — koszt, którego nie widać w ocenach
Największe koszty upadku tradycyjnej oceny nie są kosztami wykładowcy ani kosztami administracji. Są kosztami kompetencji studenta. Esej domowy był nie tylko egzaminem — był procesem uczenia się. Student piszący esej musiał uporządkować myślenie, zbudować hierarchię argumentów, zmierzyć się z paradoksem, odrzucić słabszy wariant i wybrać mocniejszy. Te operacje poznawcze — nie tekst sam w sobie — stanowiły wartość edukacyjną całego ćwiczenia.
Dziś studenci przyznają w ankietach (Stanford, 2025), że sięgają po model językowy już na etapie zbierania pomysłów — nie tylko pisania. Oznacza to, że proces samodzielnego myślenia argumentacyjnego ulega zewnętrzności: zostaje oddany narzędziu. Nie każda praca akademicka musi być dziełem w pełni samodzielnym, ale aby myślenie krytyczne się rozwijało, musi odbywać się w bezpośredniej, niezastąpionej konfrontacji z tekstami, argumentami i paradoksami. Kiedy AI przejmuje ten proces już w fazie pierwszej — przy zbieraniu argumentów — student uczy się czegoś zupełnie innego: instrukcje delegowania myślenia na model językowy. Delegowanie to jest nową kompetencją, pożyteczną zapewne, ale nie zastępuje myślenia, które zostało wydane na zewnątrz. Mocniejsi o to są model i jego dostawca. Słabiej jest student — a słabiej jest system edukacji, który miał go wzmacniać.
Konkluzja: powrót do tego, czego nie da się powierzyć maszynie
Upadek tradycyjnej oceny nie jest katastrofą. Jest wymuszonym przesiedleniem. Uczelnie przywracają formy stare, bo formy nowe — esej domowy, projekt z otwartym dostępem do sieci — przestały mierzyć cokolwiek sensownego. Egzamin ustny, egzamin pisemny pod nadzorem to racjonalna odpowiedź na sytuację, w której domowa forma oceniania przestała być narzędziem pomiaru, a stała się polem bitwy technologii, w którym student zawsze wygrywa.
Kosztami są czas pracy wykładowcy — system staje się bardziej pracy- i czasochłonny — oraz ograniczenia skalowalności: trudno zorganizować tysiące egzaminów ustnych w tygodniu sesyjnym na uniwersytecie publicznym. Zyskiem jest zaś coś, co przez dwie dekady cyfryzacji powoli uciekało: świadomość, że myślenie studenta wymaga ochrony przed jego własnymi narzędziami i że dostępność modelu językowego jest ofertą, z której należy umieć nie skorzystać.
Ten tekst jest świadectwem przejścia. Nie jest powrotem do przed-cyfrowości, lecz powrotem do tego, co nie zostało zastąpione. Porządkowanie myślenia pod nadzorem, konfrontacja słowna na żywo, odpowiedź na pytanie doprecyzowujące — to umiejętności, których nie da się powierzyć maszynie. Skoro nie da się ich powierzyć maszynie, uczelnia może je uczyć i oceniać. Reszta — eseje domowe, projekty, rozprawy pisane w domu — jest dziś ofiarą własnego sukcesu: stały się zbyt łatwe, by mierzyć cokolwiek.