ArXiv pod presją: jak AI zalewają archiwum nauki
Liczba preprintów w ArXiv rośnie wykładniczo, a moderatorzy nie nadążają. Naukowcy apelują o zmianę systemu, by nie stracić użyteczności serwisu.
ArXiv, elektroniczne archiwum prac naukowych działające od 1991 roku, stoi przed bezprecedensowym wyzwaniem. Serwis, który przez trzy dekady był stabilnym fundamentem wymiany wiedzy w naukach ścisłych, zmaga się z eksplozją liczby przesyłanych artykułów — znaczna część z nich generowana przez algorytmy sztucznej inteligencji.
Skalę problemu pokazują liczby
Archiwum, obecnie zarządzane przez Cornell University i dostępne bezpłatnie dla każdego użytkownika internetu, notuje dramatyczny wzrost przesyłek. W ciągu zaledwie dwóch lat liczba artykułów złożonych w wrześniu wzrosła z 20,5 tysiąca (wrzesień 2024) do 40,3 tysiąca (wrzesień 2026). To prawie podwojenie tempa publikacji w tak krótkim okresie.
ArXiv przyjmuje prace z szerokiego spektrum dyscyplin — od fizyki i astronomii, przez matematykę i informatykę, aż po biologię i matematykę finansową. Historycznie system działał na zasadzie zaufania: artykuły mogły przesyłać wyłącznie zarejestrowani i weryfikowani autorzy. Jednak napływ treści generowanych przez AI zmienił dynamikę całego procesu.
Moderatorzy w pułapce
Pracownicy odpowiedzialni za recenzję nadesłanych prac borykają się z problemem skalowania. Kevin Buzzard z Imperial College London wprost mówi o przeciążeniu zespołu moderacyjnego. Artykuły mogą czekać na przejrzenie przez całe tygodnie, co dla dynamicznie rozwijającej się nauki stanowi realną przeszkodę.
Sytuacja jest na tyle poważna, że sami naukowcy zmuszeni są sięgać po sztuczną inteligencję, aby poradzić sobie z chaosem. Buzzard przyznaje, że musi używać narzędzi AI do wskazania, które spośród tysięcy artykułów warto przeczytać. To błędne koło: AI generuje zawartość, która przytłacza moderatorów, a naukowcy używają AI, aby poradzić sobie z napływem.
Jakość versus ilość
Obawy naukowców dotyczą nie tylko liczby artykułów, ale przede wszystkim ich wartości merytorycznej. Chaim Goodman-Strauss z Uniwersytetu Arkansas scharakteryzował prace generowane przez AI jako „w zasadzie prowizoryczne” — artykuły, które mogą zawierać błędy logiczne lub niejasne wyjaśnienia.
Terence Tao z UCLA poszedł dalej, wyrażając obawy, że obecny sposób publikacji odkryć naukowych może zaszkodzić całej matematyce. Problem nie sprowadza się do samej poprawności faktów. Jak wyjaśnia Buzzard: „Problem polega na tym, że artykuły o charakterze prowizorycznym nie wyjaśniają dobrze pewnych rzeczy. Nie chodzi tylko o poprawność; chodzi o ludzkie zrozumienie, a sztuczna inteligencja czasami bardzo słabo sobie z tym radzi”.
Odpowiedź ArXiv: limity i kontrola
W odpowiedzi na kryzys ArXiv wprowadził nowe mechanizmy kontroli. Od niedawna obowiązuje limit dwóch artykułów na miesiąc na jednego autora, przy maksymalnie trzech aktywnych zgłoszeniach jednocześnie. Serwis od dawna zezwala na użycie sztucznej inteligencji przy tworzeniu prac, jednak wymaga jawnego ujawnienia tego faktu.
Warte odnotowania jest, że moderatorzy ArXiv zaobserwowali wzrost liczby artykułów o wąskim, często marginalnym zakresie oraz niskiej wartości naukowej. To sugeruje, że problem nie dotyczy wyłącznie jakości, ale również intencji — część przesyłek może być motywowana chęcią szybkiego zwiększenia liczby publikacji, a nie rzeczywistym wkładem w naukę.
Fragmentacja ekosystemu
Odpowiedź rynku na chaos w ArXiv przybiera formę alternatywnych platform. Pojawiła się nowa usługa Hexagon, dedykowana „pre-preprintom” generowanym przez AI. Takie rozwiązania mogą wydawać się korzystne — oddzielają treści AI od tradycyjnych prac naukowych. Jednak fragmentacja ekosystemu publikacji naukowych rodzi nowe zagrożenia: brak centralnego miejsca dla całej wiedzy, trudności w śledzeniu całego dorobku badawczego, ryzyko utraty spójności naukowego dyskursu.
Co to oznacza dla przyszłości nauki
Kryzys ArXiv jest symptomem głębszego problemu: brak jasnych standardów dla artykułów generowanych przez AI w nauce. Podczas gdy narzędzia AI stają się coraz bardziej zaawansowane, instytucje naukowe wciąż szukają równowagi między otwartością na innowacje a ochroną integralności procesu naukowego.
Ograniczenia wprowadzone przez ArXiv mogą być bolesne dla niektórych badaczy, ale stanowią konieczny krok ku przywróceniu użyteczności serwisu. Pytanie brzmi: czy będą wystarczające, czy też będziemy świadkami dalszej fragmentacji światowego systemu publikacji naukowych?
Na podstawie: Wszystko co najważniejsze. Tekst opracowany redakcyjnie.