Wiarygodność badań naukowych stanowi fundament postępu medycyny, zwłaszcza w obszarze onkologii, gdzie publikowane wyniki wpływają na rozwój terapii, badań klinicznych i decyzji terapeutycznych. Najnowsze badanie opublikowane w The BMJ pokazuje jednak skalę problemu, która może podważać zaufanie do części literatury naukowej. Zespół badaczy pod kierunkiem prof. Adrian Barnett opracował narzędzie uczenia maszynowego, które zidentyfikowało ponad 250 000 potencjalnie sfałszowanych publikacji dotyczących raka, mogących pochodzić z tzw. „fabryk publikacji”.
Z tego artykułu dowiesz się…
- Jak działa naukowy „filtr antyspamowy” oparty na uczeniu maszynowym i w jaki sposób identyfikuje publikacje mogące pochodzić z tzw. fabryk papieru.
- Jak duża jest skala problemu w badaniach nad rakiem, w tym ile prac i z jakiego okresu objęto analizą.
- Które obszary onkologii i typy nowotworów są najbardziej narażone na napływ potencjalnie sfałszowanych badań.
- Dlaczego wykrywanie fałszywych publikacji ma znaczenie dla pacjentów, badań klinicznych i rozwoju nowych terapii.
Czym są „fabryki publikacji” i dlaczego to problem?
Fabryki publikacji to podmioty, które masowo produkują lub sprzedają gotowe prace naukowe niskiej jakości, a czasem wprost sfałszowane. Oferują one kompletne manuskrypty lub współautorstwo, często wykorzystując powtarzalne szablony językowe, nienaturalne sformułowania, a nawet spreparowane dane czy obrazy. Jak podkreśla prof. Barnett:
Papiernie to firmy, które sprzedają fałszywe lub niskiej jakości badania naukowe. Produkują „badania” na skalę przemysłową, a nasze odkrycia sugerują, że problem w badaniach nad rakiem jest o wiele poważniejszy, niż większość ludzi przypuszcza.
Skala tego zjawiska sprawia, że fałszywe prace mogą przenikać do głównego nurtu literatury, wpływając na kolejne badania i decyzje kliniczne.
Analiza 2,6 miliona publikacji o raku
Badanie miało charakter przekrojowy i objęło 2,6 miliona artykułów naukowych dotyczących raka, opublikowanych w latach 1999–2024. Analiza wykazała, że ponad 250 000 prac charakteryzowało się stylem pisania i strukturą zbliżoną do publikacji wcześniej wycofanych z powodu podejrzeń o fałszerstwo.
Szczególnie niepokojący jest trend czasowy. Odsetek podejrzanych publikacji wzrósł z około 1% na początku XXI wieku do ponad 16% w 2022 roku, co sugeruje narastanie problemu w ostatnich latach.
Jak działa „naukowy filtr spamu”
Zespół badawczy wykorzystał model językowy BERT, ucząc go rozpoznawania subtelnych „odcisków palców” tekstowych, które wielokrotnie pojawiają się w znanych produktach fabryk artykułów naukowych. Chodzi m.in. o powtarzalne struktury zdań, nietypowe połączenia terminów czy charakterystyczny sposób opisu metod i wyników. Prof. Barnett wyjaśnia:
Najprawdopodobniej opierają się na szablonach, które można wykryć za pomocą dużych modeli językowych analizujących wzorce w tekstach.
Testy przeprowadzone na zweryfikowanych przykładach wykazały, że model prawidłowo identyfikował podejrzane publikacje w 91% przypadków. Sam autor porównuje to rozwiązanie do dobrze znanego mechanizmu:
W zasadzie stworzyliśmy naukowy filtr spamu. Podobnie jak system poczty elektronicznej potrafi wykrywać niechciane wiadomości, nasze narzędzie sygnalizuje prace, których styl i struktura odpowiadają stylowi i strukturze tekstów wycofanych i oszukańczych.
Które obszary onkologii są najbardziej narażone
Analiza wykazała, że problem dotyczy tysięcy czasopism, w tym również tytułów wydawanych przez największych wydawców naukowych i posiadających wysoki wpływ. Najczęściej oflagowane publikacje pochodziły z obszarów takich jak biologia molekularna nowotworów oraz wczesne etapy badań laboratoryjnych.
Szczególnie wysoki odsetek podejrzanych prac dotyczył badań nad niektórymi typami nowotworów, w tym rakiem żołądka, wątroby, kości i płuc. To właśnie w tych dziedzinach masowa produkcja niskiej jakości artykułów może w największym stopniu zaburzać bazę dowodową.
Zastosowanie narzędzia w praktyce redakcyjnej
Trzy czasopisma naukowe rozpoczęły już testowanie nowego narzędzia w ramach wstępnej selekcji redakcyjnej. Celem jest identyfikowanie potencjalnie sfałszowanych manuskryptów jeszcze przed wysłaniem ich do recenzji naukowej.
Autorzy badania podkreślają jednak, że oflagowanie publikacji nie oznacza automatycznie oszustwa. Wyniki modelu powinny być traktowane jako sygnał ostrzegawczy, który wymaga dalszej weryfikacji przez ekspertów.
Dlaczego to ma znaczenie dla pacjentów
Konsekwencje przenikania fałszywych badań do literatury naukowej wykraczają poza samą naukę. Jak zauważa prof. Barnett:
Badania nad rakiem mają wpływ na badania kliniczne, rozwój leków i opiekę nad pacjentami. Jeśli sfabrykowane badania przedostaną się do bazy dowodowej, mogą wprowadzić w błąd prawdziwych naukowców i ostatecznie spowolnić postępy pacjentów.
Z tego powodu badacze planują rozszerzenie narzędzia na inne dziedziny medycyny oraz jego dalsze doskonalenie wraz z pojawianiem się nowych, potwierdzonych przypadków działalności fabryk publikacji.
Główne wnioski
- Narzędzie oparte na uczeniu maszynowym przeanalizowało 2,6 mln publikacji dotyczących raka z lat 1999–2024 i zidentyfikowało ponad 250 000 prac o cechach charakterystycznych dla fabryk papieru.
- Model językowy BERT poprawnie wykrywał podejrzane publikacje w 91% przypadków, analizując wzorce stylu i struktury tekstu znane z wcześniej wycofanych artykułów.
- Odsetek oflagowanych badań wzrósł z około 1% na początku XXI wieku do ponad 16% w 2022 roku, co wskazuje na narastający problem w literaturze onkologicznej.
- Fałszywe lub niskiej jakości badania mogą zaburzać bazę dowodową, wpływać na badania kliniczne, rozwój leków i opiekę nad pacjentami, dlatego wczesna identyfikacja takich prac jest kluczowa.
Źródło:
- https://www.bmj.com/content/392/bmj-2025-087581
- Queensland University of Technology

