La IA señala más de 260.000 artículos sospechosos de investigación sobre el cáncer, y la tasa sigue aumentando

La magnitud de la investigación fraudulenta en la ciencia del cáncer podría ser mucho mayor de lo estimado anteriormente. Un equipo de investigadores de la Universidad Tecnológica de Queensland, la Universidad de Sídney y el CNRS en Francia ha aplicado un modelo de lenguaje BERT ajustado para examinar 2.647.471 artículos de investigación sobre el cáncer publicados entre 1999 y 2024. El resultado: 261.245 artículos (el 9,87 por ciento) mostraban patrones de escritura característicos de las fábricas de papel, operaciones comerciales que producen en masa manuscritos fabricados o plagiados para su venta a investigadores.

El estudio, publicado en The BMJ, representa el mayor cribado sistemático de la literatura oncológica para detectar contaminación por fábricas de papel. La tasa ha aumentado bruscamente con el tiempo, desde aproximadamente el 1 por ciento a principios de la década de 2000 hasta un pico superior al 16 por ciento en 2022, antes de descender ligeramente en 2023-2024.

Cómo funciona la detección

El modelo, construido sobre BERT base uncased de Google (110 millones de parámetros), se ajustó en 2.202 artículos que habían sido retirados de la base de datos Retraction Watch con una etiqueta de «fábrica de papel». Estos sirvieron como ejemplos positivos, artículos cuyo estilo de escritura, estructura y patrón de frases coincidían con la producción de fábricas de manuscritos basadas en plantillas. Para los controles negativos, el equipo seleccionó 2.202 artículos de revistas de alto impacto y países con baja representación de fábricas de papel (Suecia, Finlandia, Noruega, Taiwán).

Behind every article is careful research and verification. Help us continue delivering reliable news.

Make a difference

El modelo lee títulos y resúmenes frase por frase, produciendo una puntuación de probabilidad para cada una. La clasificación final es la media de todas las puntuaciones a nivel de frase. En la validación interna, el modelo alcanzó un 91 por ciento de precisión con un 87 por ciento de sensibilidad y un 96 por ciento de especificidad. Frente a conjuntos de validación externos (3.094 artículos señalados de forma independiente por expertos en integridad de imágenes), la precisión aumentó al 93 por ciento.

Patrones geográficos y por editorial

Los artículos señalados no se distribuyen uniformemente. Por país del primer autor, China representó 177.907 artículos señalados, el 36 por ciento de todos los artículos sobre cáncer con primeros autores chinos. Le siguieron Irán (20 por ciento), Arabia Saudí (16 por ciento), Egipto (15 por ciento) y Pakistán (13 por ciento). Estados Unidos tenía 10.511 artículos señalados, aproximadamente el 2 por ciento de su producción oncológica.

Por editorial, las tasas más altas se concentraron en operaciones más pequeñas: Verduci Editore (aproximadamente el 67 por ciento de sus artículos señalados, principalmente en el European Review for Medical and Pharmacological Sciences), International Scientific Literature (45 por ciento, principalmente en Medical Science Monitor), y Spandidos Publications (38 por ciento, o 19.043 artículos). Entre las grandes editoriales, Springer Nature, Elsevier y Wiley tenían cada una aproximadamente el 10 por ciento de sus artículos sobre el cáncer señalados, aunque en números absolutos eran sustanciales: 40.293 solo para Springer Nature.

La investigación sobre el cáncer gástrico tenía la tasa más alta por tipo de cáncer, con un 22 por ciento, seguida del hueso/osteosarcoma (21 por ciento) y el hígado (20 por ciento). La biología fundamental del cáncer estaba más contaminada que las áreas clínicas: la investigación en supervivencia, epidemiología y políticas sanitarias tenía tasas de señalización inferiores al 2 por ciento.

Tres revistas ya lo están probando

Tres revistas de una importante editorial ya han integrado el modelo en sus sistemas de envío en línea para examinar manuscritos relacionados con el cáncer en tiempo real. Los nombres de las revistas no se han revelado; los autores los ocultaron intencionadamente para evitar que las fábricas de papel adaptaran sus plantillas.

«Es un cribado estadístico, no una atribución de mala conducta», advierten los autores en el artículo. Dada una prevalencia real estimada de aproximadamente el 10 por ciento en la literatura, aproximadamente el 30 por ciento de los artículos señalados serían falsos positivos.

Salvedades importantes

El modelo se entrenó con datos de Retraction Watch que sobrerrepresentan las retractaciones de autores chinos, lo que puede introducir sesgo geográfico. Además, como el modelo es una red neuronal profunda, las características específicas que detecta no son directamente explicables. Los autores reconocen que el modelo puede penalizar el inglés formulaico de hablantes no nativos, confundiendo potencialmente patrones lingüísticos con patrones de fraude.

También existe un problema de carrera armamentística: a medida que mejoran las herramientas de detección, las fábricas de papel adaptarán sus plantillas. El auge de la IA generativa, señalan los autores, desdibuja aún más la frontera entre el texto genuino y el fabricado.

Fuentes

  • Scancar B, Byrne JA, Causeur D, Barnett AG. «Machine learning based screening of potential paper mill publications in cancer research: methodological and cross sectional study.» The BMJ 392:e087581, 2026. DOI: 10.1136/bmj-2025-087581
  • Comunicado de prensa de la Universidad Tecnológica de Queensland vía ScienceDaily

Traducido por Alessandra

Scroll to Top