AI标记超过26万篇可疑癌症研究论文——比例仍在上升

癌症科学中的欺诈性研究规模可能比之前估计的要大得多。来自昆士兰科技大学、悉尼大学和法国CNRS的研究团队应用了一种微调的BERT语言模型,筛选了1999年至2024年间发表的2,647,471篇癌症研究论文。结果:261,245篇论文(9.87%)显示出论文工厂特有的写作模式,,论文工厂是大量生产伪造或剽窃手稿并出售给研究人员的商业运作。

这项发表在《英国医学杂志》上的研究,代表了对癌症文献中论文工厂污染的最大规模系统筛查。随着时间的推移,这一比例急剧上升,从2000年代初的约1%上升到2022年超过16%的峰值,然后在2023-2024年略有下降。

检测的工作原理

该模型基于谷歌的BERT base uncased(1.1亿参数),在Retraction Watch数据库中标记为”论文工厂”的2,202篇已撤回论文上进行了微调。这些作为阳性示例,,其写作风格、结构和措辞模式与基于模板的手稿工厂输出相匹配的论文。对于阴性对照,团队从高影响力期刊和论文工厂代表性低的国家(瑞典、芬兰、挪威、台湾)选择了2,202篇论文。

If our reporting has earned your trust, consider helping us continue our work.

Become a supporter

该模型逐句阅读标题和摘要,为每个句子生成概率分数。最终分类是所有句子级分数的平均值。在内部验证中,该模型达到了91%的准确率、87%的灵敏度和96%的特异性。针对由图像完整性专家独立标记的3,094篇论文的外部验证集,准确率上升到了93%。

地理和出版商模式

被标记的论文分布并不均匀。按第一作者国家划分,中国占177,907篇被标记论文,,占所有中国第一作者癌症论文的36%。其次是伊朗(20%)、沙特阿拉伯(16%)、埃及(15%)和巴基斯坦(13%)。美国有10,511篇被标记论文,约占其癌症产出的2%。

按出版商划分,最高比例集中在较小的机构:Verduci Editore(约67%的论文被标记,主要在《欧洲医学与药理科学评论》),International Scientific Literature(45%,主要在《医学科学监测》),以及Spandidos Publications(38%,即19,043篇)。在主要出版商中,Springer Nature、Elsevier和Wiley各自约有10%的癌症论文被标记,尽管绝对数量很大,,仅Springer Nature就有40,293篇。

按癌症类型划分,胃癌研究以22%的比例最高,其次是骨/骨肉瘤(21%)和肝癌(20%)。基础癌症生物学比临床领域污染更严重:生存、流行病学和健康政策研究的标记率低于2%。

三家期刊已在测试

一家主要出版商的三家期刊已经将该模型集成到其在线投稿系统中,用于实时筛查癌症相关手稿。期刊名称未被披露,,作者有意隐瞒,以防止论文工厂调整其模板。

“这是统计筛查,而非对不当行为的归因,”作者在论文中警告。鉴于文献中估计的真实患病率约为10%,大约30%被标记的论文将是误报。

重要注意事项

该模型在过度代表中国作者撤回论文的Retraction Watch数据上进行训练,这可能会引入地理偏见。此外,由于该模型是一个深度神经网络,它检测到的具体特征无法直接解释。作者承认,该模型可能会惩罚非母语者的公式化英语,可能将语言模式与欺诈模式混淆。

还有一个军备竞赛问题:随着检测工具的改进,论文工厂将调整其模板。作者指出,生成式AI的兴起进一步模糊了真实文本和伪造文本之间的界限。

来源

  • Scancar B, Byrne JA, Causeur D, Barnett AG。”Machine learning based screening of potential paper mill publications in cancer research: methodological and cross sectional study。” The BMJ 392:e087581,2026。DOI:10.1136/bmj-2025-087581
  • 昆士兰科技大学新闻稿 via ScienceDaily

婷 翻译

Scroll to Top