AI撰写的研究提案与人类提案评分相当,但AI评审者表现出系统性亲AI偏见

根据一项发表在arXiv上的新研究,大语言模型可以生成质量与人类研究人员撰写相当的科学项目计划,但基于AI的评估者对AI生成的提案表现出系统性偏好。

这项由 Kavli 宇宙物理与数学研究所的 Jia Liu 领导的研究,比较了人类和三种大语言模型(ChatGPT 4o、Claude Sonnet 4 和 DeepSeek V3)在物理学、天体物理学和宇宙学八个专家构思项目上撰写的一页研究提案。

八位领域专家各自概述了一个研究项目,涵盖活动星系核演化、星系与暗物质晕连接、弱引力透镜本征排列、引力波黑洞双星以及利用脉冲星计时阵列检验广义相对论等主题。人类项目规划者(各主题领域专家级的博士生或博士后)随后各自在无AI辅助的情况下撰写了一份提案。另外,特定领域外的本科生使用固定提示模板为每个项目生成了三份AI提案,最终形成32份提案的语料库:八份人类撰写,24份AI生成。

四位资深研究员担任盲审人类评审者,对提案的清晰度、方法适当性、资源规划和可行性进行评估。两个前沿大语言模型(Claude Opus 4.8 和 ChatGPT Pro 5.5)执行了相同的评估。

Quality journalism takes time and resources. Your support helps us focus on accuracy instead of advertising.

Support independent reporting

人类评审者对人类撰写和AI生成的提案总体评分相似,两组平均得分均约为5分制中的3.5分。然而,AI评审者对AI生成提案的评分比人类撰写的提案高出大约一分,显示出系统性的亲AI偏见。这种偏见集中在人类计划较弱的项目中, 人类计划质量与AI评审者偏见之间的相关性约为-0.95。

当被要求识别每份提案是由人类还是AI撰写时,人类评审者对人类撰写提案的准确率为72%,对AI生成提案的准确率为79%,个体准确率在59%至88%之间。人类评审者通过模板式的五步方法论部分、缺乏引用、整数时间线和过度使用机器学习术语等特征识别出AI生成的提案。人类撰写的提案则通过具体的作者-年份引用、独特的领域行话、第一人称表述和聚焦的范围来区分。

两个AI评审者均以100%的准确率正确分类了全部32份提案,一致且无误地运用相同的线索, 引用诸如统一的五阶段模板、精炼的非人称散文、通用调查选择、详尽工具列表和程式化风险缓解等特征。

论文指出,这些结果表明在广泛部署大语言模型进行提案准备和评审时应保持谨慎,因为AI评估者可能会引入系统性地偏向AI生成内容的偏见。

图片:(无,研究论文)

来源:arXiv:2607.25881(Liu et al.,2026年7月28日)

婷 翻译

Scroll to Top