人工智能让科学家的时间变得更宝贵,而这正是问题所在

关于人工智能进入科学领域的流行说法是,自动化将去除繁琐的杂务,研究人员会用省下来的时间更深入地思考,并把工作完成得更彻底。一项新的建模研究认为,这种说法把经济学完全讲反了。大型语言模型让科学家变得更快,也就抬高了研究人员时间的价格,而时间越贵,就越会被花在下一个项目上,而不是用来打磨手头的项目。作者伊蒙·迪德(Eamon Duede)、凯文·格罗斯(Kevin Gross)、莫莉·克罗克特(Molly Crockett)和卡尔·伯格斯特龙(Carl Bergstrom)在摘要中直白地预测,研究人员将做得更多、但做得更差,而不是做得一样多、但做得更好。

这篇论文于 2026 年 7 月 19 日发布在 arXiv 上,尚未经过同行评审,它对这项技术刻意采取了宽容的假设。模型假定大型语言模型的表现与最热情的拥护者所想象的一模一样:便宜、快速、准确、不出错。作者指出,即便在这样的假设下,工具的存在本身也会重塑科学家分配精力的方式,因为它改变了引导研究的摩擦与激励。这一发现是结构性的,不是对幻觉或技能退化的抱怨,作者也明确表示,人工智能工具并非问题的根源。大型语言模型照出的,是一个早已奖励数量胜过质量的激励体系。

这套数学机制来自行为生态学。模型借用了最优觅食理论,这一理论由埃里克·查诺夫(Eric Charnov)于 1976 年提出,用来描述动物如何决定何时离开一块食物区域,模型把它套用在研究人员决定何时离开一个项目上。科学家会花一段固定长度的发现期来了解项目的价值,包括提出假设、做预实验、收集初步数据。一旦价值明确,研究人员要么放弃项目、开始新的探索,要么投入开发阶段,而开发阶段又分为两部分。第一部分是必需工作,也就是把结果变成可发表论文的不可压缩成本,包括作图、排版、校对、投稿。第二部分是可自由支配的开发,包括后续实验、敏感性分析、更深入的统计、打磨文字。模型的关键量是时间的长期回报率,它决定了研究人员每花一小时所面对的机会成本。

基于这一框架,论文推导出三个预测,其中前两个令人不安。当大型语言模型缩短发现期时(在技术性领域正是如此,模型能帮助研究者快速识别有前景的问题),研究者会变得更挑剔,发表的项目比例更小,但即便是他们决定发表的项目,开发得也不如以前彻底,因为时间的机会成本上升了。当大型语言模型转而降低撰写手稿所需的必需工作(在以实地工作为基础的学科中正是如此,写作和分析占主导),发表的阈值就会下降,于是更多项目被发表,而每个项目开发得都不够深入。只有第三种情况毫无疑义是好的:当大型语言模型加速的是可自由支配的开发本身,让后续实验和更深入的分析变得更便宜时,项目会被开发得更彻底。某个领域最终哪一种结果占上风,取决于大型语言模型加速的是研究的哪个阶段。

Quality journalism takes time and resources. Your support helps us focus on accuracy instead of advertising.

Fund our reporting

模型最尖锐的结论,是对”省时谬误”的诊断。作者写道,指望自动化琐碎任务能为科学家换来深入思考的时间,这一希望会落空,因为大型语言模型让研究人员的时间变得更值钱,而不是更不值钱。一旦一篇论文接近可发表状态,用来打磨它的每一个小时,都是没有用来发现下一个项目的一小时,而当一切运转得更快时,这一个小时的机会成本还会增大。结果就是形成一种继续往前走的激励。作者指出,他们把科研机构视为静态不变的,这在短时间尺度上是合理的,但随着实践变化快于政策变化,这种假设注定会带来一段错位期。在大型语言模型缩短手稿产出时间的领域,期刊投稿量已经在急剧上升,给同行评审带来压力,而”不发表就出局”的激励结构比这些工具早出现几十年。

论文最引人注目的细节,是它自己的人工智能使用声明。作者报告说,正文是在没有人工智能辅助的情况下写成的,只用了内置的拼写检查,但他们使用了 ChatGPT 5.4、ChatGPT 5.5 和 Gemini 3.1 来建议证明策略,用 Claude Fable 5 检查证明的一致性,并用 ChatGPT 5.5 来调整图表字体和 LaTeX 格式。一篇主张大型语言模型会把科学家推向匆忙的论文,其本身的产出恰恰在模型所描述的环节借助了大型语言模型,也就是证明核查和排版这类可自由支配的工作,被加速并部分外包。这是对这种现象的一个小而诚实的例证,而不是对它的批判。

这些保留意见是真实存在的。这是一篇预印本,模型做了大量简化,把时间当作唯一的资源,并假定激励保持不变。真实的大型语言模型会出错,而这些错误可能带来模型没有计入的成本。但这项工作的价值在于,它把结构性效应单独剥离了出来:即便是一件完美的工具,在一个奖励产出的体系里,也会把精力从深度上移开。对科学政策而言,实际的结论是,要改善结果就必须改变激励,因为技术并不是起约束作用的瓶颈。作者认为,指望省下的时间会转化为更深入的思考,这种希望被他们的结果打了折扣。大型语言模型举起的那面镜子,正把体系自己的模样照给它看。

婷 翻译

References

Eamon Duede, Kevin Gross, M.J. Crockett, and Carl T. Bergstrom, The unintended consequences of large language models as a labor-augmenting technology in science. arXiv:2607.17397 (2026). DOI: 10.48550/arXiv.2607.17397.

Kaia Glickman, Scientists using LLMs will ‘do more, less well’, modelling study predicts. Nature News, 31 July 2026. DOI: 10.1038/d41586-026-02397-5.

E.L. Charnov, Optimal foraging, the marginal value theorem. Theoretical Population Biology 9(2), 129-136 (1976).

Scroll to Top