科学

科学

长期寻求的量子状态:电子轨道自发选择方向

围绕原子核运行的电子占据着不同的形状,这些形状描述了在空间任意点找到电子的概率。在大多数材料中,这些轨道是随机取向的。但在一种新发现的量子态中,轨道自发地排列成周期性图案,其果断程度不亚于铁原子选择磁取向。这项发表在《自然·物理》杂志上的发现,提供了迄今为止纯轨道有序最清晰的实验证据。 这一发现是在一种名为Tb₂CoAl₄Ge₂(铽、钴、铝、锗)的金属间化合物中取得的。利用角分辨光电子能谱(ARPES),该技术通过紫外光测量从材料中射出的电子的能量和动量,研究人员观察到了独特的能带结构指纹:表面铽原子的5d轨道已排列成有序图案,打破了晶体晶格的旋转对称性。 这种被称为”自发对称性破缺态”的轨道有序,一直是凝聚态物理中最难以捉摸的概念之一。 第三自由度 在固态物理学中,电子具有三个基本自由度:电荷、自旋和轨道。电荷有序(电子密度的周期性调制)是电荷密度波等现象的根源。自旋有序产生磁性,包括铁磁性、反铁磁性以及新近被认识的交替磁性。作为第三成员的轨道有序,则一直难以被单独分离出来。 困难源于纠缠。在大多数材料中,轨道有序与晶格畸变、自旋排列和电荷调制紧密耦合。当轨道有序化时,晶格可能发生轻微畸变,即杨-特勒效应。当晶格畸变时,又可能将自旋推入特定排列。结果正如论文作者所指出的”先有鸡还是先有蛋的问题”:通常无法判断哪种有序驱动了另一种。 Tb₂CoAl₄Ge₂化合物规避了这一问题。轨道有序在表面出现时并未伴随晶格畸变或磁转变,使其成为罕见的近乎纯轨道有序、可被独立研究的范例。 为何重要 理论上,轨道有序被认为与凝聚态物理中一些最令人费解的现象有关。在锰氧化物(表现出庞磁电阻的锰氧化合物)中,轨道有序被认为在相图的形成中起着根本作用。在铁基高温超导体中,轨道有序被认为是向列相(一种材料的电子特性在无明显结构变化的情况下变得依赖于方向的状态)的驱动力。 在此之前,这些联系仍停留在理论层面,因为轨道有序无法与伴随的晶格和自旋效应分离。Tb₂CoAl₄Ge₂表面提供了一个洁净的实验平台,使研究人员能够独立检验关于轨道物理的预测。 窥见隐藏的有序 这一发现还展示了方法论的进步。ARPES已被用于研究电子能带结构数十年,但轨道有序会在ARPES光谱中留下独特的特征,即能带的分裂,反映了轨道构型的对称性破缺。研究人员分析了这种能带分裂,从而提取出轨道排列的模式。 铽的5d轨道,相对弥散的外壳轨道,被证明是值得关注的对象。它们的空间范围使其对局域电子环境敏感,而它们在晶体表面的位置使其能够在不受体相干扰的情况下被ARPES探测。 这一发现开启了量子材料研究的新篇章。如果轨道有序可以被分离,那么它就可以被操控;如果它可以被操控,那么它最终就可以被设计到利用它的材料中,从而有可能将轨道物理纳入量子器件设计的工具箱。 婷 翻译 本文依据知识共享署名4.0国际许可协议提供。内容摘自《自然·物理》发表的原始报告。

July 21, 2026 21:57 UTC
科学

为什么神经科学无法复制自己的发现,以及这对大脑研究意味着什么

越来越多的证据表明,已发表的神经科学发现中有相当一部分无法被复制。问题并非欺诈或草率,而是根植于大脑研究如何进行的统计架构之中,其教训超越了复制率本身,延伸到了我们如何推断大脑功能这一根本性问题。 复制危机在神经科学中并非单一失败的案例,而是一种模式。特别是脑-行为成像研究,已被证明难以复制。当独立的实验室使用相同的方法重复已发表的实验时,他们常常得到不同的结果。原始发现与复制尝试之间的差距已经大到让一些研究者质疑神经影像学文献中有多少是建立在坚实基础之上的。 根本问题在于统计功效,或者说统计功效的不足。许多神经科学研究,特别是那些使用功能性磁共振成像的研究,仅在20到30名受试者的样本量上进行。这些小样本会产生对大脑活动充满噪声的估计。在20人扫描中看似”激活”的大脑区域,在另一次扫描中可能不会出现,这并非因为第一个发现是错误的,而是因为信噪比对于小样本来说实在太低,无法可靠地检测到它。 这一问题因分析灵活性而进一步加剧。一个包含10万个体素(3D像素)的功能性磁共振成像数据集,可以通过数千种合理的方式进行分析。运行某一种分析流程并发现显著结果的研究者,可能是在利用噪声的偶然特征,而非真正的神经信号。而使用不同流程、甚至相同流程但使用新样本的复制尝试,则一无所获。 这对脑科学意味着什么 复制问题迫使神经科学重新审视如何推断大脑功能。一项显示大脑区域在任务中”亮起”的功能性磁共振成像研究,本身并不能证明该区域对该任务来说是必需的。这需要来自病变研究、动物模型以及经颅磁刺激等因果技术的汇聚性证据,而许多已发表的研究并未提供这些证据。 好消息是这个领域正在做出回应。大型多实验室合作项目,如”许多实验室”项目和国际脑实验室,正在以单个实验室无法企及的样本量进行协调复制。例如,国际脑实验室2021年的一项工作表明,小鼠的标准化行为任务在七个实验室中产生了一致的结果,这证明了当方法被严格标准化时,复制是可能的。 预注册,在数据收集开始前将分析计划提交到公共注册表,正变得越来越普遍。包括《自然·神经科学》和《神经影像》在内的期刊现在要求某些类型的文章进行预注册。一些资助机构正在直接支持复制研究。 更深层的教训 神经科学中的复制危机有时被描述为一场可信度危机,但它或许更应该被理解为统计谦逊的一课。人脑是已知宇宙中最复杂的物体,拥有大约860亿个神经元,形成数万亿个突触连接。期望小样本研究能够可靠地绘制其功能图,从来都是过于乐观的。 向更大样本、标准化方案和预注册分析的转变,并不意味着旧的文献没有价值。这意味着该领域正在开发更好的工具来区分信号和噪声,并且在这个过程中,学习到大脑比研究者们曾经意识到的还要难以研究。 来源:Live Science (2026),”Neuroscience findings often can’t be replicated, and it’s a big problem for what we know about the brain”;International Brain Laboratory (2021),”Standardized and reproducible measurement of decision-making in mice,” eLife;Many Labs 复制项目;功能性磁共振成像可复制性的各项荟萃分析。 婷 翻译

July 21, 2026 21:55 UTC
科学

像物理系统一样思考的AI芯片:振荡器、同步与1000倍能效承诺

当今大多数AI系统通过每秒数十亿次开关晶体管来运行,消耗着巨大的能量。由知名AI研究人员创立的一家初创公司提出了一种根本不同的方案:一种完全不进行开关切换的芯片,而是让物理振荡器自行陷入同步模式,并将结果称为图像。 Unconventional AI由Naveen Rao(曾任职于Databricks、Nervana Systems和Intel)、Michael Carbin(MIT)、Sara Achour(Stanford)以及前Google工程师MeeLan Lee共同创立,于6月发布了其首个模型。这款名为Un-0的产品是一个基于模拟耦合振荡器网络构建的图像生成器,而非传统的晶体管逻辑电路。该公司声称,该架构的能效可能比传统AI硬件高出1000倍。 这一说法非同寻常,但其背后的物理学原理并非如此。 同步即计算 该原理源于藏本模型(Kuramoto model),这是一种对耦合振荡器行为的数学描述。放置在共享表面上的两个节拍器,以略有不同的速率摆动,会逐渐同步,最终锁定在同一节奏中。同样的现象也出现在同步闪烁的萤火虫、心脏起搏器细胞和大脑神经元中。 在Un-0的架构中,数千个虚拟振荡器被物理连接在一起。每个振荡器都有一个相位,描述其在周期中所处位置的角度。振荡器网络中不同的相位角度模式编码了不同的图像。”鞋子”由一种相位配置表示,”火车”由另一种表示。 要生成图像,一小部分振荡器被预设为目标相位模式,这就是”提示”。当连接到更大的随机相位振荡器组时,控制组将整个系统拉向与目标模式的同步。收敛后,生成的相位值网格被送入解码器,将数字转换为像素颜色。 效率从何而来 在传统AI芯片中,每次操作都需要晶体管在开和关状态之间切换,每次都会消耗能量。大型模型的单次推理可能涉及数万亿次这样的切换。 基于振荡器的方法用连续的物理动力学取代了离散的开关切换。电流流经自然振荡的闭合回路。没有强制开关,也没有能量浪费在维持晶体管位置上。系统通过同步的物理学而非逐步的逻辑计算来达到答案。 “耦合藏本振荡器系统提供了在以前未曾达到的规模上通过物理动力学学习的可能性,”该公司在宣布Un-0的博客文章中写道。 基准测试结果 当前版本的Un-0运行在振荡器的软件模拟上,而非物理硬件上。该公司声明的目标是构建定制的基于振荡器的芯片。 在标准图像生成基准测试中,Un-0产生的FID(Fréchet Inception Distance)分数与早期的图像生成模型(如Google的BigGAN和OpenAI的iDDPM)相当。使用16,384个振荡器,它在ImageNet 64×64上实现了6.74的FID,该指标衡量生成图像与参考图像的匹配程度,数值越低越好。 这些结果尚未达到当前最先进水平。”传统生成器在绝对质量和参数效率上仍然更强,用新算法和模型架构缩小这一差距是未来的工作方向,”该公司承认。 未来之路 Un-0是一个概念验证,而非商业产品。从振荡器的软件模拟到实现1000倍效率提升的物理芯片,这条道路漫长且充满不确定性。该公司在Lightspeed、Andreessen Horowitz、Sequoia和Jeff Bezos的支持下,以45亿美元估值筹集了4.75亿美元的种子资金,表明投资者愿意等待。 这项研究的更深层意义可能在于架构而非商业。AI硬件的标准假设是,更好的芯片意味着更快的晶体管。Un-0挑战了这一假设,它质疑计算是否可能看起来不像逻辑而更像物理学,一个耦合元素的网络陷入编码答案的同步状态。 婷 翻译

July 21, 2026 21:03 UTC
科学

单个陶瓷外壳取代复杂多传感器组件实现六轴力传感

《自然·通讯》(Nature Communications)发表的一项新设计将六轴力/力矩传感的复杂多传感器组件缩减为单个单片压电陶瓷外壳,消除了传统方法的复杂性、成本和故障点。 该传感器由中国研究人员开发,采用单片(一体式)压电陶瓷外壳,在施加力或力矩时发生形变。形变在陶瓷表面产生电荷,通过测量多个电极上的电荷分布模式,系统可分别解析施加负载的所有六个分量。 关键创新在于几何结构。多轴力/力矩传感器必须区分压缩、弯曲、扭转和剪切等不同形变模式,这些模式在真实物体承受任意载荷时会以复杂方式重叠。传统设计通过使用各自对准特定轴的独立传感元件,再通过计算组合其输出来应对这一问题。 单片外壳以相反方式解决了相同问题。它不是用多个传感器测量孤立的形变,而是用一个传感器测量完整的形变场,并通过外壳的几何形状和电极的定位实现解耦。压电效应(机械应力响应下产生电荷的现象)是线性和可重复的,这意味着施加力与测量电荷之间的关系可以一次校准后可靠使用。 重要性 六轴力/力矩传感器对于机器人操作至关重要。需要将销钉插入孔中、组装组件或与人类交互的机器人手臂必须同时感知其施加的力和阻碍其运动的力矩。当前一代传感器价格昂贵、体积庞大且机械结构复杂。 可作为单片陶瓷件制造的单片传感器在成本、尺寸和可靠性方面具有优势。无需管理装配公差,没有随时间降解的粘合剂,也没有独立传感元件之间的对准问题。传感器可以做得足够薄,直接集成到机器人关节或末端执行器中而不会增加显著体积。 该论文报告了高灵敏度和解耦精度,意味着传感器能以最小串扰区分沿X轴施加的力与沿Y轴施加的力。具体数值性能指标可在完整论文中查阅。 压电传感的物理原理 压电陶瓷材料在受到机械应变时产生电荷。电荷量取决于应变的大小和方向。通过在陶瓷外壳表面 patterning 多个电极并独立测量每个电极的电荷,研究人员从电响应的空间模式重构出完整的六分量力/力矩向量。 挑战在于施加负载与电荷分布之间的关系并不直观,它取决于外壳几何形状、材料特性、电极布局和边界条件。研究人员在制造器件前使用有限元建模优化了外壳形状和电极位置。 结果是一个通过其内在机械设计而非后处理或算法校正来实现性能的传感器。进行解耦的是物理结构,而非软件。 应用领域 除了机器人技术,单片六轴传感器在精密制造(需实时监测工具力)、虚拟现实和增强现实的触觉反馈系统、需测量与组织相互作用力的生物医学设备,以及重量和可靠性至上的航空航天领域具有潜在应用。 《自然·通讯》中的演示是实验室层面的概念验证。将其转化为商业可行的传感器需要扩大制造工艺规模、证明长期稳定性,并将传感器与标准机器人接口集成。但这一原理,单个成形的陶瓷片可以取代多组件组件,预示着为需要感知自身操作的下一代机器提供更简单、更便宜、更稳健的力传感路径。 婷 翻译

July 21, 2026 20:02 UTC
科学

中国Kimi K3在关键基准测试中追平美国AI模型,但硬件差距揭示不同故事

总部位于北京的Moonshot AI于7月16日发布了Kimi K3,AI研究人员的反应迅速而热烈。”人们称之为’斯普特尼克时刻’,”新南威尔士大学认知神经科学家、研究AI对社会影响的乔尔·皮尔森(Joel Pearson)表示,”这是一个转折点。” Kimi K3是一个拥有2.8万亿参数的推理模型,是有史以来公开发布的最大型AI模型之一。Moonshot的内部基准测试显示,该模型在编程、电子表格操作和通用推理任务上与美国的顶级模型旗鼓相当,甚至更胜一筹。发布三天后,需求就将该公司的处理能力推至极限,迫使暂停新用户注册。 但K3背后的故事不仅仅是基准测试分数,更关乎在美国芯片禁运下构建前沿AI模型的意义。 以少胜多 自2022年10月以来,美国以国家安全为由限制中国获取先进AI芯片。这些限制措施一再收紧,最近一次是在2025年,拜登政府将管制范围扩大至包括某些类型的内存带宽和芯片封装。 中国企业的回应是在算法效率方面大力投入。2025年初发布的DeepSeek证明,可以用比美国公司更少、更不先进的芯片构建具有竞争力的模型。Kimi K3延续了这一轨迹。 新南威尔士大学计算机科学家托比·沃尔什(Toby Walsh)表示,芯片限制可能无意中加速了中国在模型架构方面的创新。”可以推测,这里需求是发明之母。” K3的规模、2.8万亿参数,在训练过程中需要相当可观的硬件支持。但Moonshot AI并未披露其训练基础设施或总计算预算。开放权重的发布允许研究人员在自己的硬件上运行该模型,这有可能实现闭源、仅限API的模型无法实现的应用。 模型访问的地缘政治 K3的发布恰逢AI模型可用性异常波动的时期。2026年6月,美国政府指示Anthropic暂时禁用其最先进的模型Fable 5和Mythos 5。Fable 5的访问权限在数周后恢复,但Mythos 5仍仅限于特定美国组织使用。 这创造了一种市场动态:开放权重的中国模型可能是美国以外研究人员能够获得的唯一前沿级模型。皮尔森指出,中国模型正在改变”投资者和用户对美国前沿模型价值的看法”,因为Google、Anthropic和OpenAI花费数十亿美元训练的模型可能在一天之内变得无法访问。 K3的局限性 模型的规模也是其限制因素。一个2.8万亿参数的模型即使仅用于推理也需要大量的内存和计算资源。硬件有限的研究人员可能会发现,与更小、更高效的模型相比,K3并不实用。Moonshot尚未披露推理成本或硬件要求,潜在用户只能自行评估该模型的能力是否值得其资源消耗。 中国模型是否真正缩小了与美国前沿模型的差距,这个更广泛的问题仍然难以客观回答。公开基准测试涵盖特定任务,且存在过拟合的风险。性能最强的美国模型(OpenAI的GPT-5.6、Anthropic的Claude Opus 4)尚未发布足够详细的技术报告以进行独立比较。K3可能是世界上最好的开放权重模型,但它是否是最好的模型,取决于最优秀的闭源模型的能力有多少仍然不为公开评估所见。 婷 翻译 Sources Fieldhouse, R. & Basu, M. (2026). “Does China’s latest AI model finally equal US rivals? What scientists think.” Nature News, 7月21日. DOI: 10.1038/d41586-026-02281-2; Reuters (2026), […]

July 21, 2026 19:58 UTC
科学

谷歌地图发现直径25公里陨石坑:公民科学正在改写地质学

2024年,乔尔·拉普安特在计划前往魁北克省科特诺尔地区露营旅行时,在谷歌地图上注意到一个异常现象:马尔萨尔湖中心有一个直径约25公里的圆形凹陷,其地形特征与周围景观截然不同。他截取屏幕截图,向位于安大略省伦敦市的西安大略大学运营的众包网站”Impact Earth”提交了报告,从而启动了一系列事件,最终确认了多年来发现的最大陨石撞击坑之一。 行星地质学家戈登·奥辛斯基(同事们称他为”奥兹”)于2025年访问了现场。他的发现证实了拉普安特的猜测。这个圆形结构暂定名为乌哈卡蒂克,已获得其传统土地所在地埃夸尼特希特因努理事会的批准,显示出约3.9亿年前陨石撞击的明显证据。奥辛斯基发现了冲击变质效应,由撞击产生的极端压力和温度导致的岩石变形,以及更令人惊讶的撞击熔融岩。 “撞击熔融岩正如其名:大量岩石因撞击事件而熔化,然后冷却结晶,看起来很像火山岩,”奥辛斯基告诉Space.com。”发现它们被保存下来,而它们通常是陨石坑中最先被侵蚀的部分之一,是一个巨大的惊喜。” 保存异常完好的陨石坑 位于圣劳伦斯湾北部的乌哈卡蒂克陨石坑直径约25公里(15英里),使其成为近几十年来发现的最大撞击结构之一。奥辛斯基指出,上一次发现同等规模的结构是2018年在格陵兰发现的直径31公里的海厄沃萨结构,但该陨石坑因完全被冰层掩埋而仍存在争议。 乌哈卡蒂克撞击熔融岩的保存意义重大,因为它使研究人员能够确定撞击事件的年代并研究撞击体的地球化学特征。这也意味着该陨石坑自形成以来并未遭受实质性侵蚀,表明在其3.9亿年历史的大部分时间里,它一直被掩埋和保护,直到最近的地质过程才将其暴露出来。 卫星时代的公民科学 这一发现是免费卫星图像如何改变地质勘探的典型案例。为导航和城市规划而设计的谷歌地球和谷歌地图已成为事实上的地质调查工具。训练有素的业余观察者能够识别出专业地质学家可能遗漏的特征,因为后者并不会特别关注某一片特定区域。 拉普安特提交报告的”Impact Earth”平台正是为此目的而设计的。它允许任何人提交候选撞击结构供专家评审。自推出以来,该平台已收到数千份提交,其中大多数是误报。乌哈卡蒂克是少数经确认的例外之一。 该陨石坑已获得对该领土拥有管辖权的因努理事会的正式认可。乌哈卡蒂克这一名称源自因努语,反映了陨石坑所在土地的文化背景。 对拉普安特来说,一次露营旅行中的偶然发现已成为对行星地质学的持久贡献。他在屏幕上发现的陨石坑如今已成为科学记录的一部分,提醒人们地球表面仍隐藏着未被发现的故事,而发现它们的工具正日益向任何拥有互联网连接的人开放。 婷 翻译

July 21, 2026 19:09 UTC
科学

GTEx十年:绘制人体基因表达图谱的发现

2010年,美国国立卫生研究院(NIH)启动了一项雄心勃勃的项目:从数百名已故捐赠者身上采集组织样本,对每个组织的RNA进行测序,并绘制出基因在人体中如何被开启和关闭的全面图谱。十多年后的今天,基因型-组织表达(GTEx)项目已经改变了人们对组织特异性基因调控的理解,而且这些数据仍在不断产生新的发现。 最终版GTEx数据集(V8)包含来自838名死后捐赠者的遗传数据,以及来自54个组织部位和两个细胞系的17,382个样本的RNA序列。每个样本捕捉了特定个体特定组织中的转录组,即基因组产生的全部RNA分子。其结果是创建了一个资源,使研究人员能够提出一个以前无法大规模回答的问题:同一个基因组如何产生心脏、肝脏和大脑? GTEx的发现 最直接的发现是,大多数基因并非均匀表达。它们大多表现出组织特异性模式。有些基因只在肝脏中活跃,有些只在大脑中,还有一些只在睾丸中活跃。但GTEx的规模使研究人员能够超越二元开/关分类,来衡量定量变异,即一个基因在一个组织中的表达量比另一个组织高多少,以及这种差异在不同个体之间如何变化。 这种定量变异被证明是理解表达数量性状位点(eQTL)的关键,eQTL是影响基因表达强度的遗传变异。在GTEx之前,eQTL研究主要局限于血液,因为血液容易采集。GTEx显示,许多eQTL是组织特异性的。一个能提高肝脏中基因表达量的变异可能在大脑中完全没有影响,这一发现对目标组织至关重要的药物开发具有直接意义。 GTEx促成了PrediXcan的开发,这是一种利用个人DNA序列预测其特定组织中基因表达水平的统计方法。该工具已被用于识别与双相情感障碍、冠状动脉疾病、克罗恩病、类风湿性关节炎和1型糖尿病相关的基因,这些疾病的相关组织(大脑、动脉、肠道、关节)在活体患者中无法获取。 资源的规模 GTEx项目最初由NIH共同基金资助,为期5至10年。该项目于2019年正式脱离共同基金的支持,但数据仍在被使用和引用。布罗德研究所的组织库仍保留着可用于新研究的未使用生物样本。 该数据集已整合到UCSC基因组浏览器中,任何有互联网连接的人都可以可视化跨组织的基因表达模式。GTEx门户网站提供对表达水平、eQTL和剪接模式的可搜索访问。 下一个十年的启示 GTEx模式,即大规模、公共资助、开放获取的生物样本采集,已经影响了后续项目,包括人类细胞图谱和NIH人工智能桥梁项目。现在的挑战是从批量组织RNA测序转向单细胞分辨率,即逐个测量每个细胞的转录组,揭示批量测序平均化的每个组织内的细胞异质性。 结合GTEx式组织图谱与单细胞方法的项目已经在进行中。目标是绘制一张所有主要组织在细胞分辨率下的人类基因表达参考图谱,这一资源将使GTEx图谱看起来像是更详细全景图的早期草图。 婷 翻译

July 21, 2026 16:29 UTC
科学

AI让科学加速的同时也可能让其变得更浅薄,新模型发出警告

大型语言模型有望通过自动化研究中的繁琐工作来加速科学发现。但由华盛顿大学的卡尔·伯格斯特罗姆参与的一个团队建立的新数学模型警告说,同样的速度提升可能会无意中侵蚀科学工作的质量,使研究人员对发表内容的选择性降低,对其完善过程的彻底性减弱。 这份由芝加哥大学、北卡罗来纳州立大学和华盛顿大学的研究人员发布在arXiv上的预印本,将许多科学家直觉上的担忧形式化了:即大语言模型通过减少研究的摩擦,可能会以有害而非有益的方式改变科学的激励结构。 “作为一种劳动增强型技术,大语言模型有潜力在研究的整个流程中加速科学活动,”作者写道。但他们提醒说,其效果并非完全积极的。 选择性的悖论 该模型预测,大语言模型对发表选择性的影响将取决于其使用方式,产生相反的效果。 在那些大语言模型主要用作发现有前景项目工具(挖掘文献寻找假设、识别未充分探索的问题、提出实验设计)的领域,研究人员会对其追求的内容更加挑剔。他们可以筛选更多的可能性,并将精力集中在最佳选项上。 但在那些大语言模型主要促进现有数据的发表过程(起草论文、生成图表、总结结果)的领域,研究人员会变得不那么挑剔。曾经导致他们放弃边缘阴性结果或跳过未完全准备好的论文的摩擦将消失,发表的研究数量将会上升。 作者指出,第二种情景可能会在许多领域占主导地位,并且它给科学文献的可靠性带来了风险。更多的论文,每篇经过作者自己仔细审查的程度降低,可能会压垮同行评审系统,使真正的研究发现更难脱颖而出。 速度的机会成本 该模型的第二个主要预测更反直觉。通过让科学家工作更快,大语言模型提高了研究人员时间的机会成本。花在完善一篇论文上的每一个小时,都是没有花在开始下一篇论文上的一个小时。 “通过让科学家工作得更快,大语言模型提高了研究人员时间的机会成本,创造了在转向下一个项目前不那么彻底地完善论文的激励,”作者写道。 这一预测直接反驳了乐观的叙事,即大语言模型将把科学家从琐碎任务中解放出来,给他们更多时间进行深度思考。该模型表明,被解放的时间将被重新导向更多的产出,而不是对任何单一工作的更深层次投入。 “尽管想象大语言模型通过节省我们在琐碎任务上的时间,将为我们提供更多时间深入思考和完整开发项目是很诱人的,但我们的结果给这样的希望降温了。” 一个形式化框架 该论文开发了一个简单的研究人员决策数学模型,将时间视为可在发现(寻找新项目)和生产(开发与发表结果)之间分配的资源。大语言模型改变了这些活动的相对成本,该模型预测了对发表量、选择性和彻底性的均衡效应。 该框架有意简化,作者承认真实的科学社群更为复杂,但它为那些迄今主要靠轶事表达出的担忧提供了形式化基础。 伯格斯特罗姆是一位以科学出版和科学社会学研究闻名的生物学家,他为这个问题带来了基于实证分析的良好记录。在之前的工作中,他记录了出版压力、基于指标的评价和不良激励如何扭曲了科学实践。大语言模型将此框架扩展到了重塑研究的最新技术上。 对政策的意义 该论文并不反对在科学中使用大语言模型。它认为其效果取决于具体情境,政策制定者、资助机构和期刊编辑应该考虑大语言模型的采用如何改变目前塑造研究人员行为的摩擦平衡。 如果该模型是正确的,那么在不调整奖励结构(晋升标准、资助评审、期刊规范)的情况下简单地采用大语言模型,可能会加速一个已经在进行的趋势:更多的论文,更低的可靠性,以及一个以数量衡量生产力的系统。问题不在于是否在科学中使用大语言模型,而在于如何围绕它们设计激励机制。 婷 翻译

July 21, 2026 13:23 UTC
科学

“低于平均”的飓风季仍然危险 风暴贝莎正在证明原因

当美国国家海洋和大气管理局的预报员预测2026年大西洋飓风季将低于平均水平时,他们谨慎地加上了一个标准警告:只需一场风暴就够了。热带风暴贝莎周二以时速65公里的风和潜在风暴潮席卷美国墨西哥湾沿岸,正在实时证明这一原则。 美国国家飓风中心预计贝莎将于周三在路易斯安那州新奥尔良附近登陆,带来强降雨、局部龙卷风和沿路易斯安那州和密西西比州部分海岸1至4英尺(30至120厘米)的风暴潮。该中心已警告从佛罗里达州奥克洛科尼河延伸至路易斯安那州杰斐逊-普拉克明教区边界的警戒区将出现”危及生命的风暴潮”。 贝莎只是2026年飓风季第二个被命名的风暴,此前热带风暴亚瑟上个月给美国带来了洪水。其风速勉强达到热带风暴级别,可能导致一些人低估它。但该风暴以约每小时5公里的速度向西北缓慢移动,意味着相同地区将持续降雨。到周五,一些地区降水量可能达到20厘米(8英寸),而缓慢移动的风暴以难以精确预测降雨总量而闻名,因为路径的微小变化会使其在任何给定点的累积量翻倍或减半。 厄尔尼诺悖论 由于太平洋正在发展的厄尔尼诺事件,2026年飓风季预计将比平均水平平静。厄尔尼诺通常通过增加垂直风切变(风速和风向随高度的变化)来抑制大西洋飓风活动,从而在雷暴组织成气旋之前将其撕碎。 美国国家海洋和大气管理局5月的展望以厄尔尼诺为主要驱动因素,给出55%的可能性出现低于平均水平的活动。科罗拉多州立大学团队也发布了类似预测。 但厄尔尼诺并不是平静海洋的保证。它减少了风暴的总数但并未消除它们,而那些确实形成的风暴仍然可能很危险,特别是如果它们是移动缓慢、降雨量大的系统,而不是那些登上头条新闻的快速移动的风力机器。 “由于厄尔尼诺对全球天气产生如此巨大的影响,科学家们投入了大量精力来理解它的行为,”美国国家海洋和大气管理局大西洋海洋气象实验室的海洋学家霍斯梅·洛佩斯说。”如今我们可以提前数月预测它。然而,由于自然界总是充满惊喜,仍然存在很大的不确定性。” 贝莎为何严重 这场风暴的威胁特征以水而非风为主导。风暴潮,被风暴环流推上岸的海水,可能通过低洼的密西西比河三角洲向内陆深处推进。新奥尔良官员已开始分发沙袋,并要求居民清理雨水渠。该市的排水系统在2005年卡特里娜飓风后重建和升级,将面临本季度的首次考验。 佛罗里达狭长地带、阿拉巴马、密西西比和路易斯安那的城市地区,暴洪是主要担忧。北半球热带气旋的东半圆通常携带最强降雨,而贝莎的缓慢移动将使对流云团在同一地区停留数小时,从而加大风险。 预计该风暴将于周四减弱为热带低气压,并在周末接近得克萨斯州海岸时可能消散。但这一结果取决于确切的路径以及与预计从西面接近的高空槽的相互作用,这些细节只有在发生前几小时才会变得清晰。 贝莎之后的展望 厄尔尼诺事件往往在秋季加剧,这意味着飓风季的高峰月份(8月至10月)可能会看到风暴形成的更强抑制。但2026年飓风季已经表明了它的观点:低于平均水平的季节性预报并不是安全的保证,无论是8场风暴还是18场风暴,防备误差的幅度完全相同。 婷 翻译

July 21, 2026 12:04 UTC
科学

谷歌3200万只蚊子计划:科学已就绪,但真正考验是监管

谷歌Verily生命科学部门正寻求美国环保署批准,在加利福尼亚州和佛罗里达州释放3200万只实验室培育的雄蚊,以抑制传播登革热、寨卡病毒和基孔肯雅热的白纹伊蚊(Aedes aegypti)种群。该提案背后的科学原理已在大规模试验中得到验证。监管体系能否跟上蚊子繁殖的速度,才是悬而未决的问题。 这项技术被称为不亲和昆虫技术(IIT),利用一种名为沃尔巴克氏体(Wolbachia)的天然细菌。沃尔巴克氏体存在于约60%的昆虫物种中(蝴蝶、蜜蜂、甲虫等),但白纹伊蚊体内没有。科学家将这种细菌注入蚊卵,由此产生的雄蚊被释放到野外后,与缺乏相同沃尔巴克氏体菌株的雌蚊交配。这种生殖不匹配意味着无法产生可存活的后代。 雄蚊不叮咬,也不传播疾病。这种方法具有物种特异性,只影响白纹伊蚊,且不留下化学残留。这是害虫防治领域最接近外科手术式打击的手段。 澳大利亚试验证明了什么 昆士兰大学的Nigel Beebe教授自2018年起领导了一项由Verily支持的昆士兰远北地区实地试验。在20周内,团队在三个处理城镇释放了约300万只携带沃尔巴克氏体的雄蚊。2021年发表在《美国国家科学院院刊》(Proceedings of the National Academy of Sciences)上的结果显示,四周内种群数量出现可测量的下降,12个月后一个城镇的白纹伊蚊抑制率约为95%。在三个处理点中的两个,抑制效果持续到了下一个季节。 Verily提供了机器学习系统,解决了生产过程中的一个关键瓶颈:分离雄蚊和雌蚊,因为释放会叮咬的雌蚊会破坏整个计划。 昆士兰试验证明,生物学原理是可行的。谷歌现在面临的问题是,监管体系能否批准一项规模大10倍的行动,每年在两个州释放1600万只蚊子。 监管路径 沃尔巴克氏体方法并非不受监管。美国环保署已将感染沃尔巴克氏体的蚊子归类为《联邦杀虫剂、杀菌剂和杀鼠剂法》(FIFRA)下的生物农药。沃尔巴克氏体蚊子的实验使用许可最初于2015年颁发给肯塔基大学,用于在加利福尼亚州弗雷斯诺县进行测试,并于2016年扩展至加利福尼亚州奥兰治县和佛罗里达州门罗县的试验点。 此前的许可确立了先例。美国环保署认定,这些释放对”非目标生物和环境构成的风险极小”。但谷歌提案的规模,两年内释放3200万只昆虫,比以往任何美国试验都大一个数量级,美国环保署对该申请的公众评议期已于2026年6月5日结束。 该机构尚未公布决定。如果获批,该许可将需要与加利福尼亚州农药监管局和佛罗里达州农业与消费者服务部协调,这两个机构均对其州内的实地释放拥有管辖权。 更广泛的工具箱 沃尔巴克氏体方法(IIT)是蚊虫控制的几项新兴技术之一。基于辐射的不育昆虫技术(SIT)使用伽马射线使雄蚊绝育。Oxitec等公司开发的转基因蚊子携带一种致死基因,可阻止雌性后代存活。 每种技术都面临不同的监管路径。转基因蚊子需要美国环保署的实验使用许可及美国农业部的审查。SIT用于农业害虫已有数十年历史,监管要求极低,但将其应用于人类疾病媒介则会引发新的审视。沃尔巴克氏体IIT因该细菌被归类为农药而属于美国环保署管辖,但避免了基因改造有时引发的公众反对。 2019年《自然》(Nature)杂志的一篇论文证明,将IIT和SIT相结合,对感染沃尔巴克氏体的雄蚊进行辐照,可以消除意外释放雌蚊的风险,因为任何无意间释放的感染沃尔巴克氏体的雌蚊都会被辐射绝育。这种组合方法在中国两个岛屿上几乎完全消灭了白纹伊蚊。谷歌的申请并未提出组合方法。 社区参与作为基础设施 昆士兰试验最重要的发现可能并非技术层面。该项目需要两年的社区参与、与六所大学和地方议会的协调,以及多个监管层面的批准。Beebe将合作描述为”或许是最重要的教训”。 美国推广面临的挑战在于,谷歌提议释放的社区,加利福尼亚州和佛罗里达州人口密集的城市和郊区,与昆士兰远北地区的农业隔离环境截然不同。公众对释放蚊子(即使是不叮咬的雄蚊)的担忧是真实存在的,需要在地方层面(而非仅仅联邦层面)加以解决。 随着白纹伊蚊活动范围扩大,传统杀虫剂因抗药性而逐渐失效,生物学方法正变得越来越有吸引力。问题在于,美国能否让科学的技术准备程度与监管和社区的部署准备程度相匹配。 婷 翻译

July 21, 2026 11:58 UTC
Scroll to Top