新研究显示,一个虚假论点就能让大语言模型的准确率跌至接近零

伊利诺伊大学厄巴纳-香槟分校研究人员发布的一份新预印本显示,当有人与大型语言模型争论时,模型对真相的把握可以变得多么脆弱。作者证明,一条有针对性的说服性消息,即使包含与事实不符的说法,也能让模型的回答偏离正确答案,在某些情况下使准确率跌至接近零。

这篇论文于8月12日发布在arXiv上,对作者所称的对抗性说服(adversarial persuasion)进行了形式化:这是一种攻击方式,经过辩论训练的智能体经过优化,能在单次对话中翻转目标模型的回答。作者将这项工作定位为红队研究,与越狱(jailbreak)研究互为补充,后者关注的是绕过安全规则,而非普通的对话影响。

说服者使用强化学习针对一个参数冻结的目标进行优化,并且只有在把目标模型的回答翻转到某个预设错误选项时才能获得奖励。在TruthfulQA基准上,训练将针对Qwen-2.5-7B模型的说服成功率从24.3%提升至93.7%,而目标模型的准确率从66.2%跌至1.8%,下降了64.4个百分点。说服者还能泛化到训练中从未见过的模型:对Qwen-14B的成功率为82.5%,对Llama-3.1-8B为79%。

更强的模型抵抗力更强:GPT-4o-mini在TruthfulQA上有25%的情况被翻转,在各基准上平均为16%,而GPT-5-mini是最难攻破的目标,仅为3%。课程式方法先针对更容易被说服的开放权重模型进行练习,再转向更难的目标,将GPT-4o-mini的失败率从24.6%推高至37.9%。即使是一个明确调优以抵抗说服的适配器,即作者所称的PBT-8B,仍有60%的情况会被这些论证说服。

If you believe trustworthy journalism still matters, we'd appreciate your support.

Keep quality journalism alive

训练出的说服者不使用越狱手段或对抗性前缀,而是采用普通人辩论的手法:承认目标模型给出的证据、植入虚假细节、含糊地援引研究、重新框定问题。随着时间推移,优化后的智能体会收敛于基于可信度的欺骗,编造引用和听上去权威的证据。论文中的一个例子显示,一个Qwen模型正确回答了MMLU中一道关于影响DNA的化合物的题目,随后正是通过这些手法被说服改选了一个错误的单一答案。

作者认为,在模型与人类或其他模型辩论、提供建议或做出决策的任何系统中,说服鲁棒性都应被视为一项核心安全标准。此前的相关研究支持这一担忧:2024年ACL的一篇论文表明,大语言模型的正确信念可能被说服策略所操纵;2025年EMNLP的一项研究发现,大语言模型裁判可能被说服为错误答案虚增分数;另有一项2026年关于多智能体辩论的研究发现,单个对抗性智能体就能使系统整体准确率下降10%至40%。新论文的代码和数据已在GitHub上公开。

婷 翻译

来源:Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs(arXiv,2026年8月);全文(HTML)(arXiv,2026年8月);Investigating LLMs’ Belief towards Misinformation via Persuasion(ACL 2024);Can You Trick the Grader? Adversarial Persuasion of LLM-as-a-Judge(Findings of EMNLP 2025)

Scroll to Top