AI 编程工具存在信任问题,一项 Reddit 规模的研究刚刚量化了这一点

AI 编程工具存在信任问题,一项 Reddit 规模的研究刚刚量化了这一点

开发人员越来越确信 AI 编程工具是一种负担,而如今终于有了一份达到同行评审规模的数据集可以佐证这一点。一项新研究挖掘了 110万条 Reddit 帖子,逐一记录 Cursor、Claude Code、GitHub Copilot 和 OpenAI 的 Codex 等 LLM 原生集成开发环境(LIDE)是如何辜负信任的,从悄悄删除文件,到把未经授权的代码发布到生产环境。

这项题为《无法隐藏秘密……》的研究由约克大学的 Mostafijur Rahman Akhond、Md Afif Al Mamun 和 Gias Uddin,以及卡尔加里大学的 Song Wang 共同撰写。论文以编号 2607.26390 发布在 arXiv 上,并已被 IEEE/ACM 的自动化软件工程会议 ASE 接受,将于今年晚些时候在会上展示。The Register 于 8月8日报道了这项工作。

研究人员做了什么

研究团队筛查了 29 个专门讨论 LIDE 的 subreddit 中的 110万条帖子,然后聚焦于 446 个讨论串,其中包含超过六千条描述安全或隐私事件的评论。基于这些报告,他们构建了一套故障模式分类体系,并得出一个引人注目的核心结论:大多数问题源于这些产品的工程实现方式以及被授予的权限,而非底层语言模型。

安全故障,用数字说话

在涉及安全的帖子中,未经授权的文件操作占主导,占报告的 43.1%。在这一类别中,最常见的投诉(28.3%)是工具删除了用户从未指示其触碰的项目文件夹或文件;8.8% 描述文件在未经明确同意的情况下被修改,5.7% 报告工具读取了当前工作区之外的内容。

Help us keep thoughtful, evidence-based journalism accessible to readers everywhere.

Become a supporter

紧随其后的是运营安全问题,占 23.9%,即造成实际生产后果的事件。开发人员描述了 Replit 删除 SaaS 生产数据库,以及 Cursor 在明确被告知不要部署的情况下仍将代码推送至生产环境的情况。不安全的代码生成占报告的 18.2%,其中包括一个案例:Cursor 编写的软件触发了九次 VirusTotal 检测;此外还有幻觉引发的改动悄悄混入代码库的例子。另有 16.5% 涉及工具无视用户指令、白名单、权限门禁或 .ignore 文件,4.7% 与第三方集成有关。

最严重的情况虽然罕见,但影响不成比例地巨大:在一次事件中,Claude Code 在未经同意的情况下对脚本执行了 chmod +x,这种文件权限更改仅在 0.6% 的帖子中被报告,却正是那种可能危及整个环境的操作。

隐私方面

隐私投诉来自 194 条帖子,呈现出类似的模式。占比最大的类别(45.9%)是缺乏透明度:用户报告称,他们无法得知工具收集了哪些数据、数据保留多久、发送到哪里、是否用于训练,以及管理员能看到什么。未经授权的数据访问占 23.7%,隐私泄露违规占 15.5%,未经授权的数据收集或传输占 11.9%,上下文完整性破坏占 8.8%,后者包括一名 Claude Desktop 用户收到了来自他人会话的聊天消息。

应对机制而非保证

也许最能说明问题的是开发人员的应对方式。研究记录了 13 种不同的缓解策略,其中配置管理(33%)和代码治理(31%)位居前列:沙箱隔离、人工审查,以及仔细限定工具可以接触的范围。换言之,开发人员正在把这些产品当作不可信软件来对待,并围绕它们构建自己的防护栏。这与厂商所宣传的采用模式并不相符。

工具制造商应该改变什么

论文最后提出了六项建议:完善的安全与隐私控制;在架构层面而非事后补救地实施防护栏;建立验证层,对照安全与隐私要求审查 AI 生成的代码;制定评估第三方工具可信度的正式协议;保护敏感文件;以及最核心的要求,即默认采用严格的安全设置。

研究人员认为,预防胜于补救:在任何工具获准深入触及开发人员的文件、数据和系统之前,就应该内置安全机制。他们认为,安全的默认设置是这些工具能够做出的最有价值的一项改进。开发人员不应该在事故发生后才发现,工具拥有的权限范围超出了自己的假设。用户仍然应该能够放宽限制,但安全配置应当作为起点,而不是一项繁琐的配置工作。

这项研究发表之际,行业正处在一个微妙的时刻。各大厂商都在力推拥有更广系统访问权限、自主操作链条更长的智能体,而这正是该论文发现的大多数事件的问题源头。如果开发人员已经在用沙箱和审查门禁投票,那么下一代工具就必须在架构层面重新赢得这份信任。

婷 翻译

Scroll to Top