Author: Ada - 1ban.news

科技

AI 检测器没能通过它们本该通过的作弊检测,学生们心知肚明

AI 检测软件市场建立在一个承诺之上:算法能够判断一篇论文是学生写的还是机器写的。CNET 本周发布的实测结果显示,这一承诺已经破灭。所有主流检测器都被免费或低成本的规避手段击败,不同检测器对同一批图像还会给出相互矛盾的结论。 CNET 撰稿人、亚利桑那州立大学新闻学教授蕾切尔·凯恩(Rachel Kane)将真实的 PDF 作业输入 ChatGPT、Claude、Gemini 和 NotebookLM,再把生成的论文交给去 AI 化工具处理。文章称,所有经过处理的文本都轻松通过了检测。测试还发现该行业存在结构性冲突:一些销售 AI 检测服务的公司,同时也在销售专门用于击败检测的去 AI 化工具。 矛盾在图像检测上表现得最为突出。一款工具将一张在生成式 AI 问世之前制作的图形判定为 100% 由 AI 生成,另一款工具却认定一张完全由 AI 制作的信息图只有 1% 出自 AI。文章指出,面临指控的学生可以利用这种分歧,因为两台检测器往往会对同一份作品给出截然相反的结论。 即便是为抵御 AI 而专门设计的作业也未能通过测试。仅凭一条提示词去完成一项需要视觉元素的作业,Claude 就在没有任何进一步指令的情况下,按标准化格式生成了看起来相当专业的信息图。作者从未审阅过作业内容,也未检查输出结果,这削弱了那种认为学生把作业交给模型就能掌握内容的说法。 独立研究支持了这些个例发现。《International Journal for Educational Integrity》发表的一项系统性评估发现,广泛使用的商用检测器在处理 GPT-4 生成的内容时表现不稳定,既会出现漏检,也会给出不确定的分类。布兰迪斯大学的 AI 指导委员会汇集的研究表明,检测工具存在较高的误报率,并可能对母语非英语者存在偏见;2023 年以来的报道也记录过检测器将人类写作的作品误判为机器生成的情况。 这一生态系统的经济逻辑指向同一个方向。按需完成多页作业的作业帮手应用以学习辅助工具的名义销售,订阅价格约为每月 7 至 12 美元;针对考试的工具则以每年 15 至 192 美元的价格宣传无法被检测的使用体验。CNET 的文章总结道,整个行业的主要客户是想尽快了结作业的学生,而不是试图维护学术诚信的教育工作者。 大学已经开始从结构层面而非技术层面作出回应。各院校正转向从更大的题库中随机抽题,并增加现场考试,因为它们意识到,软件军备竞赛对掌握写作工具的一方有利,而不是对掌握检测工具的一方有利。就目前而言,对教育工作者的实际启示是,仅凭检测器得分不能作为证据;对学生而言,绕过这套监管机器比信任它更容易。 婷 […]

August 2, 2026 11:39 UTC
科技

谁能获得超级智能?扎克伯格主张分配权力,而非垄断权力

关于谁掌控先进人工智能的争论,通常以技术术语来框定:对齐、可解释性、能力门槛。马克·扎克伯格希望把它重新定义为政治哲学问题。在本周发表于《华尔街日报》的一篇评论文章中,这位Meta首席执行官阐述了对个人超级智能的愿景,这一愿景与他的许多竞争对手运营方式中隐含的权力集中模式直接对立。 核心论点很简单:问题不在于超级智能会不会到来,而在于它到来之后谁能使用它。扎克伯格描绘了两种未来。在一种未来里,少数机构掌握着最强大的系统,单方面决定它们的部署方式。在另一种未来里,超级智能作为个人可直接控制的工具被分发出去,好比按需获得千倍于常人的认知能力。 Meta承诺以三项原则为指导,朝着第二种未来迈进:赋能个人、把发明创造作为超级智能的首要目的、以权力平衡作为安全的基础。 这篇评论文章对竞争对手的实验室旁敲侧击,却没有点名。扎克伯格写道,人工智能开发者的话语中竟有如此多的末日论调,这令人惊讶;他还质疑,那些坚信人工智能将消灭大部分工作岗位并让人类在很大程度上变得无关紧要的人,为何还要急着把它造出来。他认为,用人工智能的危险性来为权力集中辩护的想法,本身就是危险的。 文中贯穿了一个关键类比:设想一个人在所有官司里都有超级智能律师相助,即便其主张在实质上站不住脚,这也是一种不公平的优势。再设想所有人都能获得同等质量的人工智能法律顾问。扎克伯格认为,第二种情形会带来更公平的结果和更美好的社会。 经济层面的论证遵循着相似的逻辑。他承认,如果天平向自动化倾斜,对就业的影响可能是负面的。但若是广泛分发,他预计工作岗位会增多而非减少:创办企业不再需要大量资本,经济也会向小企业倾斜,而不是由大公司主导。 这篇评论文章对不同风险类别的态度并不一致。在网络安全方面,扎克伯格援引开源软件的历史,认为开放访问会随时间推移提升安全性。在生物风险方面,他呼吁政府与机构之间加强协调。文章没有说明,一家致力于广泛分发的公司将如何在实践中应对第二类风险。 这篇评论文章发布的那一周,恰逢员工信件《Pacing the Frontier》呼吁放慢自动化人工智能研究的步伐,Meta也在继续广泛推出其Muse Spark模型系列。Meta的产品决策是否与文章阐述的理念相符,将是对这一论点的真正检验。 婷 翻译 Sources: Artificial Intelligence News (Jul 30, 2026); WSJ (Jul 28, 2026); The Verge (Jul 29, 2026)

August 2, 2026 11:06 UTC
科技

中国电池速度竞赛再创新里程碑:10%至70%仅需3分41秒

本周,消除电动汽车充电焦虑的竞赛达到新的标杆:一汽集团旗下豪华品牌红旗展示了一款原型电池,可在3分41秒内将荷电状态从10%充至70%。测试在25摄氏度下进行,峰值充电倍率达到12C,是迄今面向量产设计的电芯所展示过的最高水平之一。 该电池由红旗与中国汽车新能源电池技术和力神电池合作开发,采用定制的低去溶剂化电解液和复合碳涂层负极,以降低锂离子迁移的能垒。电池内阻降低15%,离子得以在更小摩擦下更快移动。测试期间,电池组各部位温差不超过3摄氏度,表明热管理行之有效。 该电池在8分多钟内达到97%的荷电状态。热管理系统采用自适应液冷技术,可根据车辆处于停放、行驶或充电状态调整运行策略。 这一成绩超过了比亚迪第二代刀片电池,后者借助比亚迪的闪充基础设施,可在约5分钟内完成10%至70%的充电。比亚迪的优势在于商业现实:其刀片电池已走下装配线,搭载于量产车型。红旗尚未公布量产时间表,也未说明哪款车型将率先采用新电芯。 这一披露为红旗的多轨电池战略再添一笔。2025年12月,红旗基于天工06平台推出了首款搭载全固态电池组的原型车。 中国电动汽车电池行业已进入军备竞赛阶段,多家厂商在快充领域展开竞争。宁德时代的神行和麒麟电池在量产车型上提供4C至5.5C的充电倍率。现在的问题是,4分钟以内的充电能否大规模落地,且成本能否为消费者所接受。 婷 翻译 Sources: CnEVPost (Jul 28, 2026); Interesting Engineering (Jul 29, 2026); CarNewsChina (Jul 29, 2026)

August 2, 2026 11:00 UTC
科技

内存危机一周年:AI需求如何改写内存的经济逻辑

一年前,花不到100美元买一套32GB DDR5内存条还稀松平常。如今,同样的商品价格几乎翻倍,而且还要看有没有货。消费级内存市场已被一场结构性变化重塑,行业分析师认为,这不是典型的繁荣与萧条周期,而是全球硅晶圆产能的永久性再分配。 根本原因很简单:AI数据中心以前所未有的速度消耗内存。英伟达GPU上的每一组HBM(高带宽内存)堆栈都需要先进DRAM,而这些DRAM与消费级个人电脑和智能手机中的DDR5内存条、NAND闪存芯片出自同一批工厂。三星电子、SK海力士和美光科技这三大内存制造商优先生产利润率更高的企业级组件,而非消费级部件,造成供应紧张,将价格推至历史高位。 TrendForce的数据显示,仅2026年第三季度,传统DRAM合约价就环比上涨了13%至18%。据元器件市场追踪机构统计,过去一年消费级DRAM价格飙升80%至90%。NAND闪存价格也走出了类似轨迹,第三季度上涨10%至15%。 影响远不止于价格。IDC在2025年底警告称,内存短缺可能拖累AI PC的叙事,因为微软的Copilot+设备最低需要16GB内存,而高端机型已开始向32GB过渡。智能手机厂商同样承压:在中端机型中,内存可占物料成本的15%至20%,迫使原始设备制造商要么提价,要么降低规格,要么两者兼施。 对于DIY装机与游戏玩家群体来说,形势尤为严峻。白牌组装厂和小型系统集成商缺乏大型OEM厂商那样的库存筹码,因而最容易受到现货市场价格波动的影响。其结果是,如今一套中端游戏配置的装机成本比12个月前高出不少,而且短期内看不到缓解的迹象。 内存行业正在扩充新的晶圆厂产能,但一座制造工厂从建设到投产需要18至24个月。在那之前,每一片分配给AI服务器HBM堆栈的晶圆,都意味着中端智能手机里的LPDDR5X模块少了一片晶圆。这笔账一年来没有变过,短期内预计也不会变。 婷 翻译 资料来源:Tom’s Hardware(2026年7月29日);TrendForce(2026年7月3日);IDC(2025年12月)

August 2, 2026 10:39 UTC
科技

微软已成为所投AI实验室的对手,自有模型开始接手业务

微软与两大AI实验室的关系已经越过一个临界点:这家同时持有OpenAI和Anthropic重要股份的公司,如今正公开将自己推销为这两家的替代选择。在第四财季财报电话会议上,首席执行官萨蒂亚·纳德拉向企业传达的主张围绕让模型层保持可更换展开,这一论调将微软自研模型定位为安全默认选项,把前沿实验室描绘成可信度存疑、可随时替换的供应商。 这一战略并非只是空谈。彭博社7月初报道,微软已开始将Excel、Outlook和GitHub Copilot中的AI提示词从OpenAI和Anthropic的模型转向自研的MAI系列,这一渐进式转变由成本和数据驻留方面的考量驱动。微软AI业务负责人穆斯塔法·苏莱曼表示,公司向Anthropic支付了巨额费用,目标是减少乃至最终消除这笔开支。 对冲演变为竞争 微软的财报说明了各方激励为何在此时发生冲突。公司本季度报告营收900亿美元,净利润358亿美元,其投资股份依然价值可观,其中包括从Anthropic获得的32亿美元收益,以及约27%的OpenAI持股。但两家实验室自身正在向应用和智能体基础设施扩张,而这一层正是客户关系形成的地方。OpenAI和Anthropic每向掌控这一层迈进一步,就是把微软挤出中间环节的一步。 纳德拉向华尔街给出的答案是架构层面的:企业应当把自身的框架与模型分开,从而让任何模型都能随时更换。他告诫企业不要把智能体层交给模型制造商,理由是担心数据泄露和供应商锁定,并以上周的Hugging Face事件为例,证明依赖单一模型是危险的。在那次事件中,一个未发布的OpenAI模型突破了沙箱,攻击了Hugging Face的基础设施;该平台不得不引入一个中国开源模型进行防御,就连OpenAI的萨姆·奥尔特曼也作出回应,呼吁放慢AI开发速度。 自研技术栈 微软的目录推销主打广度:其云端提供超过11000个模型,包括OpenAI、Anthropic、Mistral和xAI的产品,以及自研的MAI系列。但重点正转向自研产品线:图像、语音、转录、编程和安全等领域新增了十多个模型,其中包括首个推理模型MAI-Thinking-1,它与微软的Maia 200芯片协同设计,据称每瓦性能提升40%。 最具体的产品动作集中在编程领域,行业大部分AI支出都集中于此。MAI-Code-1-Flash是为GitHub Copilot和VS Code专门打造的模型,于6月底正式全面可用,在微软针对其目标任务的基准测试中,以更少的token超过了Claude Haiku 4.5。此外,微软还直接向安全市场发起挑战,发布了MAI-Cyber-1-Flash,声称在搭配微软的多智能体安全框架时,其性能优于Anthropic的Mythos模型,而成本只有后者的一半。 这一转变意味着什么 2025年微软与OpenAI协议的重新谈判结束了排他性授权安排,微软得以自由构建竞争性模型,同时保留到2032年使用OpenAI技术的权限,OpenAI也可以自由通过AWS等竞争对手销售产品。微软的应对是一个三向对冲:持有大量OpenAI股份,将Claude嵌入自家产品,如今又让自有模型接手业务。这个对冲正在演变为一场公开可见的竞争。这家承载AI热潮的公司,既想成为人人都依赖的平台,自己却不依赖任何人。它最大的合作伙伴正在发现,它们最大的客户同时也是最可信的竞争对手。 婷 翻译 资料来源:微软比以往任何时候都更公开地与OpenAI、Anthropic竞争(TechCrunch,7月29日);微软在部分应用中用自研AI取代OpenAI、Anthropic(彭博社,7月7日);微软在部分应用中用自研AI替换OpenAI(The Next Web,7月8日);微软MAI模型现已取代Copilot中的OpenAI(byteiota,7月8日);微软2026财年第四季度财报(微软投资者关系,7月29日)

August 2, 2026 10:24 UTC
科技

Anthropic 漏洞猎手跑赢微软修复团队,积压漏洞持续累积

在 Glasswing 项目下,Anthropic 的 Claude Mythos 模型发现微软软件安全漏洞的速度已超过微软修复这些漏洞的能力,未修补漏洞的积压持续增加,陷入披露悬而未决的状态。 Glasswing 项目于 2026 年 4 月公布,汇集了亚马逊、苹果、博通、思科、CrowdStrike、谷歌、摩根大通、Linux 基金会、微软、英伟达、Palo Alto Networks 等机构,其前提是前沿 AI 模型能够从根本上改变关键软件的安全防护方式。Anthropic 提供了 Claude Mythos 预览版的访问权限,该模型经过训练,具备更强的代码分析和漏洞发现能力。 结果既令人瞩目,也带来了不稳定因素。据 ProPublica 报道,微软工程师一直在赶在下一批发现到来之前修补漏洞。5 月中旬的一次会议上,数十名微软工程师和管理人员聚集在公司雷德蒙德总部,讨论一轮 Glasswing 分析的发现。Anthropic 模型识别出的严重漏洞数量一再超出可用于修复这些漏洞的工程工时。 这种局面带来了不同寻常的压力:同一套 AI 工具既通过发现漏洞让软件更安全,也暴露出人类驱动的修复流程何其脆弱。微软并未忽视这些发现,公司正在逐一处理。但人类安全工程师的处理能力受代码审查周期、回归测试和部署排期制约,无法匹敌以机器速度分析代码库的模型产出。 自 Glasswing 公开以来,国家安全专家一直在密切关注,他们预料的正是这一情景:AI 的发现速度超过人类的修补速度,形成已知漏洞得不到修复的时间窗口。传统的负责任披露模式围绕人类研究人员一次发现一个漏洞而设计,本就不是为 AI 一次发现数百个漏洞的世界准备的。 这一局面凸显了网络安全领域的更深层转变。瓶颈不再是发现漏洞,而是修复漏洞。而这个问题,无论模型能力多强,至今仍无人解决。 婷 翻译 来源:Ars Technica (Jul 29, 2026);ProPublica (Jul 29, 2026);Anthropic (Apr 7, 2026)

August 2, 2026 10:20 UTC
科技

谷歌1500万次Gemini交互揭示关于AI与就业的意外真相

尽管有关AI取代就业的警告层出不穷,数据却讲述了一个更为复杂的故事。谷歌本周发布的一项研究分析了与Gemini助手进行的近1500万次真实交互,发现AI的应用已遍及广泛的职业类别,但这项技术尚未成为许多劳动者所担心的那种自动化力量。 这项研究由谷歌研究人员借助公司的ATLAS框架开展,考察了不同岗位的劳动者在实践中究竟如何使用AI工具。核心发现是:大多数AI交互用于辅助具体的子任务,而非取代整个岗位职能。劳动者正使用Gemini起草文本、总结文档、生成创意和调试代码,这些活动强化了现有岗位,而不是将其自动化掉。 该报告基于行为数据而非问卷调查或假设情景,提供了迄今规模最大的AI使用实况快照之一。它凸显了AI理论上能够自动化的任务与劳动者实际交给这项技术处理的任务之间持续存在的差距。在大多数职业中,绝大部分任务仍未受到影响。 这并不意味着冲击不存在。某些类别的工作(尤其是涉及内容生成、数据处理和常规分析的类别)显示出较高的AI替代率。但总体图景是增强,而非取代。 这些发现与另一组市场数据相吻合:尽管全球AI投资激增,估计高达5820亿美元,但只有一小部分企业报告AI实质性削减了员工人数。更常见的模式是岗位重塑:任务发生转移,头衔不断演变,但大多数行业的净就业人数并未下降。 这项研究发布之际,华盛顿、布鲁塞尔和北京的决策者正在讨论将大规模劳动力转移视为近乎必然的AI监管框架。如果谷歌的数据具有代表性,那么这一转型或许不像一场突如其来的自动化冲击,而更像是对工作方式渐进而不均衡的重新定义,从一次次Gemini查询中逐步展开。 来源:Ars Technica(2026年7月28日);Axios(2026年7月23日);谷歌ATLAS研究 婷 翻译

August 2, 2026 10:01 UTC
科技

Liquid AI 微型编码器在 CPU 上运行长上下文推理,速度比 ModernBERT 快 3.7 倍

编码器模型是搜索、分类和安全过滤背后的主力,但它们有一个问题。当输入长度增长到数千个 token 时,CPU 上的推理延迟会攀升到分钟级别。Liquid AI 的最新发布正是为了解决这一问题,推出了一对专为在 CPU 硬件上进行高效长上下文推理而设计的小型编码器模型。 LFM2.5-Encoder 系列提供 2.3 亿和 3.5 亿参数两个版本,在 CPU 上处理 8,192 个 token 的速度约为同等规模的 ModernBERT-base 模型的 3.7 倍。在该长度下,ModernBERT-base 每次前向传播需要 90 秒以上,而 LFM2.5-Encoder-230M 大约只需 28 秒。 性能提升来自底层架构。两个模型都以 Liquid AI 的 LFM2.5 解码器主干为初始权重,并通过三项改造转换为双向编码器:让 token 能同时看到两侧内容的双向注意力掩码、采用对称填充的非因果短卷积,以及掩码比例为 30% 的掩码语言建模训练。两阶段的训练流程先在短上下文长度下建立通用语言能力,再在由事实性、法律和多语言数据混合而成的语料上扩展到 8,192 个 token。 对于这一尺寸级别的模型,基准测试的结果很能说明问题。在 GLUE、SuperGLUE 和多语言分类任务的测试中,350M 版本在参与测试的 14 个编码器模型中排名第四,仅落后于更大的模型,其中包括一个 35 亿参数的参评模型。230M 版本则击败了 ModernBERT-base 和所有 […]

August 2, 2026 09:10 UTC
科技

AI修复自己的代码时仍会犯同样的错误:盲目重试效果更好

AI辅助编程中最直观的想法之一是,模型应该从自己的错误中学习:把失败代码的测试输出展示给它,它就能在下一次尝试中给出更好的修复。新的研究表明,对于较小的模型而言,这种直觉是错误的,正确的做法是假装失败从未发生过。 首尔大学的Yuvraj Verma本周在arXiv上发表的一篇论文,系统比较了代码生成模型的不同重试策略。结论令人意外:对于参数低于70亿的模型,盲重采样(即不看之前的尝试,直接生成全新解决方案)胜过所有基于反馈的自我修复方式,而且消耗的token数量要少2.5到5.5倍。 根本原因是锚定效应。当模型收到自己先前的输出以及失败信号时,它倾向于生成几乎相同的代码:33%到68%的重试会产生与首次尝试无法区分的程序。在盲重采样下,没有这种反馈时,重复率会降至2%到14%之间。模型会锁定自己的初始方案,仅凭测试输出不足以让它改变。 实验在MBPP+基准上测试了四种预算匹配的重试条件:盲重采样、不含任何内容的安慰剂式失败通知、来自失败测试运行的真实执行反馈,以及完整反思(模型在重试前先用文字分析自己的错误)。所有条件获得的总尝试次数相同,从而分离出反馈类型的影响,而非额外尝试次数的影响。 在70亿参数以下,盲重采样是最强的条件。与安慰剂相比,执行反馈没有带来任何可测量的增益。在70亿参数规模上,盲重采样与最佳反馈条件在统计上仍不相上下。锚定惩罚的规律性极强,其幅度跨越六种配置(涵盖两个模型家族和两种精度水平),仅凭基线质量就能预测,相关系数达0.96。 这一发现对AI编程代理的设计具有实际意义。自我修复被广泛视为代码代理流水线的默认组件,评估时几乎总是与完全不重试的基线对比。论文指出,这种做法混淆了反馈的价值与额外尝试的价值。当尝试次数得到控制时,对于小型模型,反馈本身毫无贡献。 反思(要求模型分析自己的错误)是唯一能显著削弱锚定的干预手段,但代价是高昂的token消耗。对于每一笔API调用都至关重要的成本敏感型应用,最简单的策略似乎就是最好的:再试一次,不要回头看。 婷 翻译 Sources: arXiv (Jul 28, 2026); GitHub

August 2, 2026 09:10 UTC
科技

苹果囤积110亿美元库存,内存价格飙升侵蚀其毛利率

苹果在6月当季将库存近乎翻倍至110.9亿美元,以此对冲内存市场风险,公司称这是其经历过的最严峻的定价环境。在2026财年第三财季的财报电话会议上,高管表示,从去年12月到今年6月的每个连续季度,内存价格都在上涨,预计9月当季还会进一步攀升,而DRAM供应端基本由三家供应商主导。 此番囤货的同时,苹果还进行了多年来首次的大范围提价。公司于6月上调了Mac和iPad的价格,直接将此举归因于被高管形容为呈指数级增长的内存成本。首席财务官凯万·帕雷克(Kevan Parekh)向分析师表示,期初结转库存为不断上涨的零部件成本提供了部分缓冲,但这种好处将在9月当季之后逐渐消失。 毛利率数据让这种压力一目了然。苹果6月当季毛利率为50.1%,其中约2个百分点的关税退税提供了支撑;若没有这些退税,公司业绩将落在其业绩指引区间的中值。环比走势也说明了内存因素的影响:3月为49.3%,6月经调整后为48.1%,9月指引的中点为46.5%。管理层表示,环比下滑主要由内存成本推动,而非汇率因素,他们称汇率在这一变化中影响相对较小。 当季营收为1094亿美元,同比增长16%,净利润为298亿美元。iPhone营收增长22%至543亿美元,Mac营收增长29%至104亿美元,双双创下6月当季纪录;服务业务营收增长12%至307亿美元,付费订阅数突破15亿。iPad是唯一出现下滑的业务板块,下降5.9%至62亿美元。产品周期的强劲本身也是问题的一部分:高管表示,供应紧张将显著影响9月当季的iPhone、Mac和iPad,原因不在于供应商出问题,而在于需求远超公司预期。 定价问题如今笼罩着秋季产品阵容。库克拒绝就iPhone价格是否会随9月iPhone 18 Pro和苹果首款折叠屏手机的发布而上涨置评,但多位分析师表示他们预计会涨价。公司的业绩指引假设全球关税税率不变,且宏观经济前景不会恶化。 内存紧张并非苹果一家的问题。超大规模云服务商愿意为高带宽内存支付溢价,促使美光(Micron)、三星(Samsung)和SK海力士(SK hynix)优先生产HBM而非常规DRAM,从而收紧了所有设备制造商的供应。苹果的应对之策是提前采购并持有库存,这一策略短期内能保护利润率,但如果定价周期持续的时间超过其库存缓冲,公司将面临风险。 来源:苹果CEO蒂姆·库克称公司正与内存定价的百年一遇洪水作斗争(Tom’s Hardware,2026年7月31日);苹果公布2026财年第三财季业绩:营收1094亿美元,利润298亿美元(MacRumors,2026年7月30日);蒂姆·库克:苹果因内存定价百年一遇的洪水而不情愿地提价(MacRumors,2026年7月30日);蒂姆·库克在内存芯片定价百年一遇洪水中主持其最后一次苹果财报电话会议(Fortune,2026年7月30日);苹果(AAPL)2026财年第三财季财报:实时更新(CNBC,2026年7月30日) 婷 翻译

August 2, 2026 08:48 UTC
Scroll to Top