Grok 4.6 正式发布:500K 上下文窗口,主攻长期运行的智能体任务

SpaceXAI 于 8 月 12 日发布 Grok 4.6,这是其旗舰模型家族的最新版本,目标直指软件开发和长期运行的 AI 智能体。这家由 SpaceX 于 2026 年 6 月吸收合并 xAI 后成立的公司,将此次发布定位为对日益增长需求的回应:市场需要能够胜任复杂多步骤任务的模型,例如研究某个课题、遍历大型代码库,或把一个粗略构想变成可运行的应用。

该模型延续了前代 Grok 4.5 的 50 万 token 上下文窗口,知识截止日期为 2026 年 2 月 1 日。它接受文本和图像输入并输出文本,支持可配置的推理强度,工具使用涵盖函数调用、代码执行、网页搜索和 X 搜索。定价保持不变:每百万输入 token 2 美元,每百万输出 token 6 美元,另有一个速度更快的版本,价格为前者的两倍。

SpaceXAI 表示,Grok 4.6 在 Artificial Analysis 的综合智能指数上与 GPT-5.6 Sol 持平,两者均得 61 分,而 Claude Fable 5 Max 为 62 分。Artificial Analysis 的独立测试得出了相近的结论:在其衡量实际智能体知识工作的 GDPval-AA v2 指标上,Grok 4.6 的 Elo 评分为 1753,仅次于 Claude Opus 5,与 Claude Fable 5 和 Qwen3.8 Max 的差距也都在误差范围之内。同一分析还发现,Grok 4.6 平均用约 53 轮、约 5 亿输入 token 完成一项任务,而 Claude Opus 5 在最大努力模式下需要约 103 轮和 20 亿 token,因此在长时间的智能体任务上,Grok 4.6 具有明显的成本优势。

该公司的自有基准表显示,Grok 4.6 在各项指标上均较 Grok 4.5 有所提升,其中 DeepSWE 提高 11.9 分,Terminal-Bench 提高 10.3 分,并在 GDPVal-AA v2、AA-Briefcase 和 Harvey LAB 法律基准上排名第一。在编程专项指标上,情况则更为复杂:GPT-5.6 Sol Max 仍在 DeepSWE v1.1 上以 73% 领先,在 Terminal-Bench v3.0 上以 34.6% 领先。

We're building an independent news platform focused on facts over headlines. Join us by supporting our work.

Keep quality journalism alive

训练沿用了 Grok 4.5 的模式,但更进一步:使用精选的模型生成数据进行了更长时间的补充训练,采用了改进的优化器,并由 Grok 4.5 自身在推理、STEM、软件工程、智能体框架和知识工作等领域重新生成 SFT 轨迹,同时过滤掉有问题的轨迹。强化学习覆盖了内核优化、Web 开发和计算机辅助设计中的智能体任务。该公司表示,模型的安全防护机制与扩展后的能力同步校准,并经过了其有史以来最大规模的部署前测试套件的检验。

可用性安排与 Grok 4.5 的发布节奏一致:该模型已在 Cursor 和 Grok Build 中上线,可通过 SpaceXAI API 以及 OpenRouter、Vercel 和 Cloudflare 等合作伙伴使用,发布周内 Cursor 和 Grok Build 的包含用量翻倍。这一时间安排符合 SpaceXAI 在 IPO 后快速迭代的节奏;该公司以 SPCX 为代码公开上市,已将编程和智能体工作确立为其竞争赛道,而对 Cursor 编辑器的收购使其得以直接触达开发者市场,并获取真实的编程会话用于训练数据。

婷 翻译

Sources: Introducing Grok 4.6 (SpaceXAI, Aug 2026); Introducing Grok 4.6 (Cursor, Aug 2026); Grok 4.6 (xAI Docs, Aug 2026); Grok 4.6 benchmarks and analysis (Artificial Analysis, Aug 2026); SpaceXAI releases Grok 4.6 (9to5Mac, Aug 2026)

Scroll to Top