Token导航 LogoToken导航

SpaceXAI发布Grok 4.7 编程知识工作能力升级

更新时间 2026-09-22来源 机器之心正文 2135字阅读约 7分钟6 张图片

机器之心编辑部

今天一早,SpaceXAI 最强模型 Grok 4.7 来了。

发布页开头只有一句极具「攻击性」的定位:面向编程与知识工作的最强模型,速度达到可比模型的两倍,价格只有一半。

图片

这次升级没有停留在跑分表上。Grok 4.7 换用了更大的基础模型,强化了长时间任务、自我检查和长上下文管理能力,并把文档、演示文稿、法律、医疗和工程等专业工作纳入重点测试。它瞄准的场景很明确:让模型在持续数小时的任务里少走弯路,交出可以直接使用的结果。

图片

马斯克发推表示,「Grok 4.7 在智能水平、运行速度和成本之间取得了很有竞争力的平衡。」

图片

长任务,成为这一代模型的主战场

Grok 4.7 采用了比 Grok 4.6 更大的基础模型。训练阶段延长了强化学习周期,任务组合也进一步加难,其中更多样本需要数小时才能完成。SpaceXAI 称,新模型在检查自身工作、管理长上下文方面都有提升。

这类改进直接对应当前编程智能体最棘手的问题。短代码生成往往只需要局部判断,真正复杂的软件任务却包含阅读仓库、拆解需求、修改多处文件、运行测试和反复纠错。模型能否在漫长执行链中保持目标、发现错误,通常比一次写出漂亮代码更重要。

CursorBench 4.0 专门考察长时间编码任务。官方数据中,Grok 4.7 得分 46.3%,Grok 4.6 为 40.4%,提升 5.9 个百分点。在 DeepSWE v1.1 上,Grok 4.7 的高推理强度成绩为 71.0%;Terminal-Bench 4.0 则从上一代的 20.3% 升至 38.0%。

据此将 Grok 4.7 称为 CursorBench 4.0 上价格与性能均处于前沿的模型。

图片

模型也被训练为原生理解 Grok Bot 的运行框架。按照官方说法,这项调整改善了对话任务和通用知识工作表现。换句话说,Grok 4.7 的升级重点已经从单轮回答延伸到模型与工具、执行环境之间的持续协作.

从写代码,走向完整的知识工作

编程仍是 Grok 4.7 最醒目的标签,但 SpaceXAI 给出的评测范围明显更宽。AA Briefcase 和 GDPval 关注的是专业人士日常完成的多步骤工作,覆盖律师、护士、金融分析师等岗位常见任务,也包括文档和演示文稿制作。

在 AA Briefcase v1.1 上,Grok 4.7 获得 1657 分,高于 Grok 4.6 的 1546 分;GDPval Elo 分数由 1605 升至 1695。官方图表中,它在 GDPval 上接近 Fable 5.1 的 1735 分,高于 GPT-6 Astra 的 1542 分。SpaceXAI 的结论是,Grok 4.7 在两项测试中均超过上一代,整体表现与其他前沿模型相当。

图片

专业领域的提升也出现在多个方向。EEBench 得分由 53.0% 升至 64.0%,Harvey Legal Agent Benchmark 由 15.8% 升至 19.6%,HealthBench Professional 由 48.5% 升至 56.7%。这些结果来自 SpaceXAI 公布的内部对比表,能够说明新旧两代模型之间的变化;跨模型比较仍会受到推理强度、工具配置和测试环境影响。

这组成绩透露出一个清晰趋势:前沿模型的竞争正在进入「完成整项工作」的阶段。

模型需要理解任务、调用工具、产出文件并自行复核,单一问答能力只是其中一环。Grok 4.7 延长训练任务时长,并强化自我验证,正是在为这类工作流补课。

安全与价格

能力提升之外,Grok 4.7 启用了一套全新的安全防护体系。SpaceXAI 称,这是其测试过的模型中,在拒答与抵抗越狱方面表现最强的一款。

在生物安全评测方面,Grok 4.7 以 62.4% 的成绩登顶 LatchBio 基准。网络安全测试 HackerBench v0.3 主要覆盖高风险和恶意任务。按照官方数据,模型仅放行 3.3% 的高风险双重用途提示,同时很少误拦正常的安全研究请求。

SpaceXAI 还开始向少数网络安全合作伙伴开放邀请制红队能力,用于防御研究。目前,这项红队能力先以受控合作方式提供。

标准版延续原价,快速版速度翻倍

Grok 4.7 已经上线 Cursor 和 Grok Build,并通过 Grok API、第三方编程框架、模型路由服务及云平台提供。标准版起价为每百万输入 Token 2 美元、每百万输出 Token 6 美元,与 Grok 4.6 保持一致

价格策略让这次升级更具冲击力。开发者无需为换代支付额外的标准版 Token 成本,却能获得更强的长任务表现、自我检查能力和专业工作成绩。

对编程智能体与知识工作产品而言,模型每次调用的单价固然重要,完成一项任务需要多少轮尝试、多少次返工,最终决定了真实成本。

最后总结一波这次升级:

从训练方式到评测组合,Grok 4.7 都在强化同一件事:长时间留在任务里,把复杂工作做完。编程只是最先成熟的入口,文档、演示、法律分析、临床推理和工程任务已经被放进同一套能力版图。

但网友似乎并不买账,「这种模型居然也敢发布,简直差到不该发布。」只能挽尊地说,这次 Grok 4.7 的卖点不是全面碾压竞品,它是用远低于部分旗舰模型的 API 成本,换来了相当接近、并在个别专业任务上领先的性能。

图片

参考链接:

https://x.ai/news/grok-4-7

https://x.com/ArtificialAnlys/status/2102074904560771365

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多