Token导航 LogoToken导航

xAI发布Grok 4.7 定位最强编码与知识工作模型

更新时间 2026-09-22来源 AGIHunt正文 1959字阅读约 7分钟8 张图片

刚刚,xAI 正式发布了 Grok 4.7,官方定位是「最强编码与知识工作模型」。

图片
马斯克转推

马斯克亲自转发了团队成员 aksheyd 的推文,后者表示花了大量时间打磨 harness,跟顶尖工程师反复迭代,还特意提到:fast 模式的 tps 快到疯狂。

而 Grok 4.7 的卖点也确实可以用一句话来概括:同价同速,全面提升

先来看数据:

图片
官方跑分对比表

CursorBench 46.3%

01

编码能力是 Grok 4.7 的主战场。

CursorBench 4.0(xhigh 档位)上,Grok 4.7 拿到了 46.3%,相比 4.6 的 40.4% 提升明显,也超过了 GPT-5.6 Sol 的 41.7%。

不过 Fable 5.1 仍然以 51.8% 领先。

在 Terminal-Bench 4.0 的提升幅度则更大:从 20.3% 直接涨到了 38.0%,接近翻倍,也刚好反超了 GPT-5.6 Sol 的 37.3%。当然,Fable 5.1 的 57.9% 还是遥遥领先……

DeepSWE v1.1 上,Grok 4.7 达到了 71.0%(4.6 是 65.2%),这个分数超过了 Fable 5.1 的 70.0%,不过 GPT-5.6 Sol 以 72.7% 仍然是最高的。

法律基准碾压

02

编码之外,还有一些不太常见的亮点。

Harvey 法律 Agent 基准上,Grok 4.7 拿到了 19.6%,而 GPT-5.6 Sol 是 2.5%,Fable 5.1 也仅有 6.7%。

这是领先幅度最大的一项,接近竞品的三倍。

EEBench(电气工程)上同样突出:64.0%,大幅超过 Fable 5.1 的 56.4% 和 GPT-5.6 Sol 的 39.4%。

图片
多小时办公任务对比

在多小时办公任务 AA Briefcase 上,Grok 4.7 得分 1657,超过了 GPT-6 Astra(1569),已经非常接近 Fable 5.1 的 1678 了。

图片
运行时长

在 HealthBench Professional 是相对弱的一项:56.7%,落后于 GPT-5.6 Sol 的 60.5% 和 Fable 5.1 的 62.1%。

五分之一的价格

03

预料之中且让人舒适的消息是:价格和 Grok 4.6 完全一样

输入 $2/百万 token,输出 $6/百万 token。

对比竞品,GPT-5.6 Sol 是 $4/$20,Fable 5.1 则是 $10/$50。

Grok 4.7 的输入价格是 Fable 5.1 的五分之一,输出价格约为其八分之一。

另外还提供了一个 fast 变体:输出速度翻倍,价格也翻倍。但即便如此,仍然比竞品便宜得多。

换个角度来看也就是,你拿 Fable 5.1 一次调用的钱,大概够可以够 Grok 4.7 调用五到八次。

底层改进

04

Grok 4.7 用了一个全新的、更大的基座模型,并且在强化学习训练上投入了更长时间。

训练任务的难度也更高了,偏向那些需要数小时才能完成的长程任务。

另一个关键改进是自我验证能力。

Grok 4.7 更擅长检查自己的工作和管理长上下文(长程任务里 Agent 最容易在中途跑偏,能自己纠错确实是挺关键的)。

此外,Grok 4.7 对 Grok Bot harness 有了原生的理解能力,对话和知识工作场景下的表现也有提升。

城市游戏对比

05

官方也放出了一个直观的对比 demo:让 Grok 4.7 和 4.6 分别完成同一个任务:搭建一个开放世界城市游戏。

先看 Grok 4.7 的效果:

图片
Grok 4.7 城市游戏

高楼、街道、汽车、HUD 小地图,已经有了 GTA 的那味儿了。

再看 Grok 4.6:

图片
Grok 4.6 城市游戏

方块建筑、白模人物……差距确实一眼便能看出。

四档推理

06

Grok 4.7 已经在 Grok Build 中上线:

图片
Grok Build 界面

支持 Low、Medium、High、Extra High 四档推理力度,可以按任务复杂度来选择。

在终端里执行 grok update,就能更新到最新版本。

Cursor 和 Grok API 也已同步更新可用。

安全护栏

07

xAI 称这是他们在安全方面校准最好的一版模型。

LatchBio 生物安全基准上拿到 62.4%,网络安全任务中仅放行 3.3% 的高风险提示,同时保持了对合法安全工作的正常支持。

官方称在拒绝和越狱抵抗方面,这是他们测试过的最强模型。

前沿性价比

08

整体来看,Grok 4.7 并没有在每个 benchmark 上都全面登顶,但在几乎所有维度上都有了显著提升,同时保持住了极低的价格。

图片
Grok 4.7

Fable 5.1 在 CursorBench 和 Terminal-Bench 上依然领先,但 Grok 4.7 已经把差距大幅缩小了,且价格则只有它的零头。

而在法律和电气工程等垂直领域,Grok 4.7 甚至已经反超了所有对手。

可以说,xAI 走的是一条「性能追到 frontier 八九成,价格只有竞品零头」的路线。

如果你是重度 Coding 用户且 cc 被封,那 Grok 4.7 这确实是个值得认真考虑的选择了。

感觉我的 Grok Heavy 订阅又更值钱了!

◇ ◆ ◇

文章标签GrokxAI模型发布
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多