刚刚,xAI 正式发布了 Grok 4.7,官方定位是「最强编码与知识工作模型」。

马斯克亲自转发了团队成员 aksheyd 的推文,后者表示花了大量时间打磨 harness,跟顶尖工程师反复迭代,还特意提到:fast 模式的 tps 快到疯狂。
而 Grok 4.7 的卖点也确实可以用一句话来概括:同价同速,全面提升。
先来看数据:

CursorBench 46.3%
编码能力是 Grok 4.7 的主战场。
CursorBench 4.0(xhigh 档位)上,Grok 4.7 拿到了 46.3%,相比 4.6 的 40.4% 提升明显,也超过了 GPT-5.6 Sol 的 41.7%。
不过 Fable 5.1 仍然以 51.8% 领先。
在 Terminal-Bench 4.0 的提升幅度则更大:从 20.3% 直接涨到了 38.0%,接近翻倍,也刚好反超了 GPT-5.6 Sol 的 37.3%。当然,Fable 5.1 的 57.9% 还是遥遥领先……
DeepSWE v1.1 上,Grok 4.7 达到了 71.0%(4.6 是 65.2%),这个分数超过了 Fable 5.1 的 70.0%,不过 GPT-5.6 Sol 以 72.7% 仍然是最高的。
法律基准碾压
编码之外,还有一些不太常见的亮点。
Harvey 法律 Agent 基准上,Grok 4.7 拿到了 19.6%,而 GPT-5.6 Sol 是 2.5%,Fable 5.1 也仅有 6.7%。
这是领先幅度最大的一项,接近竞品的三倍。
EEBench(电气工程)上同样突出:64.0%,大幅超过 Fable 5.1 的 56.4% 和 GPT-5.6 Sol 的 39.4%。

在多小时办公任务 AA Briefcase 上,Grok 4.7 得分 1657,超过了 GPT-6 Astra(1569),已经非常接近 Fable 5.1 的 1678 了。

在 HealthBench Professional 是相对弱的一项:56.7%,落后于 GPT-5.6 Sol 的 60.5% 和 Fable 5.1 的 62.1%。
五分之一的价格
预料之中且让人舒适的消息是:价格和 Grok 4.6 完全一样。
输入 $2/百万 token,输出 $6/百万 token。
对比竞品,GPT-5.6 Sol 是 $4/$20,Fable 5.1 则是 $10/$50。
Grok 4.7 的输入价格是 Fable 5.1 的五分之一,输出价格约为其八分之一。
另外还提供了一个 fast 变体:输出速度翻倍,价格也翻倍。但即便如此,仍然比竞品便宜得多。
换个角度来看也就是,你拿 Fable 5.1 一次调用的钱,大概够可以够 Grok 4.7 调用五到八次。
底层改进
Grok 4.7 用了一个全新的、更大的基座模型,并且在强化学习训练上投入了更长时间。
训练任务的难度也更高了,偏向那些需要数小时才能完成的长程任务。
另一个关键改进是自我验证能力。
Grok 4.7 更擅长检查自己的工作和管理长上下文(长程任务里 Agent 最容易在中途跑偏,能自己纠错确实是挺关键的)。
此外,Grok 4.7 对 Grok Bot harness 有了原生的理解能力,对话和知识工作场景下的表现也有提升。
城市游戏对比
官方也放出了一个直观的对比 demo:让 Grok 4.7 和 4.6 分别完成同一个任务:搭建一个开放世界城市游戏。
先看 Grok 4.7 的效果:

高楼、街道、汽车、HUD 小地图,已经有了 GTA 的那味儿了。
再看 Grok 4.6:

方块建筑、白模人物……差距确实一眼便能看出。
四档推理
Grok 4.7 已经在 Grok Build 中上线:

支持 Low、Medium、High、Extra High 四档推理力度,可以按任务复杂度来选择。
在终端里执行 grok update,就能更新到最新版本。
Cursor 和 Grok API 也已同步更新可用。
安全护栏
xAI 称这是他们在安全方面校准最好的一版模型。
LatchBio 生物安全基准上拿到 62.4%,网络安全任务中仅放行 3.3% 的高风险提示,同时保持了对合法安全工作的正常支持。
官方称在拒绝和越狱抵抗方面,这是他们测试过的最强模型。
前沿性价比
整体来看,Grok 4.7 并没有在每个 benchmark 上都全面登顶,但在几乎所有维度上都有了显著提升,同时保持住了极低的价格。

Fable 5.1 在 CursorBench 和 Terminal-Bench 上依然领先,但 Grok 4.7 已经把差距大幅缩小了,且价格则只有它的零头。
而在法律和电气工程等垂直领域,Grok 4.7 甚至已经反超了所有对手。
可以说,xAI 走的是一条「性能追到 frontier 八九成,价格只有竞品零头」的路线。
如果你是重度 Coding 用户且 cc 被封,那 Grok 4.7 这确实是个值得认真考虑的选择了。
感觉我的 Grok Heavy 订阅又更值钱了!
◇ ◆ ◇







