Token导航 LogoToken导航TokenDH.com

Kimi K3之后,中国AI开始进入”高考时代”?

更新时间 2026-07-17来源 虎嗅网正文 2528字阅读约 8分钟1 张图片

国产大模型Kimi K3在WebDev Arena获全球第一,开发者测试显示其完成BAT小游戏任务失败,GPT-5.6 Codex一次成功

本文来自微信公众号: 岳涌大江流

昨天晚上,我刷朋友圈的时候,看到了朋友童佟发的一段测试视频。

视频里,没有Benchmark,没有排行榜,也没有各种数学推理题。他只做了一件事:让AI用BAT批处理脚本,在Windows 10命令行里写一个ASCII版《小蜜蜂》。

要求很简单,也很苛刻——必须真的能运行,真的能玩,键盘能控制,敌机会移动,而不是生成一堆看起来很专业的代码。

看完视频,我没有第一时间去试Kimi,而是打开了WebDev Arena排行榜。

Kimi K3,1679分,全球第一,排在后面的,是Claude、GPT-5.6等一众顶级模型。

国产基础模型第一次真正站到了世界第一的位置。

如果把这两件事情放在一起,就特别有意思。

一边,是排行榜全球第一;另一边,却是真实开发场景里的翻车。

童佟测试的结果并不复杂。

免费版K3,游戏画面出来了,字符排布整整齐齐,看起来已经像一款游戏,但键盘无法控制角色,多轮修改依然失败。随后升级到699元订阅版重新测试,连续尝试五次,连画面都没有正常输出。

而同样一道题,GPT-5.6 Codex一次完成,程序可以直接运行。

这当然只是一个具体案例,并不能说明Codex在所有编程任务上都一定强于K3,也不能因此否定K3的整体能力。

但它让我想到一个比”Kimi到底强不强”更值得讨论的问题:

今天的大模型,到底是在学会工作,还是越来越会考试?

AI,开始越来越像中国教育了

最近一年,我越来越觉得,AI的发展路线开始有点像中国教育。

几乎所有模型公司,都在拼命刷Benchmark。WebDev Arena、SWE-Bench、BrowseComp……一个榜单接着一个榜单,模型越来越聪明,排行榜越来越高,媒体越来越兴奋,资本也越来越买单。

可真正进入真实工作以后,却经常出现另一种情况:代码能写,程序跑不了;方案能生成,项目落不了地;PPT做得很漂亮,真正执行的时候却漏洞百出。

是不是特别熟悉?

这像不像一个高考700分的学生。数学满分,英语接近满分,作文也很好,可第一次写PPT不会,第一次做Excel不会,第一次谈客户不会,第一次带团队不会。

因为考试和工作,从来不是一回事。

童佟设计的BAT小游戏,其实并不难,它只是足够”偏”。偏到训练数据很少,偏到排行榜几乎不会考,偏到没有标准答案。

于是,它真正考验的,不再是模型有没有见过,而是有没有真正理解。

Benchmark越来越像高考,真实世界永远没有标准答案。

Kimi的问题,其实不是Kimi的问题

先说结论。

我一点都不认为Kimi K3是一个失败的模型。恰恰相反,它应该是今年国产基础模型最重要的一次升级之一。无论是参数规模、长上下文能力,还是公开评测成绩,它都已经进入全球第一梯队。这一点,值得肯定。

真正让我担心的,是另一件事情。

为什么今天所有模型公司,都越来越迷恋跑分?

答案其实很现实。

因为今天的排行榜,早已不只是技术排行榜,它更像一张融资成绩单。

过去半年,中国AI几乎进入了”月更时代”。Kimi K3、腾讯混元Hy3、阿里千问、智谱GLM、DeepSeek……几乎每个月都有新模型,几乎没有一家敢停。

很多人觉得,这是技术竞争越来越激烈。

我却越来越觉得,这其实是资本竞争越来越激烈。

DeepSeek估值已经达到约710亿美元,月之暗面也在推进新一轮融资,腾讯、阿里持续加码,智谱不断迭代,每一家都希望证明自己仍然站在第一梯队。

因为排行榜越高,意味着估值越高;估值越高,意味着融资越容易;融资越容易,就意味着可以买更多GPU、招更多人才、训练下一代模型。

于是,模型更新越来越快,排行榜越来越重要,整个行业开始形成一个循环。

跑分,开始决定资本;资本,又反过来推动跑分。

这一幕,其实并不陌生。

十年前,滴滴、快的、美团、摩拜、ofo拼命融资、拼命扩张、拼命讲故事。今天,AI行业也开始进入自己的”融资时代”,只是把当年的补贴大战,变成了今天的跑分大战。

有人已经开始换打法了

有一个细节,我觉得特别值得关注。

腾讯发布混元Hy3的时候,没有把重点放在公开排行榜,而是更多强调真实业务场景,希望跳出容易被”刷榜”的公开Benchmark。

另一边,OpenAI过去一年也发生了明显变化。

他们越来越少讨论排行榜,更多在做Operator、Deep Research、Codex以及各种Agent能力。

很多人觉得这些产品没有新模型那么震撼,但我越来越觉得,这才是真正的升级。

真正的软件工程师,每天写代码可能只占20%的时间,剩下80%的时间,都在调试、运行、修Bug、不断修改。

真正重要的,不是第一次答案,而是最后能不能把事情做完。

所以,在童佟那个测试里,Codex真正让我印象深刻的,不是代码写得更漂亮,而是它更像一个真正的程序员。

不是负责生成代码,而是尽可能把整个项目完成。

这是两种完全不同的能力。

一种叫考试能力。

另一种叫工作能力。

中国AI真正的竞争,现在才刚刚开始

昨天晚上,我又重新看了一遍Kimi K3那张排行榜。

我还是很高兴。

因为国产基础模型终于第一次真正坐到了世界第一排,这是Kimi、DeepSeek、腾讯、阿里、智谱,以及无数中国AI工程师共同努力的结果。

但比起第一名,我更希望中国AI不要重复互联网时代最后那场内卷。

过去,互联网拼流量、拼补贴、拼融资;今天,AI开始拼参数、拼跑分、拼估值。

看上去变了,其实没有变。

真正让我担心的,不是Kimi有没有拿到第一。

而是如果有一天,所有模型公司都开始围着Benchmark转,围着资本转,围着下一轮融资转,那真正属于用户的问题,谁来解决?

历史已经证明过很多次。

微信不是因为排行榜第一成功,抖音也不是因为参数第一成功。

真正伟大的产品,从来不是赢在排行榜,而是赢在用户每天都会打开它。

所以,如果你问我,Kimi K3是不是国模之光?

我的答案依然是:

当然是。

它让世界第一次真正认真看待中国基础大模型。

但如果你问我,Kimi K3是不是已经赢了?

我的答案还是:

还远远没有。

排行榜第一,只能证明你赢了昨天。

真正决定一家AI公司未来五年的,不是Benchmark,不是融资,不是估值,而是有多少用户愿意每天打开它,把最重要的工作交给它。

AI真正的价值,不是替人考试。

而是替人工作。

文章标签KimiCodexOpenAI月之暗面大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多