Token导航 LogoToken导航TokenDH.com

DeepSeek V4.1 Flash来了,性能堪比pro,终于不把梁文锋认成别人了

更新时间 2026-09-16来源 蔚公子说AI正文 4758字阅读约 15分钟12 张图片

你好,我是蔚公子,ALL in AI,

专注于 AI 提效/企业赋能/教育

点击👇关注我,

分享真正能落地的AI方案,让企业和个人把AI用好


上周我写过一篇,说 DeepSeek 悄悄放了个 V4.1 Flash 出来内测。
当时最让我在意的不是模型本身,是官方在内测问卷里问的那句话。

你觉得这个模型能全面替换线上的 DeepSeek V4 Pro 么?

我当时写了一句,DeepSeek 这次想测的可能不只是一个更快的 Flash,而是想看看 Flash 能不能顶到 Pro 的位置上去。

9 月 10 号答案来了,而且比我想的还要直接。

V4.1 Flash 正式发布,官方当场宣布 V4 Pro 有序下线,连切流量的时间都定死了,9 月 14 号 12 点。

图片

我本来以为这事就这么定了。

结果只过了一天,官方又改主意了🤔

9 月 11 日,DeepSeek 又宣布:9 月 14 日之后 V4 Pro 不下线了,API 继续提供,计费方式保持不变。

这个后面我单独说,先按顺序把这次发布捋一遍。

废话不多说,咱们一个个看👇

图片

一、新模型是个什么东西

这次更新的是一个552B 参数的 MoE 模型,用的是全新的 Causal-Encoder-Decoder 结构。输入和输出不对称,输入激活 8B,输出激活 16B。


而且这次具备原生多模态视觉理解能力。

图片
图片
官方原话是,在基准测试中成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。

不过对着完整成绩表看,GPQA Diamond 这一项 V4.1 Flash 是 90.9,V4 Pro 是 92.4,依然高于4.1 Flash。

二、缓存和价格


跟上一代比,KV Cache 对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8,相对初代已经缩小了 437 倍。

这里说的是缓存,不是整个模型的部署显存。

图片

在 Agent 使用场景中,缓存命中的费用往往占比较高,所以这块压下去,Agent 类任务的成本也就跟着下来了。

价格 9 月 10 号 12 点生效,继续峰谷定价,闲时是高峰的一半。

闲时缓存命中是 0.003 美元每百万 token,折人民币大概两分钱。

图片

三、说好要下线的 Pro 最后留下来了

10 号那天的公告计划有序下线 V4 Pro 模型。

但今天我去翻 API 价格页,V4 Pro 还在。

图片

上面写着:

应用户需求,决定在 2026 年 9 月 14 日之后继续提供 DeepSeek V4 Pro API 服务,计费方式保持不变。

估摸着,这块应该是网友发力了🤔

四、全面实测


上面这些全是官方口径,听着都挺好。

但官方说得再好也是官方的,还是得自己上手跑一跑。

这次我准备了几个 Case,一路从最简单的测到最费劲的。

1. 先看看它这双眼睛,到底好使了没有


第一个必须测视觉,因为这是这次的核心卖点。

不过在测之前我得先说说以前。DeepSeek 刚开始能看图那阵子,说实话是有点近视的。

最出名的就是把梁文锋认成别人,有认成KIMI创始人杨植麟的,还有认成雷军的,当时网上传得挺欢😅

图片

那这次原生多模态来了,咱们就再考一次。

我直接上传了一张梁文锋的照片,提示词只有三个字。

图片

提示词:

他是谁

图片

这回它认出来了。

不光认出来了,还顺手把人物背景和职业经历一并铺开讲了,连出生年份和求学经历都给了。

诶,这就对了嘛。

但只认出人,还不够,我想再来个抽象点的。

最近不是动画电影《牛来》特别火吗,就是那个建模粗糙到离谱、结果反而成了黑马的。那玩意儿的表情包这两天满网飞。

图片

我把牛来的标志性截图丢了进去,提示词同样只有一句。

提示词:

这是什么角色

图片

结果它也认出来了,而且比我想的快。

电影名字、上映时间、导演编剧,还有它为什么会火,连那段拖长声调喊妈的经典片段都给我说明白了👌

两道题当然说明不了全部,但跟它刚上线识图那阵子比,已经明显不是一回事了。

2. 给它一张复杂网页的截图,让它自己复刻


看得懂是一回事,能不能拿眼睛干活是另一回事。

所以第二个我把难度往上抬了一大档。我找了个国外的后台网页,里面图表特别多,还带着一个世界地图模块,然后只给它一张截图,别的什么都不说。

提示词:

我会给你一张复杂网页的参考截图。请只根据这张截图,从零开发一个高度还原、可以实际运行和交互的网页。

**不要向我询问设计稿、尺寸、字体、色值、组件参数或技术栈。**截图里能够判断的信息,全部由你自己识别和决定。

请尽可能准确还原整体页面结构和布局、各区域的尺寸比例和空间关系、字体大小粗细和信息层级、颜色背景边框圆角阴影、图片图标卡片按钮导航等视觉元素、元素之间的对齐间距和留白,以及截图中能够合理推断出的交互功能。

不要只做一张看起来相似的静态页面。导航、Tab、按钮、菜单、切换等明显具有交互属性的组件,都请实现合理的实际交互。

最重要的是:完成第一版以后不要直接结束任务。请实际启动网页,在浏览器中打开你做出的页面并截图,然后重新查看我最初提供的参考图,把你的截图和原图进行视觉对比。

重点检查:整体布局和比例是否一致;主要元素的位置尺寸有没有明显偏差;字体层级间距和对齐是否准确;颜色圆角边框阴影是否接近;有没有遗漏原图中的元素;页面是否存在溢出错位遮挡等明显 Bug;交互是否能够正常工作。

如果存在明显差异,直接修改代码,然后重新运行、重新截图、重新比较。自己重复这个过程,不要中途询问我是否继续,也不要第一版能运行就停止,直到你认为成品已经达到可以正式交付的程度。

最终请交付完整可运行的网页项目和最终页面,并简单告诉我一共进行了几轮视觉检查,每一轮分别发现了哪些主要问题、做了哪些修改。如果还有与参考图明显不一致但暂时没有解决的地方,也请主动指出。

这个跑得是真久,体感接近两个小时🥲

但出来的东西我是满意的。

乍一眼看过去,基本跟原图差不多。

侧边栏、顶栏、上面那排数据卡片、中间的折线图、下面的渠道排行和设备占比,位置和比例都对得上,交互也是真能点的。

唯一拉胯的是那个地图。原图里那块世界地图,它复刻出来有点失真,一眼能看出跟原版不是一个东西。

除了这块,整体我觉得是 OK 的。

3. 让它做一个能玩的多米诺骨牌


前面两个测的都是眼睛,第三个我换个方向,看看它做交互的手感。

我要的是一个真能点、能触发连锁反应的多米诺骨牌网页,不是摆几块方块给你看的样子货。

提示词:

请你从零开发一个多米诺骨牌互动网页作品。要求它不是静态展示,而是一个真正可以操作、可以触发连锁反应的前端交互项目。

页面中要有一组经过合理排布的多米诺骨牌,整体视觉上要完整、美观,不能只是随便摆几块矩形。用户点击任意一块骨牌后,要能够触发自然的连锁倒塌反应。倒塌动画要尽量流畅、具有明显的连续传播效果,而不是简单的统一消失或机械切换。

页面需要有完整的视觉设计,包括背景、留白、层次、配色和整体氛围。如果合适,可以加入重新开始、随机布局、切换场景、调整骨牌数量等交互功能,但不要为了堆功能破坏整体完成度。

请优先保证可玩性和连锁反应效果,不要做成只有视觉没有交互的样子货。

完成第一版之后不要直接结束。请你自己实际运行网页,在浏览器中打开并亲自测试:点击不同位置的骨牌;检查连锁反应是否稳定;检查是否存在骨牌不倒、传播中断、动画卡顿、布局穿帮、遮挡错位等问题;检查页面在视觉上是否完整。

如果发现明显问题,请直接继续修改代码,再运行、再测试、再修复。请自行重复这个过程,不要中途询问我是否继续,直到你认为它已经达到可以正式展示的程度。

最终请交付完整可运行的网页项目和最终页面效果,并告诉我你一共做了几轮自测,每一轮主要发现了什么问题又如何修正。如果还有没有完全解决的问题,也请主动说明。

这个做得相当可以,而且比我想的要干净。

画面上没堆什么花里胡哨的东西,骨牌的形状还做了好几种,看着挺舒服的。

最让我满意的是交互。

你点哪一块都行,点下去后面整排就跟着倒,而且我想从哪儿起头都可以。这个灵活度是真不错,动画也很丝滑,一点不卡。

它还自己加了几个我没明说的东西,骨牌数量能调,倒塌速度也能调。

甚至连倒下去的音效都有👌

整体我是比较满意的。

4. 让它研究一下它自己


最后这个我觉得最有意思。

我让 V4.1 Flash 自己去研究 V4.1 Flash。

不给任何资料,让它自己上网搜、自己读官方公告和技术报告、自己核验,最后回答一个问题:它是不是真像官方说的那样已经能取代 V4 Pro。

而且我特意在提示词里挖了坑,让它专门去查有没有人把缓存显存写成整个模型显存、有没有人把几项第一写成所有第一。

部分提示词:

现在请你完成一次完整的深度研究任务。研究主题:DeepSeek V4.1 Flash 这次到底更新了什么,它是否真的像官方所说的那样已经能够取代 V4 Pro?

我不会给你资料,也不要依赖我提供的任何结论。请你自己从公开网络中搜索、阅读、核验和整理。这不是一篇普通的新闻摘要,我希望你像一个独立的 AI 行业研究员一样完成整个任务。

先建立一手资料库,优先寻找并阅读官方发布公告、技术报告、Hugging Face 模型页、API 定价信息和 Harness 相关文档。在读完主要一手资料之前,不要直接根据媒体文章下最终结论。

然后专门核查全面超过 V4 Pro 这个说法。不要直接接受这句话,也不要为了反驳而反驳,请把官方公布的 Benchmark 和公开证据逐项检查:哪些指标明显超过,哪些接近,哪些 V4 Pro 仍然更高。

在研究过程中特别留意不同来源有没有出现参数数字不一致、价格不一致、把 KV Cache 显存误写成整个模型显存、把某几个 Benchmark 第一写成所有 Benchmark 第一。如果发现冲突,请追溯原始来源,不要自行猜一个答案。

最终交付一份完整研究报告,包括一句话结论、核心更新地图、对比表、事实核查、第三方实测总结、容易被媒体误读的五个点、最终判断和完整来源表。最终判断要分成三类:已经有充分证据确认的、目前证据倾向如此但仍需更多实测的、暂时不能确认的。

这个是真把我小小的惊到了,因为太快了。

我本来做好了等半天的准备,结果三分多钟就交卷了。

而且东西是真不少。它自己出了分析,还给了个完整的文档,我光录屏往下滚就录了一分多钟。

内容也比我想的详尽,来源都留着,中间还专门做了 V4.1 Flash 和 V4 Pro 的逐项对比。

一个模型,自己去查自己,还查得挺认真🧐

五、蔚公子的洞察


几个 Case 跑完,我说说自己的感受。

第一,更新速度是真的越来越快了。

这个是我最大的感受。

你看看这才多久。前脚 Vision Exp 刚开源,我写了一篇。然后 V4.1 Flash 内测,我又写了一篇。

现在正式版直接来了,差点顺手把 Pro 给安排下线了。

这三件事加起来,也就是一个多星期。

以前一个大版本能撑半年,现在一个星期能出三个动静。

而且你看 Pro 这事,前一天还说要下线,第二天又决定留下来。变化快到连官方自己的计划都能一天一变🧐

第二,能力也在慢慢补齐。

多模态这块就是最明显的例子。以前是看不见,后来是看得见但有点近视,到今天原生多模态,眼睛这一关基本算过了。

而且最近 DeepSeek 那边的动静也不小,看得出来是想往更大更好的方向走的。

第三,跟国外比确实还有差距,但也别妄自菲薄。

这个我得说句公道话。你真要拿它跟最顶那几个比,该差的地方还是差。

但你也得看看这个追赶的速度。而且价格摆在那儿,闲时缓存命中一百万 token 两分钱,这个成本优势不是靠嘴吹出来的。

所以,我觉得该给的信心还是要给。

第四,也是我最想说的,一定要多上手。

前两天有个圈友跟我说了一句话,他说现在是真的变得太快了。

没错,就是太快了。

所以我觉得这时候最要紧的反而不是去背哪个工具怎么用。因为工具可能一个月一换,你背了也白背。

真正要抓的是核心的思想和逻辑,同时死死盯住最前沿的变化。

为什么要盯前沿?因为变化太快了,今天落后的那家,可能过两个月就反超了。

所以真正要紧的,可能不是记住谁现在是第一,而是让自己一直待在牌桌边上👌

今天分享就是这些~

也欢迎大家在评论区留下自己的思考,同时如果能点个赞和转发,就是对我最大的鼓励。

文章标签DeepSeek应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多