Token导航 LogoToken导航TokenDH.com

突发!豆包Seed-2.1-pro 0915 迎来重磅升级,一手实测

更新时间 2026-09-17来源 AI寒武纪正文 5260字阅读约 17分钟11 张图片
图片

字节刚刚把 Doubao-Seed-2.1-pro 升级到了 0915 版本,这次升级主打生产级Agent能力和多模态coding能力强化,本来我以为是一个小版本更新,没想到进化非常夸张。

这次token效率也有了很大提高,跑复杂任务再也不怕余额顶不住了,用起来也划算很多。

废话不多说,直接看我的一手测试

先说背景

这次发布有两个变体:

Doubao-Seed-Evolving,

跟 Seed-2.1-pro-0915 是同一个模型。

一个滚动迭代,一个固定版本号。

你如果不想跟着更新,就用 pro-0915;

你如果希望自动用到最新的模型,就接 Seed-Evolving,不用换接口。

case 1:模拟火星登陆

这个case是我独家测试用例,prompt就一句话,

用HTML和three.js制作一个火星登陆模拟过程,全程要符合物理过程,逼真,发挥你最大的想象力,开始吧

让模型单shot完成测试,虽然prompt很简单,但是模型必须具有强大的Agent能力,多模态理解能力才能完成好测试。这个case我是一路从opus 4.8,fable5,GPT 5.6,GPT-6,glm5.3,kimi k3,deepseek v4 pro测试过来,如果可以完成,证明模型Agent能力和多模态能力达到了我心目中的一流水平。

Seed-2.1-pro-0915测试结果果然没有失望,看来字节没有吹捧,直接看结果:

整个测试用时1小时30分钟,和我之前测试kimi k3用时基本一样,这个测试由于涉及复杂的物理过程,3d建模,以及调用无头浏览器不断测试验证,各家模型都需要花费大量时间。

Seed-2.1-pro-0915在这个case上表现目前我能给到的分数是国产第一,Agent能力,多模态coding,以及前端的审美表现都是第一梯队水准。

需要说明的是这个case是在接入claude code中测试的。

case2:豆包工作+Seed-2.1-pro-0915 + Blender MCP+ seedance2.5

如题,前几天GPT-6 Astra+ Blender刷屏了,我当时也写了文章介绍

我想看看Seed-2.1-pro-0915的能力,就想着来一个轻量级的测试

过程大概是这样:

先用 Seed-2.1-pro + Blender MCP,

生成一个3D白模的预演视频。

白模就是没有材质的几何体,用来做构图参考。

运镜在哪、镜头在哪起,人物动作大概什么幅度,

这些在白模里先定好。

然后把这个白模视频作为参考,

输入给 Seedance,

生成最终的正式视频。

简单来说这个测试链路是: Seed-2.1-pro-0915 + Blender MCP → 3D白模预演 → Seedance 2.5 → 最终视频。

这个测试是在「豆包工作」里完成的

图片

使用也很简单,如果你的电脑还没安装blender,可以先手动安装一下,不想手动安装也可以

直接告诉「豆包工作」1.安装最新的blender,2.安装官方的blender mcp,安装完就可以直接测试了,输入下面的提示词:


你现在是一个科幻动作片分镜导演。请调用 Blender mcp,帮我搭建一段 5 秒(150 帧,30 fps)的人物滑铲拔枪 3D 动作白模预演。注意不要做的太精细

具体要求如下:

1. 角色与场景设定:
   - 创建一个比例协调的铰接式人体白模(带头部、躯干、四肢活动关节),右手持握手枪道具。
   - 场景为一个狭长的未来风格走廊,两侧排列立柱,前方设有一个离地 1 米高的横向障碍闸门。

2. 人物动作流程:
   - 第 0-40 帧:人物快速正面冲刺接近障碍闸门。
   - 第 40-90 帧:在临近闸门瞬间,人物重心后仰,双腿前伸做出贴地滑铲动作,身体几乎贴着地面从 1 米高的闸门下方滑过;滑行过程中,右手抬枪对准前方瞄准。
   - 第 90-150 帧:滑过闸门后,人物借助惯性单脚蹬地转身半蹲停住,双手举枪连续做出后坐力射击动作。

3. 运镜控制设计:
   - 第 0-40 帧:摄像机置于闸门正后方,正对迎面冲过来的人物。
   - 第 40-80 帧(高难度运镜):机位降至贴地 0.15 米,在人物滑铲穿过闸门的瞬间,镜头迎面后退,随后以极近距离贴着人物躯干斜上方拉过。
   - 第 80-150 帧:在人物转身停下的瞬间,镜头围绕人物展开一个完整的 360 度升降环绕拍摄,景深锁定在枪口与人物头部。

它调用了 Blender MCP,在 Blender 完成了建模,搭完了整段预演。

建模:

图片

最后把上面的白模视频和人物参考图丢给豆包工作,

图片

让它直接调用seedance 完成视频生成,这是成品:

这个测试,我只选了5秒,因为我的预期是一次成功,虽然有第一个case打底,但是相比GPT-6 Astra 我对Seed-2.1-pro-0915的Agent能力和多模态能力内心多少还是有所保留的。

没想到测试过程非常丝滑,没有遇到任何卡顿,调用blender能力3d建模我是没看出和GPT-6 Astra 差哪里了

不知道字节做了什么训练,Seed-2.1-pro-0915这Agent能力和多模态coding能力进化太厉害了,必须给点个赞。

case 3:深度测试

有了前两个case,我对Seed-2.1-pro-0915能力信心大增,这次我准备整个深度测试,强度和难度都拉满

多Agent+卫星影像视觉核验:详细调研国外数据中心建设是否有泡沫,主要涉及OpenAI、Anthropic、谷歌、微软、Meta、亚马逊六家公司

1.资本开支与现金流核验
2.具体项目物理建设卫星图核验
3.综合判断,交叉验证
4.html报告输出

直接把下面的提示词丢给Seed-2.1-pro-0915

你现在是一位资深的科技行业股权研究分析师,正在为机构投资者撰写一份关于"国外大型AI数据中心算力建设是否存在泡沫"的独立尽调报告。请完成以下工作:

一、资本开支与现金流核验

针对 OpenAI、Anthropic、谷歌、微软、Meta、亚马逊六家公司,检索并核实以下信息。每一项数据请标注来源和发布时间,并对数据可信度做出说明。无法核实的信息请明确标注"未核实",不要编造。

1. 最近两个季度公开披露的资本开支实际值,以及管理层给出的下一财年资本开支指引
2. 同期的经营现金流和自由现金流。谷歌、微软、Meta、亚马逊有独立财报可查;OpenAI、Anthropic为非上市公司,请检索其披露的融资规模、估值和公开报道中的现金流状况,并明确标注这部分数据的不确定性更高
3. 涉及的债务融资安排,比如是否发债、发债规模、利率、期限
4. 是否存在循环投资或循环采购结构,比如英伟达对OpenAI的投资、OpenAI与Oracle及CoreWeave之间的云服务采购协议、微软对OpenAI的投资与Azure使用协议之间的关系。如果存在,请梳理这些公司之间的资金流向和合同关系

二、具体项目的物理建设核验

请重点核实以下两个项目:
1. 亚马逊为Anthropic在印第安纳州建设的Project Rainier数据中心集群
2. OpenAI、Oracle、SoftBank联合推进的Stargate项目,德州Abilene站点

请先尝试:如果你的工具集里可以访问卫星地图或地理影像相关的API或服务,请自主调用,获取这两个项目所在坐标的历史影像和最新影像,做时序对比,直接分析影像里的建筑物数量变化、施工进度、电力设施接入迹象。

如果你没有这类工具的访问权限,或者调用失败,请如实说明你无法直接获取卫星影像,不要假装自己看到了图像或编造画面细节。这种情况下,请转而检索权威新闻媒体(如The Information、Bloomberg、纽约时报、华尔街日报、路透社,或卫星影像分析机构如Planet Labs)已发布的、包含卫星影像报道的文章,基于报道中的文字转述和引用的影像描述进行分析,并明确标注这部分结论是基于文字转述,不是你直接的视觉核验。

无论通过哪种方式,请核实:
1. 影像或报道的时间跨度、拍摄机构或转载来源
2. 该项目当前的实际建设进度,与公司官方宣称的时间表和最终规模是否存在差距
3. 如果不同信源的进度描述存在矛盾,指出矛盾并说明你倾向于哪个信源,以及为什么

三、综合判断

基于以上财务数据和物理建设进度的交叉验证:
1. 资本开支增速与现金流增速之间的缺口有多大,这个缺口是被什么方式弥补的
2. 物理建设进度是否支撑得起这个资本开支规模,还是存在账面投资与实际建设脱节的迹象
3. 明确说明这是基于当前公开信息的一个风险分析框架,不是对"泡沫是否存在"的最终结论,并列出你认为最需要持续跟踪的三个信号

四、输出要求

把以上内容整合为一份图文并茂的HTML网页,要求:
1. 六家公司的资本开支与自由现金流对比图表
2. 循环投资结构关系图
3. Project Rainier 和 Stargate 的卫星影像或影像分析区域,图片位置先留空,标注清楚每张对应的时间和来源,如果二里是通过转述完成的分析,在这里注明"基于媒体报道转述"
4. 关键事件时间线
5. 结尾附完整数据来源清单,每条结论标注对应的可信度

整个报告的基调是严谨、克制、证据优先,不要用夸张的措辞去暗示某个立场。

这个case晚上睡觉前我丢上去测试的。

图片

全程auto mode,我没有管它。

第二天早上起来,它还在跑。

我等到中午,一共接近10个小时,报告出来了。

打开html的那一瞬间,我直接震惊了,

太tm专业,太详细了

直接看交付结果:

因为整个调研过程非常复杂,这里我只挑它利用多模态Agent能力进行卫星图核验的过程

调研刚开始,它先说了一句话

我没有商业卫星影像API的授权。

然后它自己去找了一条替代的路。

它试了NASA一个免费的公开影像接口,先测了一个分辨率375米的图层,发现看不清单栋楼,太粗。又测了一个30米分辨率的图层,能看清大型建筑的轮廓,但只有卫星路过当天才有数据。为了掐准哪天有数据,它又去接了一个专门查卫星过境日期的接口。

三个工具接完,它自己拼出了一条能用的影像获取流水线。

它说,30米是免费公开影像能做到的上限,看不清工地上的车辆和设备,后面所有结论都会按这个上限打折扣。

它自己判断需要什么工具,自己去找,找不到最好的就退而求其次,然后老实告诉我退到了哪一步。

工具搭好后,它同时派出5个子Agent去查六家公司的财务数据,自己拉了德州Abilene那个项目从2024年10月到2026年8月的7张真实卫星图,一张一张看。

2024年10月,地上是灌木牧场,几个小白块。

图片

2025年4月,整块地推平了,还没有建筑。

图片

2025年10月,变成11到12个大型结构,跟当时官方宣称"部分设施已经在跑负载"的时间点对上了。

图片

2026年8月,变成14到15个结构,主体建筑数量没有再翻倍。

图片

它还顺手纠正了一个可能的乌龙。

分析开始的时候它自己提出疑问,这块地到底是不是Stargate的场地,会不会跟别的项目搞混了。它去查了地图数据库里这块地的登记名称,确认清楚之后写下一句,网上有种说法是另一家公司在这里有一个更早就存在的老园区,但没有任何信源支持这个说法,判定不成立。

2026年3月,一家媒体报道这个项目的扩建计划被取消,涉事公司当天发声明否认,两边说法对不上。

它没有各打五十大板,也没有直接选边站。

它把两边的原话按时间摆出来,指出那份否认声明的措辞只覆盖了已有产能和已通电的部分,没有正面回应新增的部分是否被取消。

三周后,另一家公司官宣接手了这块被取消的容量。

最初那篇报道被印证了。

整个交付调研持续十个小时,我没点开进度条一次。

它自己判断该用什么工具,自己判断证据够不够,自己在信息不足的地方拒绝下结论。

让我印象最深的是Seed-2.1-pro-0915给出整个报告交付性质:

这是基于当前公开信息的一个风险分析框架,不是对"泡沫是否存在"的最终结论。报告刻意区分三类事实:已交割的现金、已签约但分期/附条件的义务、以及意向性框架。不提供证券买卖建议,不做目标价,不用夸张措辞暗示立场。所有判断均可被新的披露证伪——文末列出了最可能证伪本框架的三个跟踪信号。

图片

这个case的成本挺高的,花了我256rmb。

但是相比报告来说,如果让几个专业人员合作调研我觉得没有一周搞不定。

这样一看就很便宜了。


豆包工作里可以直接用

模型在豆包工作里也同步了。

进 App,选"豆包 2.1 Pro(0915新版)",就是这个版本。
TRAE 也接了。

图片

写在最后

这两年我见证了太多模型的发布,也测试过太多的模型了

一开始,每次大模型发布都是一件大事,

新能力、新测试、新记录,很热闹。

现在这种升级节奏,变得更像软件更新:

能力在持续变强,但没有什么戏剧性的时刻,

就是某一天你去测,发现它比上次好了不少。

Seed-2.1-pro 这次的升级属于后者。

它不是那种让你"震惊"的发布,

但可以让你把它留在工作流里。

对我来说,这种才是有用的。

还没用过的,可以去试试看。

API 接入地址:火山方舟。

模型名:doubao-seed-evolving / Seed-2.1-pro-0915

--end--

最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论

/...@作者:你说的完全正确(YAR师)

文章标签豆包字节跳动产品更新智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多