21世纪经济报道记者 岑栩
2026年9月16日,火山引擎方面宣布,Doubao-Seed-2.1-Pro(0915新版)完成小版本更新,模型API已在火山方舟全量上线。本次豆包App也同步升级,用户下载或升级至最新版,在应用内选取“豆包2.1 Pro(0915新版)”即可调用;编程产品TRAE也已同步接入。
(图为豆包2.1 Pro新版本接入方式 图片来源:火山引擎)
此外,据21世纪经济报道记者了解,今年6月推出、面向Coding与Agent场景的Doubao-Seed-Evolving也更新至同一版本。按照火山引擎方面的说明,企业和开发者无需更换API接入节点,即可用上最新模型。
本次更新,主要围绕企业生产级需求展开,火山引擎给出的四个方向是:Agent专业任务交付、多模态Coding、多模态理解与Token(词元)效率。
据火山引擎方面介绍,本次更新的模型在图像推理和视频推理上的Token消耗比上一代减少30%以上,推理轮次与工具调用次数同步下降。
其中,多模态编程被放在首位:豆包2.1 Pro模型可以直接读懂设计稿、图纸和操作录屏,把视觉信息转换成前端代码与游戏的逻辑,在“看图写代码”场景中达到国内领先水平。据悉,该版本距离2.1 Pro于今年6月23日在火山引擎FORCE原动力大会上的首次正式发布,间隔三个月左右的时间。
从市场需求来看,真实的编程工作,并不只是纯文本的生成。前端开发、图形界面设计、交互设计、游戏与3D建模等,都涉及大量的图像理解、视觉还原和空间逻辑。
公开资料显示,豆包2.1系列模型在视觉理解、Computer Use、Mobile Use等公开测试集上达到全球第一梯队;Seedance、Seedream、Seed Audio在视频、图像、音频创作领域具备领先优势。这些能力,正被引入编程与Agent场景,用于处理传统文本模型难以覆盖的任务。
在这一变化的背后,是编程输入方式的迭代和迁移:过去,是人学习机器的语言,写代码、PRD和接口文档;现在则增加了让机器看懂人的表达方式的环节——读手绘草图、读操作录屏、读屏幕演示。实际上,真实工程中的知识,有相当一部分不在文档里,而在设计图、界面、录屏和操作习惯中。而纯文本代码模型在这条路径上有着天然的不足,多模态模型试图补齐的,正是这条“腿”。
多模态编程:把设计图、录屏和老系统读成代码
21世纪经济报道记者还注意到,围绕多模态编程,豆包2.1 Pro的最新版强化了前端开发和设计还原能力,借助VLM能力,3D相关建模能力和游戏场景效果明显提升。
尤其是,豆包2.1 Pro模型更懂复杂代码仓库,能够快速理解项目结构、模块关系和上下文,在大型代码仓库中找到对应修改位置;面对长程、跨文件问题,定位根因和完成修复的能力增强;端到端开发能力覆盖从理解需求、修改代码到运行命令验证测试的全过程;在保持编程能力的同时,任务耗时和使用成本进一步降低。
例如,在开源游戏Luanti的仓库修复任务中,豆包2.1 Pro模型面对约38.7万行代码与1000个真实历史Issue,执行期间将补丁提前隔离,调度多个子Agent连续运行近36小时,完成根因定位与跨文件修复,最终83%的任务达到可合并标准。
公开代码统计显示,Luanti现有378373行代码、18726次提交,来自1441名贡献者,最早一次提交在2010年11月。该项目原名Minetest,2024年10月更名为Luanti,主要以C++编写,另有部分Lua代码。OpenHub统计还显示,该项目在2025年3月至2026年3月的12个月内有1254次提交、209名贡献者,按COCOMO模型估算的累计工作量约合100人年。
在ERP(Enterprise Resource Planning,企业资源计划)的有关案例中,豆包2.1 Pro模型拿到的只有一段操作录屏和几张草图。这套系统属于缺文档的老系统,模型需要在读懂28万行Java代码的基础上,沿用现有链路,开发移动端页面并跑通完整流程。也就是说,设计稿能够被直接还原为可运行的代码,而不是仅仅停留在界面截图或者代码片段的层面。
在火山引擎展示的3D场景案例中,豆包2.1 Pro先依据4张设计图还原庭院的基础结构,随后叠加水体、植被与镜头效果,再构建风霜雨雪四季状态,输出可通过代码演示、可控制镜头变化的动态3D场景。
而支撑这类任务运行的,是VLM一侧的同步更新:豆包2.1 Pro更新版可识别CAD工件、游戏引擎3D元素及AR空间,对工程图纸的尺寸标注与公差符号、PDF中图注、脚注与表头的层级关系,以及财报、研报的表格提取与跨页脚注引用的处理精度均有提升。
在视频推理一侧,豆包2.1 Pro能在视频中定位证据、跨帧整合后作答,也能对照作业规范辨认操作;可一次性处理逾两小时的长视频,完成解说稿生成、片段定位、音频合成与字幕输出,视频标注与内容质检等场景同样受益。
在更复杂的工程任务中,火山引擎方面称豆包2.1 Pro模型对复杂代码仓库的理解速度加快,能在跨文件、长程问题中理清项目结构与模块关系并定位根因。
这些案例能够表明,多模态编程不只是“看图”,而是把视觉信息接入工程链路,形成可运行、可验证的交付物。
Agent、VLM与成本账:生产级交付的另一半
在通用Agent方向,豆包2.1 Pro更新版强调VLM与多Agent能力结合,提升信息检索准确率并减少幻觉。据官方介绍,在金融投研场景下,模型的研究方法和交付报告质量达到职业级;通用搜索调研更可信,证据链驱动可靠产出,Agent幻觉大幅改善;同时支持跨应用协同,让Agent能适应复杂环境工作,并稳健推进复杂长程任务。
值得一提的是,本次豆包2.1 Pro更新版还强化了证据溯源、权威信源检索、时效判断和数据核验能力。也就是说,模型更忠于工具调用事实,在金融投研、办公自动化这类需要多轮调用工具、联网调研并产出长报告的任务中,结论都能够有据可查。
官方给出的另一个核验案例是:豆包2.1 Pro模型需要核实某车企财报中关于“巴西超级工厂15个月建成投产”的说法,随后自主调度500多个子Agent检索1000多个网页,结合海事AIS滚装船的航迹、当地岗位变化与卫星时序影像交叉比对,形成对数十页英文财报的尽调报告。
在上述案例中,该任务由一套企业尽调框架驱动,框架把每条结论限定为“supported”“contradicted”“mixed”“insufficient_evidence”四种状态,要求结论只能引用已登记的证据,公关稿件不能单独作为确认依据。由此,每一环结论都可回溯到具体证据。
在VLM方向,豆包2.1 Pro更新版对3D物体的识别与理解能力也明显提升,密集图文的文档解析能力更强,专业符号系统理解能力与图文混排文档的信息抽取能力显著增强。相比上一代Pro模型,图像与视频推理能力全面提升。这些能力与Agent结合后,可用于文档解析、跨应用操作等场景,也为多模态编程提供了底层视觉理解支撑。
市场层面,高盛此前预测,到2030年,中国AI大模型的Token调用量将实现25倍增长。公开报道还提到,国产开源模型近期的迭代,已对海外厂商定价形成压力,机构判断高端前沿模型仍保有一定的定价权。







