智猩猩AI整理
从 Hy2,到 Hy3 preview,再到 Hy3,半年不到,又完成了一次大跃迁。
本次迭代不只是推理能力、智能体能力的大幅跃升,在幻觉抑制、模型稳定性与产品使用体验上同样完成质的突破。
后续还有更多重磅更新在路上,由衷为团队感到自豪!
这不是一次普通的模型官宣,放在时间线上看,Hy3 更像是姚顺雨加入腾讯后,在 2026 年中交出的一份阶段性答卷。

- 来源:
https://x.com/ShunyuYao12/status/2074151389945827744
2025 年底,腾讯宣布姚顺雨出任首席 AI 科学家,同时兼任 AI Infra 部和大语言模型部负责人,直接进入腾讯 AI 研发体系的核心位置。
彼时外界最关心的问题是:这位 ReAct、Tree of Thoughts 等智能体经典工作的作者,能不能把自己关于 Agent、评估、真实任务的研究思路,真正放进腾讯这样一个超级产品生态里。
半年过去,答案开始变得清晰。
Hy3 正式版发布,模型采用 MoE 架构,总参数 295B、激活参数 21B,支持 256K 上下文长度;更关键的是,它不是单纯卷参数,而是把 Agent、工具调用、代码工程、办公生产力、真实业务链路作为主战场。
目前,Hy3 已接入 WorkBuddy/CodeBuddy、元宝、ima、Marvis 等业务,API 也已上线腾讯云 TokenHub。
01
年中答卷:从接掌混元,
到跑通“模型—评测—产品”闭环
如果只看公开节点,姚顺雨加入腾讯后的节奏相当密集。
2025 年底,腾讯升级大模型研发架构,新成立 AI Infra 部、AI 数据部、数据计算平台部,姚顺雨出任首席 AI 科学家,同时兼任 AI Infra 部和大语言模型部负责人。
到了 2026 年 3 月,腾讯 AI 研发体系继续调整,成立近十年的腾讯 AI Lab 被撤销,部分人员调整至大语言模型部,加入混元团队并向姚顺雨汇报。
这意味着,腾讯的 AI 研究资源开始进一步向大模型主线集中。
4 月 23 日,Hy3 preview 发布并开源。这是混元重建后的第一个版本,也被视作姚顺雨接掌混元后的首个模型成果,其性能已在复杂推理、指令遵循、上下文学习、代码生成和 Agent 任务上显著提升。
7 月 6 日,Hy3 正式版发布。从 1 月底启动基础设施重建,到 4 月 preview,再到 7 月正式版,混元用不到半年时间,跑完了一轮“底层重构—模型发布—产品验证—后训练迭代”的完整闭环。
这条线,与姚顺雨此前在《The Second Half》里的判断高度一致。
他曾提出,AI 下半场的重点会从“解决问题”转向“定义问题”,评估将比训练更重要,研究者需要更像产品经理一样思考:AI 应该做什么,怎样才算真正进步。

来源:
https://ysymyth.github.io/The-Second-Half/
Hy3 的发布,某种程度上就是这套思路在腾讯内部的一次落地。
它不是只看 MMLU、数学题、聊天体验,而是把 WorkBuddy、元宝、ima、Marvis 这些真实产品场景拉进模型迭代流程。模型在线上任务里暴露问题,再用这些问题反哺训练与评估,最后再回到产品里验证。
这也是 Hy3 最值得关注的地方:它不是一个孤立模型,而是腾讯产品生态里的一个 Agent 底座。
02
Hy3 能力表现:Agent 是主线,
生产力任务是验证场
Hy3系列的最大亮点在于Agent能力的显著跃升,这也是姚顺雨Agent研究背景的直接印记。相比前代,Hy3在后训练数据质量、多样性和RL规模上持续迭代,在推理、智能体、长上下文等任务上显著进步,取得了比肩国内外更大尺寸旗舰模型(参数规模往往是 Hy3 的 2~5 倍)的效果。

从应用侧来看,Hy3 这次提升最明显的地方,不是单一问答能力,而是更偏真实生产流程的复杂任务。无论是软件开发、办公文档处理,还是金融模型搭建、前端页面生成、游戏内容制作,Hy3 都开始展现出更强的任务理解、步骤拆解和结果交付能力。
腾讯内部还组织了 270 位来自不同业务线的专家,围绕真实工作场景进行模型盲测。结果显示,Hy3 的综合均分达到 2.67 / 4,高于 GLM5.1 的 2.51 / 4。尤其在前端开发、数据与存储、CI/CD 等更贴近工程实践的任务类型中,Hy3 的优势更加明显。
与此同时,Hy3 也延续了开源路线。目前,该模型已基于 Apache 2.0 协议,在 GitHub、HuggingFace、ModelScope、AtomGit 等平台开放。
腾讯还同步下调了 Hy3 在腾讯云 API 以及 WorkBuddy 等产品中的使用成本,希望让混元模型进入更多开发者和企业场景。按照最新定价,Hy3 输入价格为 1 元 / 百万 Tokens,输出价格为 4 元 / 百万 Tokens,命中缓存后的输入价格则降至 0.25 元 / 百万 Tokens。
03
腾讯生态接入:WorkBuddy、元宝等产品
的真实场景验证
Hy3 真正有意思的地方,不只在模型本身,而在腾讯生态。
腾讯拥有国内最复杂、最多元的产品矩阵之一。办公、社交、内容、浏览器、游戏、输入法、知识库、企业服务,每一个场景都能产生真实任务、真实反馈和真实评测。
这对 Agent 模型非常关键。因为 Agent 不是在静态题库里长出来的,而是在复杂任务里练出来的。
这次 Hy3 已接入 WorkBuddy/CodeBuddy、元宝、ima、Marvis、QQ 浏览器、微信读书、WeGame 、腾讯文档、微信公众号等产品。
其中,WorkBuddy 是最值得单独拎出来看的样板。
作为 AI 办公智能体,WorkBuddy 不是简单聊天场景,而是包含自动化脚本生成、工作流编排、数据处理、文档生成、研报分析等复杂需求。
在办公场景内部测评中,Hy3 让 WorkBuddy 任务解决率从 72% 提升至 90%,平均耗时缩短 34%。

元宝则是另一条线。
元宝的优势在于用户量和真实对话反馈。Hy3 针对长文和 AI 搜索场景中的幻觉问题,通过细粒度数据清洗与训练约束提升可靠性。基于真实日志的评测显示,Hy3 的常识错误率较 preview 下降,幻觉率也大幅降低。
元宝 Agent 升级后,可以执行信息查询、数据处理、文档办公、生活决策、网页制作等任务,并交付 PPT、Word、Excel、PDF、HTML 等文件。

ima 和 Marvis 则进一步验证了 Hy3 在知识库问答、工具编排、文件生成、文件管理、电脑诊断等场景中的稳定性。
ima 在 Agent 任务中,工具编排能力突出,盲目重试和应止未止明显减少。

Marvis Agent 在文件编辑/生成、文件管理、电脑诊断与操作等核心场景中,任务完成率达到 93.7%,相比 preview 提升 12.7%。

WorkBuddy 负责办公生产力,元宝负责大众用户入口,ima 负责知识库和信息管理,Marvis 负责桌面级 Agent,CodeBuddy 负责代码开发场景。
这几条线合在一起,构成了腾讯版 Agent 生态的雏形。
04
腾讯AI下半场新打法
过去外界评价腾讯 AI,常常会说它产品生态强、应用入口多,但基础模型声量相比更激进的模型公司并不算突出。
姚顺雨加入后,腾讯混元的打法开始发生变化,不再单纯跟随参数竞赛,而是把模型训练、Agent benchmark、真实业务评测和产品反馈放到同一个闭环里。
从办公智能体WorkBuddy,到开发工具CodeBuddy,再到元宝、ima、Marvis 等 C 端入口与工具型产品,Hy3 正在用腾讯生态中的多场景落地证明:大模型的下半场,不只是模型公司之间比谁更聪明,而是谁能让模型更稳定地进入真实工作流、完成复杂任务。
Hy3 这份年中答卷,还不能说已经让腾讯在所有模型能力上全面领先。纯数学推理、深水区代码任务、和最强闭源模型的差距依然存在。
但它至少给出了一个清晰信号:
腾讯混元不再只是追赶大模型,而是在用自己的产品生态训练 Agent。
如果说 Hy3 preview 是姚顺雨带队重构混元后的第一次亮相,那么 Hy3 正式版更像是一次宣告:
腾讯要做的不是一个更会聊天的模型,而是一个能嵌入微信、办公、内容、代码和桌面场景的 Agent 操作系统底座。







