过去两年,具身大模型快速迭代,行业大量工作集中在解决机器人 “会不会做任务” 的问题。但当机器人走出实验室 Demo 环境,进入家庭、商业的真实复杂场景,行业的核心矛盾已经切换为能不能稳定把任务做好。
现实环境噪声、物体状态变化、环境扰动,都会造成模型仿真效果与真机执行效果出现偏差。如何让机器人依据真实执行反馈持续修正行为策略,强化学习再次成为具身智能赛道的核心突破口。
9 月 2 日,星尘智能官宣人才引入消息:前字节跳动强化学习专家、前腾讯 Robotics X 智能体中心负责人孙鹏博士正式入职,重点负责机器人强化学习方向技术研发与应用落地。其中第三届中国具身智能与人形机器人创新峰会的时间为2026年12月22-23日,部分会议主题:诠释全球产业格局趋势,解析国家顶层政策与十五五规划,未来3年具身人形机器人产业红利导向,全产业链统一标准、接口互通、合规量产规范化,国产具身智能与人形机器人万台规模化量产元年路径,核心零部件与关节模组,具身智能大小脑协同与算法,灵巧手、整机研发与工艺升级,特种机器人与服务机器人场景规模化应用,大会组委会:赵靖 一八一零一六二三一六九。他的到来,将和企业自研 AI 基座模型、具身操作系统、绳驱机器人本体形成技术协同,推动实体机器人实现与环境交互过程中持续自我迭代进化。
十余年技术沉淀:从博弈 AI、大规模 RL 系统到大模型后训练
孙鹏博士拥有清华大学博士学位,之后先后在康奈尔大学、罗格斯大学完成博士后研究,十余年职业路径始终扎根强化学习、智能体、多智能体强化学习领域,横跨机器人控制、分布式大规模强化学习工程系统、大模型后训练三大方向,兼具算法理论研究与工程化落地双重能力。
在腾讯 AI Lab 与 Robotics X 机器人实验室任职期间,孙鹏担任智能体中心负责人。一方面开展机器人深度强化学习控制研究,依托对抗博弈算法完成轮式机器人端到端目标跟随能力;另一方面主导《星际争霸》系列博弈 AI TStarBots、TStarBotX 研发,在多智能体复杂博弈场景拿到突出研究成果。
转战字节跳动之后,孙鹏的工作重心延伸到大规模强化学习基础设施建设。他主导搭建 ByteRL 强化学习底层系统,支撑多款自研游戏 AI 高效训练。其团队拿下 IEEE CoG 2023 策略卡牌 AI 竞赛冠军,所研发的炉石传说 AI 具备击败顶尖人类选手的竞技实力。
伴随大语言模型浪潮到来,孙鹏进一步把强化学习方法论迁移到大模型后训练赛道。在字节 AI Lab、Seed 团队工作阶段,作为项目负责人参与推出 ReFT 强化微调方案、数学推理智能体 DeltaProver,深度参与模型 RLHF 预训练对齐工作,在大模型推理增强、Agent 智能体方向积累大量前沿工程经验。
纵观完整技术履历,孙鹏一直在探索同一个命题:如何让智能体在和环境交互获取反馈的过程中,不断优化自身决策策略。如今,这套数字世界打磨成熟的技术方法论,将落地物理世界的人形机器人之上。
补齐后训练短板,星尘智能打通实体机器人完整技术闭环
对于星尘智能而言,孙鹏的加入,补齐了基座模型训练完成之后,面向真机持续迭代的关键环节。
公司自创立起坚持Design for AI设计理念,拒绝把机器人硬件、数据集、AI 模型割裂开发,围绕绳驱机器人本体搭建 “AI 模型‑具身 OS‑绳驱本体” 全栈技术体系,已经形成基座模型、共生 Agent、强化学习后训练完整技术闭环。
自研 Lumo 系列具身基座模型,把运动作为核心模态。Lumo‑1 重点让机器人理解动作背后的逻辑动因;Lumo‑2 作为行业首个家庭隐式世界动作模型,引入隐空间动力学机制,实现 “先预测未来环境变化,再输出对应动作”,大幅提升复杂家庭任务的执行可靠性。
前端共生智能体 Philia 作为具身 OS 的重要组成部分,承接长期记忆管理、任务拆解调度、多机器人协同、人机自然交互等上层业务能力。而强化学习后训练,则承担起真实环境闭环优化的职能:让机器人从一次次真机执行结果中接收反馈,持续修正行为策略,解决仿真和现实世界的鸿沟问题。
入职之后,孙鹏将主导星尘智能具身模型、机器人强化学习整套后训练体系的建设,把大模型领域验证成熟的强化微调技术,适配真实机器人硬件、真实场景数据闭环与长期商业化部署需求,推动技术从算法原型走向实体机器人落地。
孙鹏本人谈及此次选择时表示:“过去十多年,我一直在深耕强化学习与智能体,见证这项技术从机器人控制、复杂博弈任务,一路演进到大模型后训练阶段。我希望把这些积累真正带到物理世界。星尘智能已经具备本体、具身操作系统、AI 模型完整全栈底座。我期待和团队一起,把强化学习深度融入机器人训练与部署流程,让机器人不只是学会单一任务,还能在真实环境反馈当中,越做越好。”
后训练闭环,是具身智能规模化落地的必经之路
当前不少具身模型在仿真环境、标准化测试集表现亮眼,一旦迁移到真实家庭、商业场景,就容易出现成功率下滑。单纯依靠预训练 + 示范数据,很难覆盖现实世界无穷无尽的边缘工况。
强化学习后训练闭环,核心价值就在于以真机真实反馈作为奖励信号,持续迭代模型策略,完成从实验室 Demo 走向商用落地的关键跨越。星尘智能依托绳驱机器人硬件底座、Lumo 基座模型、Philia 智能体,叠加孙鹏带来的强化学习工程能力,完整闭环已经成型,也为国内具身智能行业提供一条可参考的技术路线。
本文内容整合自公开行业信息,仅作交流分享使用;相关内容版权归原作者所有,若涉及侵权请联系删除。








