文|尚莞迪
8月19日,宇树科技在科创板挂牌上市。发行价150.80元,开盘直接跳到1100元,涨幅629%,盘中市值一度冲上4449亿元。按发行价计算,它的市盈率是219倍,行业均值不到39倍。
高点只停留了片刻。到9月18日上市满月,股价较首日高点回撤53%,市值蒸发约2366亿元,相当于三分之一个小米。
有趣的是,二级市场在撤退,一级市场却还在加注。据数据统计,2026年上半年国内具身智能赛道融资935亿元,是去年同期的五倍,已经超过2025年全年。估值过百亿元的具身智能公司,一年之内从三家变成了二十多家。出货端也在兑现:市场研究机构SAG的数据显示,上半年全球人形机器人出货约1.91万台,中国厂商占了97%,仅智元一家就出货约8400台,占全球份额44%。
在这波拧巴到让人看不透的热度里,到底有多少是真的?
最不客气的断言,来自具身智能领域的开山鼻祖Rodney Brooks。这位iRobot联合创始人、麻省理工学院人工智能实验室前主任,是行为主义机器人学的开创者,今天所说的具身智能(embodied AI),很大程度上正是从他倡导的理念中生长出来的。在最新的博客里,他写得颇为直白:围绕人形机器人的一部分狂热,已经近乎自我欺骗。

而我认为,判断一个行业是否存在泡沫的最好时机,或许正是它最喧嚣的那一刻。
本期「创见」播客,我邀请到Dr. Allen Yang,对具身智能泡沫论做了一次85分钟的全维度解读。他是加州大学伯克利分校人工智能竞速项目(ROAR)主席、FHL Vive增强现实中心创始执行主任、Hitch Open世界AI竞速锦标赛联合创始人。他出自中科大少年班,拥有伊利诺伊大学电子工程与数学双硕士、电子计算机工程博士学位,手握三十余项专利,发表论文百余篇,被引用逾两万次。

他曾带领伯克利车队拿下印地自动驾驶挑战赛冠军;他推动的伯克利人形机器人乒乓项目,创下机器人与人类连续对打106回合的世界纪录;作为Hitch Open联合创始人,他与全球执行主席唐敏勤联手,把7所中国顶尖高校的AI车队送上了天门山99道弯;今年8月,他又作为HOPE裁委会主席,把机器人乒乓送进了北京「冰丝带」的世界人形机器人运动会。
在这场对话中,Dr. Allen Yang把「泡沫」这个市场情绪,拆成了六个可以被验证的问题:具身智能是什么、不是什么;通用机器人的五层技术栈,哪几层真正卡脖子;世界模型是不是唯一解;具身智能的AlphaGo时刻长什么样;机器人经济的账该怎么算;以及从人形「机器人竞技」走向「机器人经济」,我们还要跨过哪些鸿沟。
本期「创见」播客以视频形式录制于2026年7月5日的伯克利校园,开场部分于9月补录。本期视频播客已同步上线各大平台,欢迎收看。
以下为本期内容精选。
第一章 具身智能,先要赶上小松鼠的智能
尚莞迪:具身智能是当下全球最热的叙事之一,泼冷水的却恰恰是这个领域的祖师爷。Rodney Brooks公开说,这波人形机器人热严重泡沫化,一部分商业叙事甚至带有自我欺骗。您同样在真实世界里研究物理智能多年,怎么看他的判断?

Allen Yang:学术界看技术,一向比市场有耐心。博士生入学时,导师给的第一条建议往往是:不要研究五年之内就能解决的问题。一篇好的博士论文,应该去啃五到十年之后的事。
互联网、智能手机、物联网、卷积神经网络、大语言模型,这样的周期我们已经看过很多轮。期待也好,担忧也好,放在学术界的时间尺度里都很正常。真正重要的,是让市场和消费者对具身智能形成一个正确的认识。
尚莞迪:很多人把具身智能理解成「AI加一个身体」,我觉得这个定义太浅了。我们谈具身智能时,到底在谈什么?

Allen Yang:它的英文是embodied AI,这个名字起得很好,从字面上就能看出它是什么。但更重要的是,它不是什么。Embodied,就是把智能放进一个物理形体里。这个形体不一定是人。一台有智能的扫地机器人属于具身智能,一辆能自动驾驶的汽车也属于具身智能,港口、工厂、特种作业里的智能车辆都可算作具身智能。离消费者最近、也最容易被想象的终极形态,是人形机器人。
那么它不是什么呢?会下棋、会写代码、会聊天的大语言模型,如果不能驱动一个身体去改变物理环境,从狭义上说就不能算作是具身智能。
尚莞迪:那在一个具身智能系统里,大语言模型到底起什么作用?
Allen Yang:语言只是智能的一部分。扫地机器人需要感知,知道自己在厨房还是卧室,前面有没有桌子,然后把地扫干净、不撞桌子,它就是一个合格的具身智能。它不需要语言。
自动驾驶也一样。除了最后提醒乘客「快到达目的地了,请带好行李下车」,驾驶本身并不依赖大语言模型。
所以具身智能的方案其实分成两类:一类需要大语言模型,另一类完全不需要。这是个好信号。大语言模型的包袱是算力消耗大、训练周期长,如果相当一部分具身智能不必把它当成卡脖子的环节,落地反而会更快。
学术界有个常用的比方:小松鼠。具身智能要先具备小松鼠的行为智能,才谈得上人的语言智能。
除了人,动物没有语言,它们发出的声音不是token,所以你不可能训练出动物的大语言模型。可是所有动物都能完成高质量的行为动作。几千年来,人类的生产力很大一部分靠动物帮忙,直到两三百年前有了机器,才有了汽车,才走到今天。
「如果单纯从用智能提高生产力的角度看,语言并不是必要的一环。」
第二章 在小脑还不安全时,何谈大脑?
尚莞迪:行业里有一个逐渐成形的共识:做出通用机器人,需要打通五层技术栈。最底层是硬件,包括本体结构、关节电机和灵巧手;其上是感知,让机器人看见、摸到周围的世界;再往上是「小脑」,负责运动控制,决定这具身体能做出哪些动作、做得多稳;然后是「大脑」,负责理解任务、做出规划;最顶层是训练,也就是数据与仿真,决定前面所有能力能否被习得。小脑和大脑这两个概念最容易混淆。在您的定义里,它们分别解决什么问题?
Allen Yang:英文里有句话:历史不会重复,但会押韵。关于具身智能的很多疑问,答案其实已经写在历史里。如果拿不准,就去看汽车行业。流水装配线是汽车业发明的,分期付款和个人信用体系,也是因为人们想先提车后付钱才普及开来的。
用汽车来理解小脑,就是一辆还没有自动驾驶的车。家用轿车是为了载家人,跑车是为了赛道,F1甚至不能合法上路,它存在的意义就是让全世界那几十个人去逼近速度的极限。你开一辆家用轿车,不可能跑出F1的性能;你也不可能让爸妈舒舒服服地坐进F1。原因就在于这台机械被调教成了什么样。
具身智能的小脑也是如此:它通过控制躯体,划定了这具身体能做的动作区间。大脑只能在这个区间里挑选、组合,去完成一件具体的事。
尚莞迪:那今天卡脖子的部分,更多来自于小脑还是大脑?
Allen Yang:取决于你的预期。如果预期是机器狗、扫地机器人、自动驾驶,这些已经实现了。但如果具身智能等于人形机器人,要帮我们带孩子、照顾老人、在医院做护工、去干那些高危又脏又累的活,那么五层技术,可以说当下全部卡脖子。

先说硬件。北京亦庄的人形机器人半马,去年第一届二十支队伍只有六支完赛;今年冠军跑出了50分26秒,比人类男子半马世界纪录快了将近7分钟,前三名都跑赢了人类纪录。一年时间,比赛把机器人下肢的耐久和性能逼了出来。可跑步不等于生产力,人的生产力主要在手上,机器人的手离人还差得很远。
再说小脑。你可以用大语言模型发出一条指令,但小脑能不能执行?据我所知,到今天还没有任何一台机器人能在一个陌生空间里,独立完成上楼、下楼、开门、使用工具,这里是指未知的工具。
大脑层,如果以大语言模型为基础,用语言直接驱动机器人去做事,这件事今天也还没有实现。
感知反而是最成熟的一层。二十年前,卷积神经网络就证明了机器的视觉识别能超过人。今天我们在伯克利用自动驾驶技术去开方程式赛车,速度已经推到每小时200英里,约合320公里。
最后是训练,争论最多。是只训练语言,给每个场景配一段描述,还是像小松鼠那样做行为训练?小松鼠没有语言,没有考试,也没有人给它打标签,它看着妈妈爬树,就能爬任意一棵树、吃任意一颗果子。这种少样本甚至零样本学习(few-shot / zero-shot learning)的能力,今天的具身智能还不具备。
尚莞迪:这是不是动物和机器的区别?它天生就会,是写在基因里的?
Allen Yang:有一派观点认为,动物的行为智能写在基因里。可基因编码不也是一段代码吗?DNA不也是token吗?好的基因给了你一个预训练模型,后天的学习、拜师,就是微调。小鹿、小马出生一个小时就能跑,这段编码到底是什么?为什么我们教机器人走路、爬楼梯会这么痛苦?到今天还没有任何一台机器人,能像松鼠、马、猎豹那样在任意地形上安全地奔跑。
「动物的DNA就好比是一个预训练模型,所以它能做到少样本、甚至零样本学习。」
第三章 世界模型的价值,在拿不到数据的地方
尚莞迪:大脑这一层,正在经历一次路线转向。过去两年的主流是VLA,即视觉-语言-动作模型:机器人看到画面、听懂指令,直接输出动作。如今越来越多的团队转向世界模型:让模型在内部模拟物理世界会如何演变,先推演,再行动。李飞飞把这种能力称为「空间智能」。您认为世界模型会是通往通用机器人的唯一路径吗?
Allen Yang:还是以史为鉴。按理说,最需要世界模型的是自动驾驶。可今天,中国和美国都已经有车企稳稳拿到了L4牌照。他们并没有等世界模型。为什么?
因为他们拿到了真实世界的模型。

几百万辆车在路上跑,数据足够多,用蛮力就能把模型训出来。
大语言模型也不需要世界模型。从上世纪七十年代的TCP/IP协议开始,互联网做的最核心的一件事,就是把人类的知识数字化。2000年的互联网泡沫里,赚钱的是给每家公司建网站;当年落下的枝叶和果实腐烂之后,孵化出了今天的大语言模型。英语、中文、德语、法语、日语、韩语,都在里面。
第三种情况,发生在有规则手册的地方。比如奥运会每个项目都有自己的规则手册:球是什么形状、打多少气,草皮的反弹率是多少,差一点点,世界级运动员都能感觉出来差别。在这种高度规范的环境里,不需要世界模型。
工厂也一样。特斯拉在上海、德国、加州的工厂,每一个大型铸件都是自己定制的,精度到亚毫米级,根本不需要一个世界模型去告诉机器人零件长什么样。
那什么时候需要世界模型?当你要把一台机器人放进医院,放进千家万户去当保姆。每个家的卧室和厨房都不一样,你不可能要求所有人按同一套规则装修。在那样的场景里,才真正需要世界模型。
尚莞迪:所以对具身智能来说,最重要的还是两个字:数据。再加上一套标准,把它框在合理的范围里。

Allen Yang:完全正确。世界模型之争,核心就是token,就是数据。
「世界模型真正有价值的地方,是我们没有能力拿到数据的地方。」
别人家里是私人空间,你不可能公开跑进去采集数据。但乒乓球、羽毛球是奥运项目,一百多年的比赛里,只要有录像,多视角、多选手的数据都能拿来训练。自动驾驶跑在公共道路上,谁都有权采集,高精地图已经把真实世界扫了一遍。在这些场景里,对生成式世界模型的需求就低得多。
第四章 冲破今日极限,为确保明日安全
尚莞迪:去年我跟着AI竞速伯克利战队去看印地赛,第一次亲眼看到时速两百多英里的赛车里空无一人,大为震撼。我当时问您,AI竞速是不是已经远超人类了?您说还没有,至少还差一半的距离。我当场就愣住了。可您又说,AI竞速的进化速度快得惊人,就在两年前大部分参赛赛车还跑得像醉汉一样,能完赛的寥寥无几。

Allen Yang:AI是人类所有技术里进步最快的,也是获客最快的,ChatGPT不到一年就有了上亿用户。但判断具身智能的进展,要先分清拿什么做参照,我认为大致有三层。
第一层,对标普通人。自动驾驶上路,对手是普通司机,只要比普通人安全十倍,绝大多数政府都会发L4执照。哪怕只把10%的车换成自动驾驶,整个社会的交通效率和安全都会大幅提升。
第二层,对标人类最好的选手,这就是分水岭事件。深蓝战胜卡斯帕罗夫,AlphaGo战胜李世石,都属于这一类。今年亦庄的半马发生在北京时间周六,美国这边还在过周末,到了周一,美国各大新闻网站全在报道:北京的机器人跑赢了最好的人类。分水岭一旦出现,不需要任何推广,全世界都懂它意味着什么。

第三层,是指数曲线本身。拐点之前,大家觉得它平得像一条直线,怎么这么慢;拐点一到,全球立刻明白,不需要争论,也不需要营销,赢了就是赢了。接下来,政府、投资人和企业会围绕这项技术去找应用,市场会爆发得非常快。
尚莞迪:这也是Hitch Open想推动的事,帮产学研找到那个拐点。
Allen Yang:历史上的分水岭事件,其实都走了捷径。
我们不可能为了和人比,先造出一个完美的人。
深蓝只是在国际象棋上超过了卡斯帕罗夫,AlphaGo只是在围棋上超过了李世石。当五层技术全面卡脖子的时候,必须找到一个平衡点:在某一个具体项目上达到人类最高水平,又不必等到世界模型成熟之后才动手。
乒乓球正好符合这个命题。它有大量公开数据,球的运动只需要符合牛顿力学,比赛有国际乒联严格的规则。只要在地球上打,重力是一样的,球拍、球台是一样的,唯一的变量是站在两端的本体。我们要找的,是硬件、小脑和简化后的大脑之间的最佳组合,看它能不能在三到五年内打赢世界级运动员。
自动驾驶从起步到比普通人更安全,确实走了二十年,不管你是多大的巨头、投了多少钱。所以如果有人说两三年内机器人就能打赢世界冠军,那并不现实。但亦庄半马也告诉我们,一个专门为跑步研发的机器人,经过一年研发就超过了人类。真相在两者之间。Hitch Open想做的,是和全球最顶级的科研机构、最前沿的公司一起,找到这个平衡点在哪里。
尚莞迪:1980年代,机器人学家汉斯·莫拉维克提出过一个观察:让计算机在智力测验或棋类游戏里达到成人水平相对容易,让它拥有一岁孩子的感知和行动能力却极其困难。人类觉得越高级的能力,机器越容易学会;人类不假思索的本能,机器反而最难掌握。这就是莫拉维克悖论(Moravec悖论)。
AI今天能通过律师考试、写代码、做复杂推理,却很难把一件衣服叠好放进衣柜,拧开一个瓶盖,接住一个抛过来的不规则物体。这背后可能存在的莫拉维克悖论,我们该怎么理解?
Allen Yang:在机器人领域,我不觉得它是个悖论。叠被子和小松鼠爬树一样,都不需要语言。爸妈教我们叠被子,不会先写一篇论文让我们读,我们是看着他们怎么做而学会的。行为智能本质上是模仿。今天确实还没有找到标准的解法,但这并不说明机器人已经掌握了高级智能。只有小脑的训练成熟了,大脑的训练才可能最终走向AGI。
做自动驾驶的人常说一句话:如果你知道一辆车在时速160英里时是不安全的,你还敢让你最亲爱的人坐进一辆在路上开160公里的车吗?
「AI极限运动的意义,在于照出智能体的毛刺。」
在极限状态下出现的毛刺,意味着它在普通场景里也可能出问题,也许概率只有十万分之一。可如果这个概率落在你的家人身上呢?具身智能也是一样。
一台机器人也许能上你实验室的楼梯,因为你为了演示、为了上春晚,专门训练了十天,甚至十个月。可把春晚舞台搬走,换成你家的楼梯呢?上得了厅堂,下得了厨房,今天没有一台机器人做得到。
这里的安全,指的是自主安全。网断了、家里停电了,机器人也不能从二楼摔下来,智能必须在本体里。自动驾驶也一样,不管你拿到L4还是L5,都不能因为旧金山大停电,车就停在路中间,这件事真的发生过。
尚莞迪:为什么训练这一层还是这么难?
Allen Yang:两个原因。第一是数据。互联网从TCP/IP时代就开始积累数据,可你去网上搜,有多少以第一人称视角拍人上楼梯的视频?一百万条都没有。特斯拉公开说过,它的车每天收集大约500万公里的驾驶数据。全网所有人和机器人爬楼的视频加起来,有没有500万小时?没有。500万公里这只是特斯拉一天的量。
第二个原因更技术。仿真里的世界模型,一个维度是生成,从一张门的照片生成一百扇、一万扇门;另一个维度是交互。真实世界里的物体大多不是刚体,而是可形变的。你一用力,手要能感知,物体也会被压缩、变软。叠被子之所以难,就是因为施力之后它会变形。你要模拟一条毛巾,得把它拆成无数颗粒,让它在重力下从一个点被提起时,像真毛巾一样垂坠下来。刚体可以靠拍摄采集数据,非刚体的形变是无限维的,怎么拍都拍不全。
尚莞迪:听起来还有很长的路要走。
Allen Yang:消费者、政府、投资人都需要沉住气。去年全球人形机器人的出货量不过一两万台。一家汽车公司年产一万台,是二十世纪初福特T型车刚问世时的事。从那时到今天汽车拿到L3、L4,过了一百年。
科技在加速,GPT是这样,亦庄半马也是这样,但它仍需要时间。历史的脚步又是挡不住的。我最兴奋的,恰恰是我们还不知道的东西,谁都不知道。
去年看亦庄半马的人,没有一个知道机器人什么时候能超过人类,结果只用一年就超过了。你敢想象吗?
尚莞迪:如果几十年内都看不到一个好的结果,您会后悔投身于具身智能领域吗?
Allen Yang:讲一段历史。2020年,IEEE Spectrum做过一次专访,问自动驾驶什么时候能来。一位受访者是马斯克,他说三四年,当然他永远会说三四年。另一位是伯克利校友、苹果联合创始人沃兹尼亚克,他说,这辈子也许都看不到自动驾驶汽车了。仅仅五年,这个预言就落空了。

我们是有作业可以抄的,那就是小松鼠。人本身就是一台能组织语言的机器,那就必然会有一台机器能做到同样的事,只是我们还没搞明白怎么做。今天硬件、小脑、大脑、感知、仿真,每个卡脖子的地方都有最好的公司和最聪明的人在攻关。
尚莞迪:具身智能的AlphaGo时刻会是什么样?
Allen Yang:第一,它一定对标人,而且是最好的人。你造出一台能像缉毒犬一样找违禁品的机器,也许超过了狗,但它成不了AlphaGo时刻。
第二,它必须做减法。如果IBM在上世纪九十年代就要让机器像人一样考律师资格,那时根本没有这种技术,所以那个年代的AlphaGo时刻是国际象棋,后来是围棋,再后来才是通过图灵测试、能像人一样聊天的GPT。
具身智能的AlphaGo时刻,一定是做一颗低垂的果实,而不会是造出一个全能的人。
好的乒乓球运动员不一定会打篮球:乒乓球要身形灵巧,中国有世界冠军;打篮球,亚洲人天然不占优势。机器人也一样。它的AlphaGo时刻应该不止于树上的一颗果子,而是一整棵树上的很多颗。怎么把前沿的本体、小脑、大脑、感知和训练组合起来,摘下其中一颗,是整个行业可以一起去做的事。
尚莞迪:数据不够,有人主张凭空造数据,用仿真去生成。这条路对吗?
Allen Yang:无论中国还是美国,今天在基础工业里都发现,卡脖子的不只是本体和精密仪器,还有仿真软件。造芯片、造飞机、造船,没有好的仿真,产品很难做到全球一流。飞机和船要的是流体力学、空气动力学;具身智能要的,是和物理空间的接触。
方程式赛车和世界的接触只有四个点:四个轮子。一套工业级的车辆动力学仿真软件,一个授权就要几万美元,而它仿真的只是四个轮子和赛道之间的交互。可机器人要用手和世界交互,手碰到哪里,哪里就会变形。楼梯、门、锅碗瓢盆,每一样的变形方式都不一样。这对仿真的要求高得多,是一个非常明确的卡脖子环节。
尚莞迪:所以真正推动具身智能进步的,还是一次次行动、一次次失败,以及失败之后的反馈。

Allen Yang:是的,做过自动驾驶的人都知道,安全是撞出来的,是在一次次事故里总结出来的,真实数据也是这样拿到的。

这也是Hitch Open选择乒乓球的原因。乒乓球的形变非常小,除了空气动力学,它只和两样东西交互:球台和球拍。灵巧手本来是一个痛点,但机器人握住球拍之后,手的自由度和交互难度大大降低,手变成了一块拍子,而拍子和球的交互,可以用数学公式完整写出来。
我们把一些极难预测的仿真问题,压缩到一个可规划、可控制的范围里,才能和人类数据做比较。如果人类的顶尖表现像一颗十年才来一次的彗星,你靠堆数据、堆算力,未必等得到。但如果把问题简化,等的是一颗每年都来的彗星,也许三五年内就能把它背后的逻辑算清楚,之后再用仿真去追踪,每天都能抓到它。
第五章 做人,不要做狗
尚莞迪:人形机器人会是具身智能的终局吗?一种说法是,一个人形就能干千万种活;另一种说法是,它既不可能,也不高效,更不经济,不如在不同场景造不同的机器人。您会怎么选择?

Allen Yang:具身智能不是一道是非题,它更像一张图,至少有两个维度:一个是形态,一个是生产力。不同形态带来的生产力不一样。扫地机器人做不了饭、带不了孩子,但它把扫地这件事接管了。自动驾驶拿到了L4,说明在开车这件事上已经可以不需要人。
但这还不够。美国劳工统计局有一项时间使用调查,精确到分钟,记录普通人一天二十四小时都在做什么。即使自动驾驶已经比人安全十倍,美国人平均每天开车的时间也只有半小时左右。
「如果我们要考察AI到底能替代多少生产力,一天里还有二十三个半小时没有被触及。」
家、办公室、工厂,今天几乎全是按人的形态打造的。所以人形机器人一旦达到人的性能,能触及、能替换的生产力是最多的。所以是否是人形机器人的问题,并不是一个非此即彼的选项,而是要看整张生产力饼图里最大的那一块。
尚莞迪:为什么风投都在押注一个观点:AI agent之后,下一个风口是robot agent。
Allen Yang:投资人只要看过各国的时间使用统计就会发现,人一天里绝大部分时间,只要没必要,是不会跟电脑打交道的。我们跟电脑交流靠鼠标、键盘、屏幕、触屏,可人和人交流不需要这些。
「无论大语言模型多先进,它仍然是被关在屏幕这座牢笼里的AI。」
键盘和鼠标是上世纪六七十年代的产物。那时机器理解不了人,所以我们发明了图形界面,让人学着跟机器交流。今天AI到了这个程度,该反过来了:让机器学着跟人交流,直接把活干了。这就是具身智能的终极能力。
尚莞迪:这个节点什么时候会到?
Allen Yang:通用的、AGI式的机器人,它的AlphaGo时刻还比较遥远。但如果做减法,运动领域的、能进工厂的、做专业工业应用的AlphaGo时刻,也许三年之内就会到来。今年已经有机器人公司和客户一起试点,替换某些岗位上的工人,有的场景已经做到二十四小时不间断、零失误。
尚莞迪:这和早年的黑灯工厂有区别吗?
Allen Yang:工厂本身就不需要世界模型,它是高度自动化的产线。过去我们批评自动化产线把人变成了机器,现在反过来,是要把机器变成人,在中间找一个最快的切入点。约束最少、也最难的,反而是厨房和居家,变量实在太多了。
尚莞迪:马斯克的机器人现在也还没有真正实现产出,主要放在自己的工厂里产生数据、做模拟。那么一台能养活自己的机器人,商业闭环会是怎样的?
Allen Yang:这是投资人问我最多的问题。
硅谷对具身智能有一个笑话,叫「夹起尾巴做人,不要做狗」。

它本质上其实不是笑话,背后是一张二维的布局图。
横轴是各种形态。现在去投扫地机器人,晚了;去投自动驾驶,也晚了。下一代是人形机器人,那它到底是做狗,还是做人?纵轴是生产力。狗在社会里主要是伴侣,除了军警和安防,生产力很低。而同样的投入,或者稍多一点,如果能替代一个人,对应的生产力资本化是巨大的。
谈到资本化,所有人算的都是投资回报。一个岗位要雇三个工人三班倒;换成一台机器人,二十四小时工作,也许二十二小时干活、两小时检修。
「哪一天一台机器人的成本,比三个工人哪怕低一分钱,工厂老板都会立刻替换。拐点就在这笔账上,要算到厘。」
这笔账有两个变量。第一是工种:工种越单一,替换越快。人的工资基本是恒定的,但工种越单一,机器人的成本就越低。第二是地区:人工越贵的地方,转变越早发生。如果机器人造价相同,就像特斯拉在中美两地造车成本持平,那么人工越贵的市场,越先换过来。
自动驾驶已经算得过来了。在美国有人测算过,没有司机的车每公里成本可能只有有司机出租车的五分之一,不是省一分一厘,而是成倍下降。所以一旦达到L4、L5,汽车取消方向盘是必然的,而且全球都会发生,因为这笔账在哪里都算得通。这也是Robotaxi赛道挤满玩家、陆续有公司上市的原因。
人形机器人的账,目前还算不清。自动驾驶只是一种技能,成本可以对照成熟的出租车模式折算;机器人进工厂到底替代哪个岗位,还没有定下来。但我相信,人工成本最高的市场会最先转过来。
尚莞迪:那为什么Waymo现在还比Uber贵?
Allen Yang:这跟经济模式有关。特斯拉做对了一件事:三万美元的车也好,十万、二十万的跑车也好,自动驾驶系统是同一套,而且不管你买不买,硬件都装在车里,你可以买断,可以按年订,甚至按月订。这样就把成本摊得很低。
很多车厂只在最贵的车型上装自动驾驶,用的人最少,替换的回报要求就最高。归根结底,同等性能下,AI的成本打得越低,替换就来得越早。
尚莞迪:如果一位投资人朋友问您,看具身智能项目,硬件、算法、数据、团队,哪个最重要?
Allen Yang:每家机构的评估体系都不一样,我还是从历史看。自动驾驶走到今天,大家已经没有争论了:最后赢的,一定是会造车的。不会造车,你拿不到数据,也做不了最后一公里的部署。
「谁能拿到每天500万公里的数据,谁才能拿到L4和L5。」
具身智能也一样。细分领域再多,最后要看这个组合,不管是投资人的组合,还是团队本身的组合,能不能在全球范围内找到最好的本体、最好的小脑、最好的大脑,用最优的方案,去摘一颗低垂的果实。
第六章
历史不会重复,但会押韵
尚莞迪:一个想做具身智能的团队,加入Hitch Open这个平台,能得到什么?
Allen Yang:两件事。第一是人。参赛的都是各个大学的顶尖人才,如果Hitch Open能汇集全球十所、二十所、五十所最好的大学,下一个马斯克从里面长出来的概率非常大。
而且这个平台不是让大家闭门造车,而是让大家走出去。硅谷有句话,叫get out of the building,走出办公楼。去年在天门山,很多学生学到的第一课就是:在上海、在北京,甚至在硅谷课堂上学到的自动驾驶算法,到了山上一个都跑不通。现实撞上课本的时候,是非常残酷的。把人才带进物理世界,是我们最不一样的地方。
第二是和企业一起定义低垂的果实。乒乓球是一颗,自动驾驶是一颗。这样首先省去了搭建世界模型的成本,其次能很快给大家提供高精地图、乒乓球视频这样的数据,降低企业和大学的创新成本。最后打出来的AlphaGo时刻,全球的消费者一看就懂。
「当机器人打赢人类乒乓球世界冠军的那一刻,无论中国、美国、法国还是英国的观众,都会明白这件事的意义。」
尚莞迪:可机器人在赛场上赢了比赛,不等于赢得了消费者的信任。打球是一回事,进家门做家务是另一回事。从机器人竞技到机器人经济,这条链路是通的吗?
Allen Yang:中间要跨过两道鸿沟。
第一道,是从品牌到销量。大家都知道法拉利好,可这辈子见过几辆、又拥有过几辆呢?大家认定法拉利好,是因为F1。F1赛场上只有法拉利车队能用那抹红色,它在F1的收入分成里拿得也最多。你也许一辈子都不会拥有一台法拉利,但心里会认定它是最好的。Hitch Open通过和奥运冠军级别的人类对比,打造的其实是品牌。品牌不等于销量,中间需要本体企业接住这个品牌,把它转化成投资回报。
第二道,是标准。F1打造的品牌,永远不等于汽车安全评级的ABCDE,也不等于自动驾驶的L1到L5,甚至可以说,F1在自动驾驶上反而落后了。这里需要政府介入去定义:达到了某些运动标准的本体或方案,对应什么样的安全等级;机器人能做到的技能,和消费者在市场上买到的产品之间,如何在法规上衔接。从一个好品牌到一个好产品,这两段要靠企业和政府一起填。
尚莞迪:这就涉及通用标准。赛事能在中国办,能不能去巴黎、去沙特、去非洲?怎么让它走出一个区域,完整复制到另一个区域?
Allen Yang:这就是我们选择类奥林匹克赛制的原因。奥林匹克有一百多年历史,本身就是连接各种文化的。不管是打造品牌,还是对本体、小脑、大脑做真正的技术测量,甚至和各国一起研讨政策,把机器人的运动能力对应到各国的标准,都可以在这个平台上合作。但品牌最终怎么落地,取决于每个地区的文化和真实的购买意愿,这需要不断迭代。就像一届奥运会能捧红很多运动鞋、饮料、电脑品牌,我们也希望和全球未来的AI品牌一起成长。
尚莞迪:汽车用一百多年建立起牌照、安规和全球统一的标准。机器人要走进寻常百姓家,哪怕只做某一项功能,是不是也需要这样一套国际化的标准?
Allen Yang:这是个非常好、也非常难回答的问题。汽车跑在公共道路上,一百多年里交规已经大量整合,全球最大的区别也就是靠左还是靠右开。但具身智能的生产力最终要进入千家万户,就像喝咖啡,美式、意式和中国的喝法都不一样。让机器人在各个国家、各种文化里替代人,是一个非常复杂的问题。
自动驾驶已经做了二十年,我们不希望具身智能再等二十年。办法有两个:第一是大量仿真,如果能在仿真里建起不同国家、不同文化的场景,能大大缩短这段距离。第二是开源。美国有句话:信任,但要验证。
AI永远不能只靠信任,它必须能被验证。
大语言模型就是最好的例子。今天各个国家都能有自己的大语言模型,是因为前几代基础模型走了开源的路,有Llama一代、二代、三代,早期的GPT也开源过。如果没有这些,我们今天不可能有能用中文、英文和人对话的模型。要在最短时间里拿到第一批十亿用户,底层技术开源必不可少。
具身智能将来要在我们家里和孩子、老人互动,它的数据和软件是不是也需要开源?Hitch Open之所以有Open这个词,就是希望找到最好的人、最有能力的公司,同时把沉淀下来的一部分技术开源出去。
尚莞迪:去年全球人形机器人出货一万多台,八成以上由宇树、智元这样的中国公司领跑。马斯克的机器人还没有对外出货,主要在内部使用。如果说算法高地在美国,制造和数据高地在中国,我们要面对的是一场对抗,还是一场合作?
Allen Yang:我们以这句话开始,也以这句话结束:历史不会重复,但会押韵。
苹果的CEO,不管是乔布斯还是库克,都说过,除了最贵的服务器,苹果的手机、台式机和笔记本不可能在美国制造,很大一部分在中国。新能源汽车,环保的理念从美国兴起,可今天能盈利、造得起的,不管是太阳能板还是电池,主要是亚洲企业;特斯拉能维持它的经济模型,靠的是全球布局。电商也一样,不管是京东还是亚马逊,大部分商品来自中国。
「全球最大、消费意愿最强的市场,必然要和亚洲的产线结合。」
具身智能也会是历史的押韵。不管它的应用最后落在世界的哪个角落,亚洲的产线和整个供应链生态,一定是中间不可或缺的一环。我们希望像电子产品、新能源车和电商那样,把东方和西方最好的优势结合起来,让全球消费者享受到最大的好处。
尾章
自由,是去做AI做不了的事
尚莞迪:最后一个问题。对您来说,真正的自由是什么?
Allen Yang:我经常想这个问题。我不想被当成马斯克的粉丝,但在这件事上,他的思路确实给了一个很简单的答案。大家都在问,如果社会上的工作都被AI替代了,人还能做什么?答案是:去做AI不能做的事。比如登月,比如去火星。
我们今天聊的自动驾驶、叠被子、扫地机器人,到了火星、到了月球还有用吗?没有用了。当我们把人类文明播种到一个新的环境里,要解决全新的问题,在地球上训练出来的AI就派不上用场了。在那里,人类自己的智能才真正值得发挥。
尚莞迪:所以对您来说,真正的自由,是去做AI做不了的事。
Allen Yang:也包括多去旅行,去享受大自然。我从没见过任何一个AI说自己想去旅游。想去旅游,本身就是人类的智能,因为它满足的是好奇心,而今天的AI没有好奇心。我还没吃过重庆火锅,还没去看过大熊猫。这种期待、这种探索,包括作为一个物种要去火星、去月球的渴望,今天没有任何AI主动产生过。
「好奇心,这就是人类智能相比人工智能的优势所在。」
本文基于「创见」播客录制内容整理。本期对话正文录制于2026年7月5日,加州大学伯克利分校;开场部分于9月补录。主播尚莞迪,「创见」播客主理人、Astra X Ventures创始人;嘉宾Allen Yang,加州大学伯克利分校人工智能竞速项目(ROAR)主席、FHL Vive增强现实中心创始执行主任、Hitch Open世界AI竞速锦标赛联合创始人。
文中观点为嘉宾个人表达,不构成投资建议。欢迎分享,转载请注明出处:「创见」播客。







