AI领域又一位重量级科学家走上创业之路。
7月13日,被称为“强化学习之父”的Richard Sutton宣布,自己与Khurram Javed已经离开John Carmack创办的Keen Technologies,共同成立AI初创公司Oak Lab。
- 来源:
https://x.com/RichardSSutton/status/2076663628301058329
01
离开Keen Technologies,
另起炉灶
Richard Sutton与Andrew Barto共同奠定了强化学习的概念和算法基础,在时序差分学习、策略梯度以及学习与规划相结合的智能体设计等方面作出基础性贡献。两人合著的《Reinforcement Learning: An Introduction》,也成为强化学习领域的经典教材。
凭借对强化学习概念与算法基础的奠基性贡献,两人共同获得2024年度图灵奖。
2023年9月,Sutton开始与John Carmack创立的Keen Technologies合作,随后以研究科学家的身份参与该公司的AGI研究。
Sutton在X上宣布离开Keen Technologies时,仍对Carmack及Keen Technologies给予高度评价。因此,这次分拆更像是研究路线上的分化,而非冲突。两家公司都高度重视强化学习和运行时经验,只是Oak Lab准备采取更为激进的基础算法革新路线。
此外,Khurram Javed是Sutton的得意门生,曾在阿尔伯塔大学跟随他攻读博士学位,长期研究在线学习、持续学习和高效强化学习算法,后加入Carmack团队。目前,他是Oak Lab的联合创始人及研究员。
来源:
https://khurramjaved.com/
02
终极目标:
20瓦运行万亿参数智能体
Oak Lab提出的长期目标极具雄心:
打造一个拥有万亿参数、能以20瓦功耗实时学习和规划的智能体。
20瓦大致相当于人类大脑的功耗水平。Oak Lab希望证明,迈向更强智能不一定依赖不断堆积算力和数据,也可通过更高效的在线学习算法实现。
围绕这一目标,Oak Lab重点研究:
- 智能体直接从实时经验中学习,不依赖反复回放历史数据;
- Batch size为1的在线学习算法;
- 事件驱动神经网络,仅在必要时进行计算以降低能耗。
Khurram Javed透露,团队已经拥有一条相对完整的路线图,目标是在未来几年内实现完整OaK(Options and Knowledge)架构的原型。
OaK架构需要从经验中持续发现时间抽象(temporal abstractions ),并将其转化为可以自行验证、能够服务于规划的知识。这里的“Options”可以理解为跨越多个时间步骤的技能或行动策略,“Knowledge”则包括智能体对环境形成的预测和世界模型。
来源:
https://oaklab.ai/mission
不过,这个原型不会以聊天、编程或考试成绩作为首要目标。
Khurram Javed形容,成功的早期原型可能更接近一个正在经历生命第一年的婴儿,而不是今天任何一种AI系统。它的知识或许有限,却能够纯粹依靠自己的行动和经验不断形成新能力。
来源:
https://x.com/kjaved_/status/2076663868160459214
03
大模型之外,
AI创业路线开始分化
Sutton创业也发生在一个值得注意的行业节点。
他的学生、AlphaGo核心负责人David Silver已经创办Ineffable Intelligence,押注通过强化学习打造能够自主获得新知识的“超级学习者”。
来源:
https://www.wired.com/story/david-silver-ai-ineffable-intelligence-reinforcement-learning/
Ineffable Intelligence明确提出,其目标是不依赖人类已有数据,让系统通过经验重新发现并进一步超越人类已经掌握的语言、科学、数学和技术知识。
与此同时,其他AI科学家也在探索不同于大语言模型规模扩张的路线。
Yann LeCun等人共同创办的AMI Labs正在开发世界模型,让智能体从真实世界的传感器数据中学习抽象表示,预测自身行动可能产生的后果,并据此完成规划。
来源:
https://x.com/ylecun/status/2031268686984527936
李飞飞等人共同创办的World Labs则押注空间智能,希望构建能够感知、生成、推理并与三维世界交互的前沿模型。
来源:
https://x.com/drfeifei/status/2064387365930676695
这些公司的技术路线并不相同,但它们共同呈现出一个趋势:
越来越多AI研究者开始探索静态预训练、语言数据和参数规模扩张之外的智能路径,包括从经验中持续学习、建立世界模型、理解物理空间以及进行长期规划。







