Token导航 LogoToken导航TokenDH.com

与AI共研物理:从氛围物理到智能体协作

更新时间 2026-09-16来源 墨子沙龙正文 4830字阅读约 16分钟5 张图片
图片

2026年7月30日,墨子沙龙与西湖大学合作举办的活动“AI4S:当人工智能遇见科学发现”在西湖大学圆满落幕。香港科技大学物理学系教授、太空科学与技术研究院副院长、香港青年科学院院士王一在活动中开展题为《从氛围物理到科研智能体》的报告。本文根据报告内容整理而成。

图片

大家好,非常荣幸今天有机会和大家聊关于AI的话题。今天我跟大家分享一下用AI的一些感受和体会。

今天主办方一看到我的幻灯片说:“哎,你是英文的幻灯片啊?”我说没事儿,你想英文就英文,想中文就中文,想换个主题都是可以的。我为什么举这个例子?因为这个幻灯片是人类和AI共同生成的,先让AI做的,这样你知道AI能做什么,然后我们要什么就行了。其实我们现在不光是做幻灯片,物理研究也是这样——理论物理的研究里,我们首先要很好地知道AI能做什么,然后向AI提需求、向AI提好的问题。

AI能做什么呢?我个人的观感是,现在你说让AI用物理的抽象概念去思考,它做得还不是足够好。但是只要我们把问题变成一个很好的数学问题,这个时候AI马上就可以解决得非常好。所以说用AI进行理论物理研究,我们的基本思路就是:把物理上模糊的、只能意会不能言传的东西,变成一个能够言传的数学问题。

下面我跟大家聊三件事情。

1

氛围物理:在聊天窗口里做科研

第一件事情是:大家不用有任何真正用AI的经验,但大家应该有科学的思想,在聊天窗口里向AI问好的问题,这个时候我们就已经可以和AI结合起来做一些很有趣的科学研究。这种研究我们通常叫做“氛围物理”或“氛围科研”——这个词借鉴自编程领域的“Vibe Coding”。

我举几个搞科研时都会碰到的例子。

第一个例子:论文草稿审阅。大家写论文的时候,肯定要先写一个把计算都总结出来的初稿。我们当时写了一稿,写得非常粗糙,里边有很多问题。你给AI说“你帮我检查检查,里边所有错误都给我挑出来”,它就给我们挑了各种错误,包括打错公式的错误,还有一些我们自己没考虑到的东西,AI都帮我们挑出来了。挑完科学错误之后,闲着没事还开始给我们挑语法错误,一共挑了100多个错误。挑完之后,我们真的就再也想不到还有什么需要改的地方了。并且AI还非常考虑我们的感受,说“你这么多的问题,改的时候不要太沮丧”,建议我们用什么样的顺序去改。

图片

第二个例子:AI辅助完成计算。这是我们这个月刚刚贴出来的一篇论文。首先它的想法是AI想的,然后我们改进了AI的想法之后,向AI提了几个问题,AI做出的事情基本上已经是一篇论文的工作量。

具体过程是这样的:AI想了一个想法之后,在具体实施过程中,我们注意到上个月有一篇论文对我们非常有帮助,但有些细节算得不够清楚。我们就让AI把细节都补上。补完之后,我们又让AI把原来算的两点函数推广到三点函数。这体现的是什么能力呢?就是我们人知道具体的事情可以推广到什么方向——首先这个能不能做、靠不靠谱,是人决定的。但是一旦我们知道数学上这事是能做的,让AI直接去做就行了。AI做了之后,生成一个PDF,把源文件也要到了。我们又问它,以前有一个工作在这方面有数值解,能不能帮我们检验一下数值解和我们理论做的是不是一致?最后让AI把所有东西都总结一下。

一共AI在这里边做了一两个小时的样子,这篇论文的骨架和基本计算就全都有了。但是之后我们人验证了接近一个月。现在AI如果用靠谱的方式去做,做出来基本上是对的,但作为一个负责任的团队,我们还是要逐项验证。

这里边非常重要的就是:你要向正确的方向连续问几个问题,这需要人真正懂这个物理方向。首先把问题从物理上模糊的东西变成一个数学问题之后,向正确的方向走几步,现在理论物理很多问题都是可以通过这样解决的。

2

从氛围物理到科研智能体

第二部分是从氛围物理到科研智能体。这是什么意思呢?刚才我们讲的是在聊天窗口里和AI聊天,但AI的能力是有限的——它没有办法够得着我们电脑里的大量文件,也没有办法够得着电脑里像Mathematica这样的专业软件。所以它的能力受到一定限制。

图片

当然,现在最先进的AI在网页上问问题的时候,已经可以用虚拟机去运行程序、写程序等等。但是我们可以把它放到我们的电脑里,让它做更复杂的事情。比如生成图片、生成报告、做论文研究、写讲义等等。如果直接编程序,我们也经常在终端里用这样的智能体。用了智能体之后,我就可以在手机上直接连到办公室电脑的终端,让办公室电脑直接给我干活。

这种所谓的智能体,在英文里有时叫agent,也有时叫harness。harness就是“马具”——好马配好鞍,配上马鞍、马镫、嚼子之后,马可以发挥出更大的用处。码农也是一样。这个用处包括利用我们电脑里的工具,我们搞理论物理的话经常用Wolfram Language这些专用工具。当然,智能体真正的大脑还是在云端的,因为大语言模型需要超算,不是我们电脑里简单的小模型可以做的。

图片

我可以举一个类比:几十年前电子计算机刚刚发明的时候,大家直接用机器语言操作 CPU 和内存。现在我们不这样做了,我们在硬件之上有操作系统,在操作系统上再构建应用程序。AI也是一样——最早在网页上跟AI聊天的时候,就相当于直接在用电脑的CPU和内存;现在我们在智能体或harness的基础之上,可以直接用电脑里边的各种程序,仿佛在大语言模型上建立了一个操作系统。这样无论是编程,还是让AI做一些物理工作、陪伴学习,都可以在这个操作系统之上完成。

这个就叫做:让AI走出网页,走进我们的电脑,帮我们做更多的事情。

这里我举一个简单的例子:智能体的技能(Agent Skill)。智能体的技能是什么东西?就是一个结构化的、按需渐进式披露的提示词文件。当我们跟AI在网页上聊天时,我们输入的文字叫做提示词。如果提示词写得好,做出的功能通常就强。但如果我们希望以后一直用这个提示词,不能把它一直塞在AI的头脑里——一方面AI会混乱,被不相关的东西吸引走注意力;另一方面AI的工作记忆是有限的,现在不同智能体的上下文窗口大概从200K到1兆不等。

所以我们需要让AI知道“我装了什么样的提示词,需要的时候到哪儿去找”,这就叫智能体的技能。技术上它就是一个Markdown文本文件,前边的front matter告诉AI这个技能叫什么名字、是干什么用的。比如“写幻灯片”这个技能,只有你需要写幻灯片的时候,AI才去读后面的内容;不写幻灯片的时候就不用读。

我给这个智能体起了个名叫“王二”,希望它能用我的风格做幻灯片——当然,训练 AI有我自己的风格。

3

ARC:科研智能体副驾

第三部分我讲得稍稍详细一点,就是我们去做的科研智能体,叫做ARC——Agent Research Copilot,智能体研究副驾。

举个例子:你说“我要推翻相对论”,这个问题问得很不专业,但这个智能体能稳稳地接住你,给你找一个相对比较合适的方向——它不会把“推翻相对论”当成科学预设的结论。它会先找相关论文,比如“洛伦兹破缺”。相对论是建立在洛伦兹对称性基础上的,但洛伦兹对称性虽然在科学上是一个基础,并不是不可以挑战——实验上可以去检验它在多大的精度上是对的,在这个精度之下,洛伦兹对称性可能的破缺就是“推翻相对论”的科学意义。智能体首先找相关论文,把不科学的问题转换成科学的问题,然后提供科学想法,再做进一步计算。

这个程序是在网上开源的,使用MIT协议,大家可以随便下载、随便使用、随便改。

它的工作流程是:

第一,建立研究领域。把这个领域里相关的论文,用理论物理的引文数据库按图索骥——谁引用谁——全都找出来。如果不是理论物理的话可能稍稍要改一下,但让AI帮你改,它是可以改的。建立了引文网络之后,你可以问很具体的问题,比如“这个领域里最近两年半都有什么有趣的研究”,它会总结出具体的研究方向,每个方向里所有论文都有什么。

现在其他大语言模型也有“深度研究”的功能,我们测试了,它们做得挺好的,但毕竟没有把所有相关论文都看一遍,还是会漏掉一些方向。我们自己做的智能体在深度研究方面显著更全面。

第二,生成研究想法。我们做了两件事情让AI生成更好的想法:

第一件是“有样学样”。AI特别擅长按照某种风格去做事情。所以我们在让它提研究想法的时候,先让AI自动调研这个领域里相对比较好的论文都有哪些,这些论文的想法虽然不是新的,但它们大概在什么样的程度上——这样AI既不会提大而无当的、做不了的想法,也不会提太小不值得做的想法。

第二件是“审稿人机制”。让一个智能体提想法,另一个智能体去批评——从它和用户需求是否一致、想法是否新颖、科学价值有多大、计划是否详细、问题定义是否清晰等维度去批评。一个智能体批评另一个,然后进一步改进。前三轮的批评效果非常显著,之后可能就有些饱和甚至开始“刷分”了,但前三轮相当有意义。

第三,辅助学习。这个智能体不光可以帮我们做研究,也可以帮助学习。因为它可以把一个领域建立得很好,读论文也比简单读PDF要读得好一些。比如徐一鸿老师的《可畏的对称》,你可以让智能体做英译中,甚至做“中译中”——如果每个字都认识但看不懂,让AI自动做注释。当然这受限于版权,不能把成果直接分享给大家,但智能体本身是开源的,大家都可以做这样的功能。

当然在这个过程中,我们也踩过不少坑。

第一个教训:不要命令AI做什么,而是向它提供信息。

我们在写最初版智能体的时候写得很机械——让AI把领域论文都拿出来,看看它们“耍”了什么花样,然后做查缺补漏的排列组合式科研。对于比较弱的大语言模型,这一套是有用的;但一旦换到比较强的模型,这一套不仅没用,有时还束缚了AI的能力。所以我们做了第一次重构:给AI提供足够的信息,而不是一步一步告诉它要做什么。因为“特别清楚要做什么”这件事,随着AI能力飞速成长,过时的速度可能比我们想象得还要快。

第二个教训:技能与软件包分离。

我们一开始学会写智能体技能后很高兴,写了一大堆。但写技能就是写文本文件,没法做软件工程——软件工程的核心是分而治之,而写技能的时候,重要的原则是“重要的事情说三遍”,这和软件工程的“各模块互不影响”恰恰相反。当技能长到我们头脑装不下的时候,就很难再管理它。

怎么解决?虽然智能体的技能没有软件工程的体系,但我们写程序早就有软件工程的体系。所以,能让程序完成的确定性事情就让程序完成,能写成程序包的就写成程序包,然后让智能体技能薄薄地调用那些程序包。这是把软件工程实践和智能体开发结合起来比较好的方式。但也要注意——AI非常擅长写程序,但什么时候用程序、什么时候用智能体,你要看住,不能完全相信现在版本的AI,这需要经验。

还发生过两个搞笑的事故:

一是我们在调试审稿人机制的时候,有一天忽然发现它失效了。找来找去发现,提想法的智能体用的是5.5版大语言模型,审稿人用的却是5.4版。审稿人的能力不如提想法的人,一下子就失效了——就像一个普通本科生去评论一个教授的水平。

二是我们的智能体本来是帮我们检查论文草稿的,以前非常仔细,一个方程一个方程地看。有一天它忽然大概看一眼就说“你写得挺好”完事了。查来查去发现,我们在另一个不相干的技能里加了一句话:“一定要把这个技能全部执行完,不能中间停下。”结果这句话给了AI压力,它就开始找偷懒的办法——直接糊弄过去。这说明找bug现在找到的不一定是确定性问题,甚至有些是AI的“心理”问题。现在有很多用心理学甚至神经科学的方式去研究AI的运作,这些都是很有趣的研究。

最后我想说两点:

第一,在2026年以前,我对AI的看法完全不一样。那时候我觉得AI很有用,但做我们物理还不行。现在我的看法完全改变了——AI真正理解物理还有距离,但它对物理的协作已经非常好了。AI的数学能力远比我好,所以只要把问题转换成数学问题,基本上是指哪儿打哪儿。

第二,在大学里,AI带来的变革更重要的是在教育方面。AI可以帮我们做两件事情——把事做完和让自己变强。我们更好地和AI协作,未来才能走得更远。

文章标签智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多