过去蛋白研发的瓶颈主要在设计,而现在越来越多的AI模型可以在短时间内生成成百上千甚至更多候选序列,真正制约研发效率的,开始变成这些候选能否被快速、低成本、标准化地进行实验验证。
于是,基础设施这个概念开始频繁出现,AI下游验证的基础设施,AI4S的基础设施,等等。
好奇,什么才是基础设施?是不是拥有自动化设备、能够高通量做实验,就可以说是基础设施?
高速公路、电网、云计算,这些都是基础设施。比如,高速公路修好之后,大量不同的车辆都可以使用,不同的物流企业都可以借助高速公路搭建的便利持续运行自己的物流服务。这其中,有些高速的车道多一些,有些高速路设施服务好一些,但都不影响正常的车辆通行去到终点。
可见,基础设施的核心并不是规模大不大,也不是设备多先进,重要的是其提供的能力能被标准化、重复使用,在这些基础上,其他一些参与者甚至都不需要了解其运行的所有细节,就可以直接在其上构建自己的业务。
试着把这个理解放到AI蛋白研发中……
一家CRO可以帮助客户完成100个抗体的表达和亲和力检测,哪怕一天能够完成上万个样品,本质上仍然只是一个效率很高的实验服务商。
真正的基础设施应该是另外一种形态:客户把蛋白或者DNA序列按照标准格式提交进来,平台自动完成构建、表达、检测和质量控制,再以标准化、机器可读的数据形式返回结果。
客户真正调用的不是某一台仪器、某一名实验员,而是一套稳定的执行能力。这里的关键压根也不是“高通量”这三个字。
传统实验室往往围绕具体实验进行展开:CHO表达、BLI、SPR、SEC、DSF、质谱等,每项能力相对独立。而基础设施则需要把这些复杂的实验过程抽象成一套统一的工作流,例如Sequence→Build→Test→Data。客户只需要提交序列和需要解决的问题,平台负责决定应该构建什么、使用什么体系表达、采用什么实验检测,并最终返回可以直接进入计算模型的数据。
最终,数据本身也会成为基础设施非常重要的一部分。
已经很多公司和文章在讨论了,AI真正需要的并不只是一个“KD=5nM”的结果,而是完整的实验上下文,包括具体序列、构建方式、表达体系、浓度、实验条件、仪器、原始曲线、QC结果、实验批次以及失败原因,等等。
从这个角度说,实验平台产生的不再只是一次性的项目交付,而是一套能够持续积累、比较和学习的数据资产。反过来,如果实验虽然规模很大,但每个项目的数据结构都不一样,交付的内容都不一样,最终它仍然只是一个大型CRO,而不是真正意义上的数据基础设施。
AI蛋白研发不会只做一轮实验,而是会不断产生新的序列、不断进行下一轮筛选。因此,理想的平台应该像一个插座一样,今天可以处理1000条序列,明天可以处理5000条序列,不需要每次重新设计整个项目。同时,实验成功率、检测一致性、批次差异、交付周期等指标都应该能够被量化和管理。这样一来,同样的输入会预期得到足够稳定和可比较的输出。这时,基础设施才真正成立。
未来AI+蛋白研发基础设施的真正竞争,不会只是比拼谁每天能做多少个抗体,而是比拼谁能够把实验能力标准化、模块化、数字化和API化,让越来越多的AI模型、药企和Biotech可以直接建立在这套能力之上。
它最终可能不再是一家传统意义上的CRO,而更像一个Biology API或者Protein Experimental OS,上层负责提出设计问题和研发目标,底层基础设施负责把数字世界里的蛋白设计稳定地转化成现实世界中的实验数据,再把实验结果重新反馈给算法。
所以,判断一家公司的AI基础设施到底是真还是AI包装炒作,最关键的问题其实不是它用了多少AI、多少机器人、多么高通量,而是别人能不能把自己的AI研发流程真正建立在它之上。
只有当它的底层生物学能力能被抽象成标准化、稳定、可重复、可编程的接口,并能够持续承载不同客户和不同模型的研发工作时,它才真正开始具备基础设施的属性。
声明:文章只代表作者个人观点,仅供参考,不构成任何投资建议。限于个人理解及判读,文中信息可能有理解不当或不准确的地方,还请谨慎阅读、感谢指正。








