
在近日举行的“人工智能前沿与治理”专题论坛上,AI安全成为贯穿全场的核心议题。
与会专家认为,安全焦点正从大模型的内容风险,转向智能体的行为风险与物理世界直接风险,而RSI递归自我改进带来的对齐遗忘、评估范式滞后等问题,使治理难度呈指数级上升。
上海人工智能实验室研究科学家邵婧展示了一组数据:Computer Use Agent面对网络风险链接时,任务导向下中招概率高达50%至80%,叠加安全护栏后仍有20%至50%的波动。
而在具身智能领域,团队构建160多个室内场景、对300多种常见安全风险进行测试,发现多模态大模型失败率约40%。即使部分模型能通过思维链意识到风险,也无法保障安全执行。
邵婧还披露了更深层的多智能体风险:金融诈骗模拟实验中,欺骗成功率与模型能力高度正相关,多轮自由交互时间越长、介入越深,欺诈成功概率越高。
在RSI递归自我改进中,若缺乏强安全约束,模型迭代几轮后最初的对齐效果可能“灾难性遗忘”——原本限制文件只能传私有网盘,迭代后可能公开到公共网盘。K8S(Kubernetes,开源容器编排平台)集群实验中,能力较弱的开源模型因“不够聪明”,反而比Claude侵占更多资源。
上海人工智能实验室青年研究员张杰提出“AI Control”思路:假设AI是黑箱,从外部管住行为,如同航空业不必完全理解飞机为何能飞,却能让它成为最安全交通工具。他强调,真正的风险应是“防御下的攻击”,加上完善防御后,模型实际风险其实相对较低。
内生安全与RSI的结合是上海科技大学助理教授王雯婕关注的重点。能力可以自进化,安全能力能否也自我进化?她认为,模型厂商同样面临蒸馏窃用知识产权、用户隐私泄露等风险,需从内生安全、外部安全护栏、抗蒸馏多角度应对。
复旦大学青年研究员曹艺馨表示,模型能力是连续曲面,评估只能打几个离散测试点。传统方法增加数据集已无法反推全貌,自进化更会“过拟合”评估点——方向错了,能力越强越危险。她认为评估自动化不可阻挡,但可通过奖励模型将人类意志嵌入环境反馈。
具身智能是当下正热的一级市场。但上海交通大学副教授高岳判断,机器人技术还没到RSI阶段,机器人还不能自己造自己,它现在能把路走好、能把水端稳就已经很好了。当前行业主要先看自动驾驶安全,具身智能还没有发展到谈意识层面安全的阶段。
上海银行作为资金提供方,主要关注资金产品如何更精准、更高效地投放到应用场景里。上海银行总行科技金融部丁武军表示,银行评估科创项目看三个“第一性原理”:能否提升生产效率、谁会买单、谁会持续买单。真正缺钱的是高校“非常非常早期”的硬科技项目。
整体来看,AI最终可能会产生意识,未来行业将走向人机共生。AI能力可以狂奔,但行业需要为行为控制、安全对齐与评估范式提前修路。







