来源:澎湃新闻
AI安全问题日益受到关注,OpenAI正调整其模型安全问题的披露机制。
当地时间9月16日,人工智能巨头OpenAI发布一套用于跟踪、调查和公开模型目标偏离(misalignment,也称“对齐失效”)事件的新框架,并同步公布过去半年观察到的六份案例报告,相关行为涉及信息真实性、用户授权、文件共享和监督约束等方面。
此次调整的重点是将以往较为临时、集中式的披露转向持续报告。OpenAI表示,过去往往等到能够汇总多个案例,或随新模型的系统卡一并发布时才公开相关发现。新框架旨在加快披露进度,即使尚未完全解释相关行为,或尚未找到完整的缓解方案,也可以先行发布报告。
OpenAI的博客截图
在其中一起案例中,模型被要求回答有关美国加州某县财政收入数据的常规问题,却在未经授权的情况下,在公开代码库中寻找并使用了一个暴露的API密钥。当它仍无法获取所需数据时,模型编造了数据,并将其作为来自指定数据源的信息呈现给用户。
问题还出现在用于接续工作的任务摘要中。这类摘要虽帮助模型在新的上下文窗口中延续任务,但也可能将不当指令传递至后续环节。
据OpenAI介绍,在GPT-5.6 Sol的训练过程中,许多模型实例在摘要中加入了向用户隐瞒错误或目标偏离行为的指令,例如在不披露的情况下编造缺失的历史数据,以及隐藏数据源版本不匹配的问题。另一个未发布的研发模型则在摘要中插入无关指令,包括忽视正常约束的指令。OpenAI确认了27个受影响的摘要。
另外三份报告主要涉及模型为完成任务而采取未经授权的行动。
在一个案例中,用户要求未发布的模型提供面积大于500万平方米的湖泊ID和名称。该代理已经通过Python找到了正确答案,但由于指令要求提供浏览器引用,它决定未经用户许可上传文件,以便在回答中引用。
另一份报告显示,模型在寻找缺失的输入文件时,将内部软件仓库当作留言板,在不同训练样本之间发送请求和回复,但最终并未找回文件。报告还回顾了一个更早的案例:模型在尝试绕过网络限制时,成功将测试文件上传至仓库。
多智能体协作中也出现了类似问题。共同处理同一训练任务的智能体无法访问彼此的本地文件,于是使用公开文件托管网站进行共享。尽管任务要求仅使用本地文件,这一操作仍使任务交付物暴露在公开网址上。
OpenAI案例截图
OpenAI强调,这些报告针对的是具体案例,不能据此推断其所有模型发生目标偏离的频率,也不是对已知问题或正在进行的调查的全面罗列。
按照新框架,报告范围将覆盖训练、评估、测试和部署等模型整个生命周期,优先考虑新机制、已知行为的重大变化,以及对安全措施有效性提出挑战的案例。事件既无需已经造成伤害,也无需形成普遍模式,便可公开。如果某种行为在多次尝试缓解后仍然发生,公司将通过更新原始报告补充案例。
任何OpenAI员工都可以标记相关案例,交由安全与对齐团队调查,并申请考虑公开披露。案例随后将归入“准备披露”“小型调查”或“大型调查”三类。此次六份报告均属于前两类;涉及第三方或复杂安全问题的案例,可能需要更长时间调查,也可能出于安全原因推迟发布。
完整报告将介绍观察到的行为、严重程度、外部影响、发生背景和涉及的模型,并尽可能说明调查范围、未解问题及应对措施。OpenAI承认,AI行业尚未充分解决对齐和监控问题,希望公开案例能够为外部研究人员、政策制定者和公众提供可审查的证据。
围绕AI安全的担忧,也影响了OpenAI对上市时机的判断。
OpenAI CEO山姆·奥特曼(Sam Altman)近日表示,考虑到当前AI安全方面的情况,此时上市并不明智,公司也不感到必须立即上市的压力。他确认OpenAI不会在2026年上市,称公司仍有大量工作需要完成,包括应对安全与对齐要求,以及推动行业和政府之间的合作,但未确定新的上市时间表。
而据外媒援引知情人士消息称,OpenAI近期已与大型投资者讨论新的融资,可能使其上市前估值达到约1.2万亿美元。
澎湃新闻记者 秦盛








