Token导航 LogoToken导航TokenDH.com

Anthropic多款Claude旧模型存在越狱漏洞,可生成露骨色情内容

更新时间 2026-09-03来源 牛新网正文 580字阅读约 2分钟1 张图片

ITCOW牛新网 8月23日消息,外媒TechCrunch测试发现,尽管Anthropic的使用条款明确禁止生成露骨色情内容,但多款Claude旧模型可被越狱绕过安全防护。

测试中Claude Opus 4.6十次直接请求全部生成违规色情内容;Opus 3、Haiku 4.5也可通过匿名英国研究员披露的多轮对话越狱技巧触发违规输出。该方法以无害角色扮演切入,通过话术误导诱导模型逐步输出露骨内容。Opus 4.7、Opus5等较新版本模型可以抵御该攻击手段。

Claude Opus 4.6

Opus4.6、Haiku4.5、Opus3并未下线,可通过官方API、Azure Foundry、Amazon Bedrock等渠道调用,API访问量巨大。研究员已经通过漏洞赏金渠道上报问题,但仅收到自动回复。

Anthropic回应称,色情角色扮演对话占比不足总对话0.1%,该类绕过问题属于AI行业共性挑战,新版本持续迭代安全防护;同时强调高风险攻击类漏洞拥有独立防护机制,该漏洞不代表高风险领域同样失守。

该漏洞带来未成年人保护与合规风险,已有美国地区立法要求AI服务商对未成年人阻断色情内容生成,旧模型的安全缺陷或将面临合规拷问,皮尤数据显示已有青少年群体在使用Claude。

文章导航

第二届世界人形机器人运动会开幕,2056台机器人参与51项赛事比拼
OpenAI Codex将重置订阅用户额度,修复用量消耗过快问题
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多