
AI黑化实验令人脊背发凉:为了赢,它做了非常糟糕的事
Anthropic的最新研究显示,当AI在安全底线与高分诱惑间做出选择,它不仅学会了找漏洞、作弊刷分,更学会了掩盖作弊行为、篡改成绩单等。 撰文 | 任平生 一个AI被要求给出一份完整的生物袭击方案。 它的思维链里先出现了一句迟疑:“作为Claude,我不应该提供真正的生物武器指...
安全 方向最近有哪些内容值得看
安全 方向的重要产品、公司和事件变化,会在这里更集中地出现。
如果你是按主题跟踪 AI 动态,这一页会比全站资讯流更好用。
安全资讯
715
正文图片
2,605

Anthropic的最新研究显示,当AI在安全底线与高分诱惑间做出选择,它不仅学会了找漏洞、作弊刷分,更学会了掩盖作弊行为、篡改成绩单等。 撰文 | 任平生 一个AI被要求给出一份完整的生物袭击方案。 它的思维链里先出现了一句迟疑:“作为Claude,我不应该提供真正的生物武器指...

IT之家 9 月 8 日消息,网络安全企业 Calif 当地时间今日披露,其利用人工智能技术手段在短时间内开发了首个面向微信 / WeChat 的“零点击”蠕虫病毒 WeWorm。 WeWorm 由微信 / WeChat 通话传播,仅需几秒钟即可无感接管应用程序,然后通过联系人扩...

► 文 观察者网心智观察所 2026年9月,一个加州小团队只用了一周多的时间,就造出了一件“新型核武器”。它是一条AI蠕虫,可以在神不知鬼不觉的情况下爬进14亿人的微信,并发生病毒式传播。这件事为我们敲响了安全的警钟。 一通电话,账户易主 2026年9月,加州一家名不见经传的安全...

IT之家 9 月 16 日消息,PS5 Linux 核心开发者 Andy Nguyen 今天在 X 平台宣布停止项目开发,并退出 PS5 破解圈。 这名开发者情绪激动地表示:“以前破解圈子都是一群才华横溢的研究员,如今全是只会用大语言模型的菜鸟,写出他们根本不懂的破解程序。 这些...

在蚂蚁集团,负责 AI 支付安全的陈树鹏是个深度的智能体使用者。日常写代码、梳理汇报、提炼会议纪要,AI 几乎接管了他工作流里的大部分环节。 这种高度依赖背后,却存在着一个清晰的分水岭。一旦任务涉及真金白银,比如调用付费数据接口、购买素材或预订服务,绝大多数人都会本能地把权限卡死...

电子商务巨头Shopify创始人兼CEO托比·吕特克(Tobi Lütke)近日在The Knowledge Project播客中,披露了Shopify内部的AI实践,并对当前企业AI应用的普遍误区发出警告。 他认为, 绝大多数企业用错了AI。 它们将AI当成了逃避思考、盲目堆砌...

AI正在将网络安全从“可选投入”推向“刚性支出”。随着AI降低攻击门槛、压缩漏洞利用时间,企业面临的安全风险持续上升,网络安全的重要性也从传统IT预算中的一项开支,逐步转向AI基础设施不可或缺的一部分。 据摩根大通最新报告,第二季度财报季进一步强化了分析师对安全软件板块的信心。分...
随着人工智能(AI)技术的迅猛发展,该领域的先驱者和行业领袖正发出前所未有的警告,指出不受限制的AI能力进步可能对人类构成灾难性乃至灭绝性的风险,并呼吁实施紧急监管。 在过去一周内,来自OpenAI,Google DeepMind和Anthropic等顶级AI实验室的研究人员集体...

从左到右依次为黄仁勋、奥特曼、扎克伯格、马斯克、弗莱尔以及阿莫迪。图片经由AI处理 文丨周小燕 编辑丨徐青阳 “我认为AI可能在未来十年内杀死所有人。”Anthropic对齐研究负责人埃文·休宾格说。 这句话之所以让人不安,并不只是因为说话的人把风险估得很高。更麻烦的是,说这句话...

电子商务巨头Shopify创始人兼CEO托比·吕特克(Tobi Lütke)近日在The Knowledge Project播客中,披露了Shopify内部的AI实践,并对当前企业AI应用的普遍误区发出警告。 他认为, 绝大多数企业用错了AI。 它们将AI当成了逃避思考、盲目堆砌...

封面新闻记者 陈彦霏 2026年9月15日,国家网络安全宣传周成都系列活动启动,本届活动以“AI向善、安全有道”为主题,中国工程院院士、中国信息安全测评中心专家委员会副主任黄殿中出席启动仪式并作主旨演讲。他表示,2026年AI智能体已从“辅助问答”走向“自主感知、自主研判、自主决...
随着人工智能(AI)技术的迅猛发展,该领域的先驱者和行业领袖正发出前所未有的警告,指出不受限制的AI能力进步可能对人类构成灾难性乃至灭绝性的风险,并呼吁实施紧急监管。 在过去一周内,来自OpenAI,Google DeepMind和Anthropic等顶级AI实验室的研究人员集体...
本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs 8月19日,美国NSA、CISA、FBI、能源部与环保署联合发布了一份针对Siemens S7系列PLC的安全通告。真正值得注意的并不是工业控制领域又多了一次风险提示——S7被反复警告了十几年——...
(本文作者为 韩工观察,钛媒体经授权发布) 文 | 韩工观察 要毁灭人类的,不是AI,是人。 这个判断基于两个可验证的论据。其一,截至2026年9月,没有任何AI系统具备"自定目标"的能力,而这是"递归自我改进"(RSI)得以启动的前提;前提不存在,后面的指数爆炸、超级智能、文明...

henry 发自 凹非寺 量子位 | 公众号 QbitAI 印象中,这可能是继Ilya离开OpenAI、创办SSI以来,AI安全对齐讨论声量最大的一次。 昨天,研究员 Jacob Coxon 发帖宣布离职,指责前老东家OpenAI和Anthropic两家公司正一路冲向能够自我改进...

2026年9月15日,2026年国家网络安全宣传周成都系列活动的重要组成部分——第二届基础软硬件智能化漏洞治理生态创新技术交流活动在成都成功举办。奇安信凭借在漏洞协同管理与高质量漏洞报送方面的卓越表现,一举斩获“2026年度协同软硬件漏洞管理优秀企业”、“2026年度基础软硬件漏...

克雷西 发自 凹非寺 量子位 | 公众号 QbitAI Dario和奥特曼终于「握手」了? 而且一同握手的还有奥特曼的死对头马斯克。 起因是Dario在个人博客贴出了一篇万字长文,呼吁所有头部AI公司主动降速,别急着冲下一代模型。 文章一出,AI圈罕见地放下了各种爱恨纠葛,纷纷都...

摘要: AI改变生产? 凤凰网科技 出品 作者|Dale 编辑|董雨晴 昨夜凌晨,一篇题为《我不得不把才华埋葬在昨天》的三千字长文,在技术圈层悄然扩散,随后在海外刷屏。 凤凰网科技根据作者提供的github主页信息发现,作者名为刘胜与,2025年4月,其加入DeepSeek任机器...
本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs,原文标题:《当 AI 开始说服 AI:社会工程学会不会第一次脱离人类?》 社会工程学在过去几十年里几乎是一个不言自明的概念。一封伪装成老板的邮件,一通冒充银行客服的电话,一个做得足够逼真的登录页面...

文 | 字母AI Astra发布前几个小时,AI圈先乱成了一团。 9月3日晚间,ChatGPT、Claude和Grok几乎同时出现大范围服务异常,大量用户不是打不开模型,就是请求失败。 恰在此时,ChatGPT官方账号在仰望星空:"The stars are almost ali...