智猩猩AI整理
Ollama、vLLM、Dify、MCP服务器、Agent技能包……开源AI基础设施遍地开花,但配套安全工具长期缺位。传统扫描器看不懂AI组件、版本兼容失效、无法覆盖Agent运行时与模型对齐漏洞。
腾讯朱雀实验室近日发布AI-Infra-Guard开源安全框架技术报告,首次用一套系统打通基础设施、MCP协议、Agent行为、底层大模型四层攻击面,独创分层匹配检测范式,配套完整规则库、审计引擎与越狱评测套件,全量开源给行业复用。

项目开源地址:
github.com/Tencent/AI-Infra-Guard
技术报告链接:
https://arxiv.org/pdf/2606.31227
01
AI安全工具集体失效:传统方案三大致命盲区
近两年AI软件栈爆发式扩张,推理服务、Agent开发平台、MCP工具协议、模块化技能包形成完整供应链,但现有安全工具完全跟不上,核心存在三类不可调和的鸿沟:
更关键的是,AI攻击面是分层异构的,不同层级漏洞需要完全不同的判定证据,单一检测手段根本无法全覆盖:
- 裸奔的Ollama实例:基础设施层,靠特征签名就能确认;
- MCP工具描述投毒:协议层,必须读懂代码语义才能识别;
- Agent泄露系统提示词:行为层,只能通过多轮对话交互复现;
- 模型生成违禁指令:模型层,需要上万次对抗样本统计验证。
过去没有任何一款开源工具能同时搞定四层风险,这也是AI-Infra-Guard核心创新起点:分层自适应评估原理,每层匹配专属检测引擎。

02
核心理论:四层攻击面+四类检测范式一一对应
项目提出两大底层安全原则,构成整套框架的理论根基:
(1)安全异构原理
AI系统不同层级风险本质不同,漏洞判定需要完全不同的证据,不存在通用扫描方案。报告把证据分为四类:签名证据、语义证据、行为证据、统计证据,复杂度逐级上升。
(2)分层适配评估原则
每一层使用成本最低、证据充分的检测手段,不用高阶工具干简单扫描(用LLM扫端口指纹浪费算力),也不用规则硬解语义漏洞(正则无法识别MCP投毒)。
四层分层与对应检测模块一目了然:
层级 | 核心风险 | 匹配检测范式 | 内置模块 |
|---|---|---|---|
基础设施层 | 无认证服务、配置泄露、已知CVE | 确定性规则匹配 | Infra-Scan |
MCP协议/技能供应链层 | 工具投毒、命令注入、权限越界、技能投毒 | LLM驱动智能审计 | MCP-Scan + 技能扫描 |
Agent运行行为层 | 提示词泄露、工具滥用、间接注入、越权访问 | 多轮黑盒红队测试 | Agent-Scan |
底层大模型层 | 越狱突破、对齐失效、对抗诱导 | 大规模对抗枚举+LLM裁判 | Prompt-Security |
区别于Nuclei、Semgrep、garak等单点工具,AI-Infra-Guard是业内唯一覆盖四层全栈的开源框架,同时新增Agent技能供应链审计能力,填补市场空白。
03
四大核心模块拆解:从端口扫描到模型越狱全链路防护
模块1:基础设施扫描M1——专为AI组件打造的规则引擎
针对AI服务指纹、漏洞识别痛点自研声明式匹配语言,内置海量行业专属规则库:
- 覆盖75类主流AI组件,107条指纹规则、1443条漏洞规则;
- 自研版本归一化算法,兼容构建号、开发版、滚动latest标签,解决版本对比失效问题;
- 三层置信度分级结果:验证级(实锤泄露)、版本级(CVE匹配)、推断级(组件自带风险),区分证据可信度;
- 混合内存磁盘存储,支持百万级IP/CIDR批量扫描,并发限流避免打垮业务;
- 双匹配逻辑:通用YAML声明规则+Go代码逃逸接口,适配MLflow等复杂多步识别场景。
落地价值:一键批量测绘全网暴露AI推理服务,提前拦截无鉴权GPU、明文密钥泄露等高危裸奔风险。
模块2:MCP智能审计M2——用大模型做代码安全审查,首创Prompt-as-Rule范式
MCP作为Agent工具交互标准,衍生工具投毒、影子工具、 Rug Pull等传统软件不存在的新型攻击,固定规则完全无法识别,框架引入Agentic智能审计流水线:
- 静态白盒:读取源码,追踪数据流识别注入、隐藏后门;
- 动态黑盒:仅调用MCP接口,仅凭工具描述检测投毒风险,无需源码。
模块3:Agent技能供应链审计——填补AI扩展包安全空白
随着Cursor、OpenClaw等Agent生态普及,第三方技能包成为全新供应链攻击面,团队同步推出业内首个技能安全基准SkillTrustBench(5520条真实样本),配套完整审计流水线:
基准测试显示,主流大模型接入该审计流水线后F1最高达0.9848,恶意技能识别召回率接近100%。
模块4:Agent红队测试M3——黑盒模拟黑客多轮诱导攻击
面向已上线Dify、Coze等商用Agent,仅通过对话交互挖掘运行时漏洞,核心设计兼顾攻击覆盖率与API调用成本:
模块5:模型越狱评测M4——统一大模型对齐安全基准
针对底层大模型安全能力量化评估,搭建可扩展对抗评测套件:
- 整合16套主流越狱数据集,合计7248条有害提示;
- 上百种单轮/多轮攻击算子:编码混淆、角色伪装、渐进式诱导、树状攻击搜索;
- 可插拔LLM裁判,区分暴力越狱、偏见、隐私泄露、代码攻击等多类伤害;
- 输出标准化越狱成功率,横向对比不同底座模型安全韧性。
04
分布式架构:两种部署形态,企业/开发者均可落地
整套框架采用服务端-工作节点分布式架构,同时提供两种交付形态:
架构设计解决了异构任务调度难题:毫秒级端口扫描、数十分钟代码审计、数小时模型评测共用一套调度逻辑,统一输出标准化漏洞报告、安全评分、修复建议。
05
对比现有开源工具:优势一目了然
目前市面上安全工具均局限单一层级,AI-Infra-Guard实现全栈覆盖,核心差异化优势:

06
行业价值与未来规划
(1)落地意义
- 企业侧:一套工具完成AI资产测绘、漏洞扫描、第三方技能准入审核、上线Agent渗透测试、底座模型安全验收,打通AI全生命周期安全检测;
- 开发者侧:开源免费,MCP、Agent技能开发者可本地自检,提前规避投毒、越权等高危缺陷;
- 行业侧:统一分层安全评估范式,配套基准数据集SkillTrustBench,为AI安全标准化提供可复用工程底座。
(2)后续迭代方向
- 四层模块联动:基础设施扫描结果自动引导Agent针对性红队测试;
- 大规模全网测绘:基于框架扫描公网暴露AI服务,量化行业整体安全现状;
- 持续扩充规则库、攻击算子、基准数据集,社区插件生态开放共建。
07
结语
Agent生态安全不再是单点提示词防御问题,而是横跨基础设施、协议、运行行为、底层模型的系统性工程。腾讯朱雀实验室开源的AI-Infra-Guard通过分层匹配检测的创新思路,打破单一工具的能力边界,为快速扩张的AI软件供应链提供一套完整、可落地、全开源的安全红队解决方案。







