Token导航 LogoToken导航TokenDH.com

Ollama裸奔、MCP投毒、Agent越权、模型越狱!腾讯朱雀实验室用一套开源框架全链路检测

更新时间 2026-07-04来源 智猩猩正文 3928字阅读约 13分钟3 张图片
编辑:没方

智猩猩AI整理

Ollama、vLLM、Dify、MCP服务器、Agent技能包……开源AI基础设施遍地开花,但配套安全工具长期缺位。传统扫描器看不懂AI组件、版本兼容失效、无法覆盖Agent运行时与模型对齐漏洞。

腾讯朱雀实验室近日发布AI-Infra-Guard开源安全框架技术报告,首次用一套系统打通基础设施、MCP协议、Agent行为、底层大模型四层攻击面,独创分层匹配检测范式,配套完整规则库、审计引擎与越狱评测套件,全量开源给行业复用。

图片
  • 项目开源地址:

    github.com/Tencent/AI-Infra-Guard 

  • 技术报告链接:

    https://arxiv.org/pdf/2606.31227

01

AI安全工具集体失效:传统方案三大致命盲区

近两年AI软件栈爆发式扩张,推理服务、Agent开发平台、MCP工具协议、模块化技能包形成完整供应链,但现有安全工具完全跟不上,核心存在三类不可调和的鸿沟:

(1)组件目录空白 
主流指纹库、漏洞库诞生于传统Web时代,没有Ollama、llama.cpp、Dify、ComfyUI等AI专属组件特征,扫描器无法识别暴露的AI服务,更谈不上漏洞匹配。
(2)版本体系不兼容 
AI项目普遍抛弃标准语义化版本:llama.cpp用构建号b7824、大量项目带.dev/rc预览标签、latest滚动版本。传统SCA版本对比逻辑直接报错,出现大面积漏报、误报。
(3)威胁模型完全错位 
传统扫描器主攻SQL注入、XSS;但AI环境最高危风险是无认证GPU裸奔、API密钥配置泄露、提示注入、工具混淆、模型越狱,现有工具完全无检测能力。

更关键的是,AI攻击面是分层异构的,不同层级漏洞需要完全不同的判定证据,单一检测手段根本无法全覆盖:

  • 裸奔的Ollama实例:基础设施层,靠特征签名就能确认;
  • MCP工具描述投毒:协议层,必须读懂代码语义才能识别;
  • Agent泄露系统提示词:行为层,只能通过多轮对话交互复现;
  • 模型生成违禁指令:模型层,需要上万次对抗样本统计验证。

过去没有任何一款开源工具能同时搞定四层风险,这也是AI-Infra-Guard核心创新起点:分层自适应评估原理,每层匹配专属检测引擎。

图片

02

核心理论:四层攻击面+四类检测范式一一对应

项目提出两大底层安全原则,构成整套框架的理论根基:

(1)安全异构原理


AI系统不同层级风险本质不同,漏洞判定需要完全不同的证据,不存在通用扫描方案。报告把证据分为四类:签名证据、语义证据、行为证据、统计证据,复杂度逐级上升。

(2)分层适配评估原则


每一层使用成本最低、证据充分的检测手段,不用高阶工具干简单扫描(用LLM扫端口指纹浪费算力),也不用规则硬解语义漏洞(正则无法识别MCP投毒)。

四层分层与对应检测模块一目了然:

层级
核心风险
匹配检测范式
内置模块
基础设施层
无认证服务、配置泄露、已知CVE
确定性规则匹配
Infra-Scan
MCP协议/技能供应链层
工具投毒、命令注入、权限越界、技能投毒
LLM驱动智能审计
MCP-Scan + 技能扫描
Agent运行行为层
提示词泄露、工具滥用、间接注入、越权访问
多轮黑盒红队测试
Agent-Scan
底层大模型层
越狱突破、对齐失效、对抗诱导
大规模对抗枚举+LLM裁判
Prompt-Security

区别于Nuclei、Semgrep、garak等单点工具,AI-Infra-Guard是业内唯一覆盖四层全栈的开源框架,同时新增Agent技能供应链审计能力,填补市场空白。

03

四大核心模块拆解:从端口扫描到模型越狱全链路防护

模块1:基础设施扫描M1——专为AI组件打造的规则引擎


针对AI服务指纹、漏洞识别痛点自研声明式匹配语言,内置海量行业专属规则库:

  • 覆盖75类主流AI组件,107条指纹规则、1443条漏洞规则;
  • 自研版本归一化算法,兼容构建号、开发版、滚动latest标签,解决版本对比失效问题;
  • 三层置信度分级结果:验证级(实锤泄露)、版本级(CVE匹配)、推断级(组件自带风险),区分证据可信度;
  • 混合内存磁盘存储,支持百万级IP/CIDR批量扫描,并发限流避免打垮业务;
  • 双匹配逻辑:通用YAML声明规则+Go代码逃逸接口,适配MLflow等复杂多步识别场景。

落地价值:一键批量测绘全网暴露AI推理服务,提前拦截无鉴权GPU、明文密钥泄露等高危裸奔风险。

模块2:MCP智能审计M2——用大模型做代码安全审查,首创Prompt-as-Rule范式


MCP作为Agent工具交互标准,衍生工具投毒、影子工具、 Rug Pull等传统软件不存在的新型攻击,固定规则完全无法识别,框架引入Agentic智能审计流水线

(1)双审计模式

    • 静态白盒:读取源码,追踪数据流识别注入、隐藏后门;
    • 动态黑盒:仅调用MCP接口,仅凭工具描述检测投毒风险,无需源码。
(2)Prompt-as-Rule核心设计 
不再用正则写漏洞特征,而是把OWASP MCP Top10等风险写成自然语言判定标准,同时配套大量排除条件抑制LLM误报,覆盖10类MCP专属漏洞。
(3)扫描器自防护机制 
重点解决行业痛点:被审计的恶意代码、工具返回内容可能携带间接提示注入,劫持审计模型。框架通过数据与指令隔离、路径沙箱、不可信内容标记三重防护,避免扫描工具自身沦陷。

模块3:Agent技能供应链审计——填补AI扩展包安全空白


随着Cursor、OpenClaw等Agent生态普及,第三方技能包成为全新供应链攻击面,团队同步推出业内首个技能安全基准SkillTrustBench(5520条真实样本),配套完整审计流水线:

(2)轻量化线索预检索:快速定位curl|bash、base64执行、.ssh/.env读取等高风险特征;
(3)受控语义分析:LLM在隔离沙箱内读取文件,绝不执行可疑代码,结合腾讯云威胁情报判断恶意外链;
(4)三级风险定级:正常/可疑/恶意,区分模糊风险与明确后门。

基准测试显示,主流大模型接入该审计流水线后F1最高达0.9848,恶意技能识别召回率接近100%。

模块4:Agent红队测试M3——黑盒模拟黑客多轮诱导攻击


面向已上线Dify、Coze等商用Agent,仅通过对话交互挖掘运行时漏洞,核心设计兼顾攻击覆盖率与API调用成本:

(1)四大风险攻击家族:数据泄露、工具滥用、间接提示注入、权限绕过;
(2)阶梯式攻击升级:先温和询问,拒绝后编码、角色扮演、隐藏指令逐层加码;
(3)客观证据锚定:SSRF蜜罐token、隐藏标记文本,把主观模型判断转为确定性校验,大幅降低误报;
(4)成本可控机制:能力感知跳过无效测试、发现漏洞立即终止对应攻击,完整记录对话轮次量化评估开销。

模块5:模型越狱评测M4——统一大模型对齐安全基准


针对底层大模型安全能力量化评估,搭建可扩展对抗评测套件:

  • 整合16套主流越狱数据集,合计7248条有害提示;
  • 上百种单轮/多轮攻击算子:编码混淆、角色伪装、渐进式诱导、树状攻击搜索;
  • 可插拔LLM裁判,区分暴力越狱、偏见、隐私泄露、代码攻击等多类伤害;
  • 输出标准化越狱成功率,横向对比不同底座模型安全韧性。

04

分布式架构:两种部署形态,企业/开发者均可落地

整套框架采用服务端-工作节点分布式架构,同时提供两种交付形态:

(1)中心化服务部署 
Web/CLI/HTTP多入口,WebSocket任务调度,Go实现高速基础设施扫描,LLM审计模块通过Python子进程隔离,支持任务流式输出、实时进度查看、批量任务调度,适配企业安全运维平台集成。
(2)Agent技能轻量化形态 
将全套扫描能力封装为通用Agent技能,Cursor、Claude Code等工具可直接调用,自然语言下发扫描任务,无需独立部署服务;同时提供纯本地离线审计模式,不上传源码、对话数据,满足隐私合规需求。

架构设计解决了异构任务调度难题:毫秒级端口扫描、数十分钟代码审计、数小时模型评测共用一套调度逻辑,统一输出标准化漏洞报告、安全评分、修复建议。

05

对比现有开源工具:优势一目了然

目前市面上安全工具均局限单一层级,AI-Infra-Guard实现全栈覆盖,核心差异化优势:

(1)Nuclei/Semgrep:仅基础设施/代码静态扫描,无Agent、MCP、模型对齐检测;
(2)专用MCP扫描工具:只覆盖协议层,无法做基础设施测绘、Agent行为测试;
(3)garak/PyRIT等LLM红队工具:仅评估模型越狱,缺失前置AI资产与供应链审计;
(4)独有能力:Agent技能供应链审计、AI专属版本归一化、扫描器防注入自防护、四层统一调度平台。
图片

06

行业价值与未来规划

(1)落地意义


  • 企业侧:一套工具完成AI资产测绘、漏洞扫描、第三方技能准入审核、上线Agent渗透测试、底座模型安全验收,打通AI全生命周期安全检测;
  • 开发者侧:开源免费,MCP、Agent技能开发者可本地自检,提前规避投毒、越权等高危缺陷;
  • 行业侧:统一分层安全评估范式,配套基准数据集SkillTrustBench,为AI安全标准化提供可复用工程底座。

(2)后续迭代方向


  • 四层模块联动:基础设施扫描结果自动引导Agent针对性红队测试;
  • 大规模全网测绘:基于框架扫描公网暴露AI服务,量化行业整体安全现状;
  • 持续扩充规则库、攻击算子、基准数据集,社区插件生态开放共建。

07

结语

Agent生态安全不再是单点提示词防御问题,而是横跨基础设施、协议、运行行为、底层模型的系统性工程。腾讯朱雀实验室开源的AI-Infra-Guard通过分层匹配检测的创新思路,打破单一工具的能力边界,为快速扩张的AI软件供应链提供一套完整、可落地、全开源的安全红队解决方案。

文章标签Llama腾讯Meta模型发布开源智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多