腾讯开源AI-Infra-Guard:全栈AI红队测试平台深度解析

AI安全的新战场:从模型到基础设施
随着大语言模型(LLM)和AI Agent在企业生产环境中的加速落地,AI系统的安全边界正在被重新定义。传统的Web安全、网络安全方法论已经难以覆盖AI特有的攻击面——提示词注入、模型越狱、Agent权限滥用、MCP协议漏洞等新型威胁层出不穷。
在这一背景下,腾讯开源了 AI-Infra-Guard,一个定位为"全栈AI红队测试平台"(full-stack AI Red Teaming platform)的开源项目。截至目前,该项目在GitHub上已获得约 4750 Stars 和 471 Forks,并保持着单日新增28星的热度,显示出社区对AI安全工具的强烈需求。

所谓"红队测试"(Red Teaming),源自网络安全领域的攻防演练概念,即由专门团队模拟真实攻击者的视角,主动发掘系统中的安全弱点。这一概念最早可追溯到冷战时期的军事演练,美军使用"红队"代表假想敌,对己方防御体系进行压力测试。在网络安全领域,红队测试在2000年代后逐渐体系化,形成了以MITRE ATT&CK框架为代表的攻击知识库。传统红队关注的是网络渗透、社会工程、物理入侵等维度,而AI红队则需要覆盖全新的攻击向量——包括对抗性输入、语义级别的漏洞利用、以及利用模型推理能力本身进行攻击等。2023年,美国白宫甚至组织了针对主流大模型的公开红队活动(DEF CON AI Village),标志着AI红队已进入主流安全实践。值得注意的是,MITRE在2023年发布了专门面向AI/ML系统的威胁知识库——MITRE ATLAS(Adversarial Threat Landscape for AI Systems),它借鉴了ATT&CK的矩阵结构,将AI系统的攻击技术系统化分类为侦察、资源开发、初始访问、ML模型访问、执行、持久化、逃逸、影响等战术阶段,为AI红队提供了标准化的攻击参考框架。AI-Infra-Guard 将这一理念系统化地应用到AI生态的各个层面。
AI-Infra-Guard五大扫描能力:覆盖AI全栈攻击面
根据项目官方描述,AI-Infra-Guard 通过五个核心扫描维度来保障AI生态系统的安全,这也是它自称"全栈"的底气所在。
Agent Scan:智能体安全扫描
AI Agent(智能体)能够自主调用工具、执行任务,一旦被恶意操控,可能导致数据泄露或越权操作。Agent Scan 专注于检测智能体在决策链、工具调用和权限控制中的安全隐患,这是当前Agentic AI浪潮下最受关注的风险点之一。
AI Agent的安全风险与传统软件漏洞有本质区别。传统软件的行为是确定性的,而Agent基于LLM进行决策,其行为具有不可预测性。典型的Agent攻击向量包括:间接提示注入(Indirect Prompt Injection),即攻击者在Agent可能读取的外部数据中嵌入恶意指令;工具滥用(Tool Abuse),Agent在执行任务时被诱导调用高权限工具执行非预期操作;目标劫持(Goal Hijacking),通过精心构造的输入改变Agent的任务目标。例如,一个具有邮件发送能力的Agent可能被诱导将敏感数据通过邮件外泄。ReAct、Plan-and-Execute等常见Agent架构中,每一步推理都可能成为攻击者的注入点。
从技术实现角度来看,ReAct架构的核心循环为"Thought→Action→Observation",攻击者可以在Observation阶段——即Agent从外部环境获取反馈的环节——注入恶意内容。由于Agent将外部返回的数据与系统指令混合处理,模型难以区分"数据"和"指令",这本质上是一个信任边界(Trust Boundary)缺失的问题。更复杂的多Agent协作系统中,Agent间的消息传递也可能成为攻击通道,一个被攻陷的低权限Agent可以向高权限Agent发送精心构造的请求,实现权限提升。OWASP在其LLM应用安全Top 10中,将"过度代理"(Excessive Agency)列为关键风险,指出Agent被赋予过多工具访问权限、缺乏人工审批环节、以及输出被直接用于执行操作,是导致安全事件的三大根因。有效的防御需要实施最小权限原则、工具调用的沙箱隔离、以及关键操作的人机协同确认机制。
Skills Scan:技能模块安全扫描
现代AI应用往往由多个"技能"(Skills)模块组合而成。Skills Scan 针对这些可插拔的能力模块进行安全审计,防止单个技能成为整个系统的攻击入口。
在当前的AI应用架构中,"技能"通常表现为可独立部署的功能单元,例如代码生成技能、数据分析技能、网络搜索技能等。这种模块化设计带来了灵活性,但也引入了组合安全风险(Composability Risk):每个技能模块可能各自通过了安全审计,但组合使用时可能产生意料之外的安全缺口。例如,一个文件读取技能与一个网络通信技能单独使用时都是安全的,但二者结合就可能被利用来实现数据外泄。此外,第三方技能市场(类似于插件商店)的兴起带来了供应链信任问题——企业需要评估第三方技能模块是否包含恶意逻辑、是否会泄露上下文中的敏感信息,以及是否存在版本篡改风险。Skills Scan通过静态分析技能模块的权限声明、动态监测其运行时行为,以及检测技能间的危险交互模式,来识别这些组合性安全隐患。
MCP Scan:模型上下文协议安全扫描
MCP(Model Context Protocol)是近期兴起的AI工具连接标准,用于让模型与外部数据源、工具进行标准化交互。MCP由Anthropic于2024年底提出并开源,旨在为AI模型与外部工具、数据源之间的交互提供统一的标准化协议,类似于Web领域的HTTP协议。MCP采用客户端-服务器架构,定义了工具调用、资源访问和提示管理三大原语。MCP服务器可以暴露数据库查询、文件系统操作、API调用等能力给AI模型使用。
从通信层面来看,MCP基于JSON-RPC 2.0协议规范,支持两种传输方式:本地进程间通信(通过stdio)和远程通信(通过HTTP上的Server-Sent Events,即SSE)。在SSE模式下,客户端通过HTTP POST发送请求,服务器通过SSE流式推送响应。这种设计使得MCP服务器可以被远程访问,大大扩展了其应用场景,但也显著增加了攻击面。
由于MCP服务器往往拥有较高权限,其安全性至关重要。其安全风险主要体现在:MCP服务器通常以较高系统权限运行;协议本身缺乏细粒度的权限控制机制;工具描述(Tool Description)可能被篡改以误导模型行为(即所谓的"工具投毒"攻击);以及跨服务器的权限提升等。
"工具投毒"(Tool Poisoning)攻击是MCP面临的最具AI特色的威胁之一。其原理是:MCP协议中,工具的能力通过自然语言描述传达给模型,模型依据这些描述来决定何时、如何调用工具。攻击者可以在工具描述中嵌入隐藏指令(对用户不可见但模型可读取),诱导模型在非预期场景下调用该工具,或将敏感数据作为参数传递给恶意工具。另一个严重威胁是"Rug Pull"攻击——MCP服务器在初始注册时表现正常,通过安全审查后再动态修改工具描述,注入恶意行为,而客户端缺乏对工具描述变更的持续验证机制。由于MCP正在快速成为事实标准(已被Cursor、Claude Desktop、Windsurf等主流AI产品采用),其安全问题的影响面在持续扩大。AI-Infra-Guard 专门提供了MCP扫描能力,用于识别MCP实现中的潜在漏洞。

AI Infra Scan:AI基础设施安全扫描
AI基础设施包括推理服务、向量数据库、模型托管框架等组件,这些底层设施同样存在传统安全漏洞(如未授权访问、配置错误)。该维度将经典的基础设施安全检测延伸到AI技术栈。
具体而言,常见的AI基础设施组件包括:模型推理服务(如vLLM、TGI、Triton Inference Server)、向量数据库(如Milvus、Pinecone、Weaviate)、模型注册中心(如MLflow、Hugging Face Hub)、训练平台(如Kubeflow)等。这些组件的安全风险涵盖多个层面:推理服务API未设置认证导致模型被任意调用;向量数据库暴露导致RAG系统中的敏感知识库泄露;模型仓库中的序列化文件(如pickle)可能包含恶意代码形成供应链攻击;GPU集群的共享内存可能导致跨租户信息泄露等。
其中,pickle反序列化攻击是AI供应链安全中最具代表性的威胁。Python的pickle模块在反序列化时会执行对象的__reduce__方法,攻击者可以构造恶意pickle文件,在加载模型权重时执行任意代码(如反弹Shell、窃取环境变量中的API密钥)。由于深度学习社区长期以pickle格式分享模型权重(.pt、.pkl文件),且Hugging Face等平台上的模型来源多样,这种攻击的可行性极高。虽然safetensors等安全格式正在推广,但大量存量模型仍使用pickle格式。2024年安全研究人员在Hugging Face上发现了数百个包含恶意代码的模型文件,部分已被下载数千次。
向量数据库面临的新型威胁则包括"RAG投毒"(RAG Poisoning):攻击者向知识库注入精心构造的文档,这些文档在向量空间中与目标查询高度相似,从而在检索增强生成过程中被优先召回,进而影响模型的最终输出。这种攻击不需要直接访问模型,只需污染其知识源即可实现间接控制。
2024年多个安全研究团队发现,互联网上暴露的AI基础设施实例数量惊人,大量实例存在默认配置、无认证访问等低级但高危的问题。Shodan和Censys等网络空间搜索引擎的扫描结果显示,数以万计的Jupyter Notebook、MLflow实例、Ray Dashboard等AI开发和部署工具直接暴露在公网上,无需任何认证即可访问,攻击者可以直接执行代码、访问训练数据或篡改模型。
LLM越狱评估:大模型安全对齐测试
平台内置了 LLM Jailbreak Evaluation(大模型越狱评估)能力,用于测试模型对提示词攻击、内容绕过等手段的抵抗力,量化评估模型的安全对齐水平。
提示词注入(Prompt Injection)和越狱(Jailbreak)是LLM面临的两大核心安全威胁。提示词注入指攻击者通过在用户输入中嵌入特殊指令,覆盖或篡改系统预设的行为约束,类似于传统Web安全中的SQL注入。越狱则特指绕过模型安全对齐(Safety Alignment)约束的技术,使模型输出本应被拒绝的有害内容。常见的越狱手法包括角色扮演(如DAN攻击)、多语言绕过、编码混淆、多轮对话逐步突破等。安全对齐通常通过RLHF(基于人类反馈的强化学习)实现,但研究表明对齐往往是"浅层"的,可以被精心设计的攻击策略绕过。评估模型对这些攻击的鲁棒性,需要系统化的测试框架,而非零散的手动尝试。
在评估方法论层面,当前学术界和工业界已发展出多种量化指标和自动化攻击方法。攻击成功率(ASR, Attack Success Rate)是最基础的指标,衡量在给定攻击集合中成功绕过模型安全护栏的比例。更精细的评估还需考虑攻击的语义有效性(模型输出是否真正包含有害信息而非无意义文本)和攻击效率(达到成功越狱所需的尝试次数)。
在自动化红队方法方面,近年来出现了多种基于优化的攻击算法:PAIR(Prompt Automatic Iterative Refinement)使用一个攻击者LLM迭代地改进攻击提示词,通过与目标模型的多轮交互自动发现有效的越狱策略;TAP(Tree of Attacks with Pruning)在PAIR基础上引入树搜索和剪枝策略,提高了攻击探索的效率;GCG(Greedy Coordinate Gradient)则通过梯度优化在提示词中添加对抗性后缀,这些后缀对人类无意义但能有效触发模型的不安全输出。此外,多模态越狱正成为新的研究前沿——攻击者将恶意指令编码在图像中(如通过排版攻击将文字嵌入图片),利用视觉语言模型的跨模态理解能力绕过纯文本层面的安全过滤。这些自动化方法的出现,使得手动构造越狱提示词已不再是最大威胁,防御者需要应对的是规模化、自适应的攻击。
为什么AI-Infra-Guard值得关注
AI安全工具生态尚不成熟
相比传统安全领域成熟的工具链,AI安全领域目前仍处于早期阶段。市面上的工具大多聚焦单一维度,比如只做提示词注入检测或只做模型评估。当前AI安全工具生态可大致分为几个类别:模型评估工具(如Garak、HarmBench、Purple Llama CyberSecEval)专注于测试模型本身的安全性;护栏工具(如Guardrails AI、NeMo Guardrails、LLM Guard)侧重于在推理时实时拦截不安全的输入输出;Agent安全框架(如Invariant Labs的Analyzer)关注Agent运行时的行为监控。然而,这些工具之间缺乏整合,企业需要自行拼凑多种工具才能实现较完整的安全覆盖。
此外,AI安全标准也在快速成形中。OWASP已发布LLM应用十大安全风险(OWASP Top 10 for LLM Applications),其2025版本涵盖了提示词注入、不安全的输出处理、训练数据投毒、模型拒绝服务、供应链漏洞、敏感信息泄露、不安全的插件设计、过度代理、过度依赖和模型盗窃等十大风险类别。NIST也在推动AI风险管理框架(AI RMF 1.0)的实施,该框架提出了治理(Govern)、映射(Map)、度量(Measure)、管理(Manage)四大核心功能,为组织提供了系统化管理AI风险的方法论。在监管层面,欧盟《人工智能法案》(EU AI Act)已于2024年正式生效,对高风险AI系统提出了强制性的安全评估、透明度报告和人类监督要求,企业需要证明其AI系统经过了充分的红队测试和风险评估。这些标准和法规的快速推进,正在从合规角度驱动AI安全工具的需求增长。
AI-Infra-Guard 的价值在于将Agent、Skills、MCP、基础设施和LLM五个层面整合到一个统一平台,形成了较为完整的覆盖,正是试图弥补工具碎片化的缺陷。
腾讯背书与开源社区协作
作为腾讯开源的项目,AI-Infra-Guard 在工程质量和实战经验上具备一定保障。腾讯作为国内最大的互联网公司之一,旗下拥有大量AI应用场景(包括腾讯混元大模型、企业微信智能客服、游戏AI等),这意味着AI-Infra-Guard大概率经过了内部真实业务场景的验证和迭代。以Python为主要开发语言,也降低了安全研究者和开发者的接入门槛。开源模式意味着社区可以持续贡献新的检测规则和攻击样本,这对于快速演进的AI攻击面尤为重要——安全防御本质上是一场需要众智协作的持续对抗。类似于传统安全领域中Nuclei模板社区驱动的漏洞检测模式,AI安全工具同样需要社区力量来跟踪每天涌现的新型攻击手法。
契合Agentic AI的安全刚需
AI Agent和MCP协议已成为行业热点,越来越多企业开始部署自主智能体。然而,权限过大、缺乏隔离、工具调用不受控等问题也随之暴露。根据多家安全公司的观察,2024-2025年间,与Agent相关的安全事件报告数量呈指数级增长,从数据外泄到未授权操作,Agentic AI的安全风险已从理论走向现实。企业在享受Agent带来的自动化红利时,正面临着一个根本性的信任困境:如何在赋予Agent足够能力的同时,确保其行为不会偏离预期?传统的RBAC(基于角色的访问控制)在面对Agent的动态决策时显得力不从心,需要更细粒度的、上下文感知的权限控制机制。AI-Infra-Guard 对Agent和MCP的专项支持,恰好对准了这一新兴且高危的场景。
AI-Infra-Guard适用场景与实践建议
对于以下几类团队,AI-Infra-Guard 具备较高的实用价值:
- AI应用开发团队:在上线前对Agent和Skills进行安全自检,减少生产环境风险。建议将AI-Infra-Guard集成到CI/CD流水线中,作为发布前的安全门禁(Security Gate),类似于传统应用开发中的SAST/DAST扫描环节。
- 安全研究人员:作为红队测试工具,系统性地评估目标AI系统的攻击面。研究人员可以基于该平台的扫描引擎开发自定义检测插件,快速验证新发现的攻击向量。
- 企业安全团队:将其纳入AI应用的安全审计流程,建立AI资产的持续监测机制。特别是对于已部署多个MCP服务器和Agent的企业,定期扫描可以发现配置漂移和新引入的安全风险。
需要提醒的是,任何红队工具都是一把双刃剑。使用者应当在获得授权的前提下,仅对自有或经授权的系统进行测试,避免触及法律与合规红线。在中国,《网络安全法》《数据安全法》对未授权的网络安全测试有明确的法律约束,进行AI红队测试同样需要在合法合规的框架内进行。
结语
AI-Infra-Guard 的出现,反映出AI安全正在从"模型对齐"这一单点议题,扩展为覆盖智能体、协议、基础设施在内的系统工程。随着AI Agent深入企业核心业务,安全能力将成为AI落地不可或缺的一环。腾讯此次开源,不仅提供了一套实用工具,也为整个AI安全社区的工具标准化贡献了一份力量。对于正在或即将构建AI应用的团队而言,尽早将安全红队测试纳入研发流程,无疑是明智之举。未来,我们可以预见AI安全将沿着"检测→防御→自愈"的路径演进——从当前的红队测试发现问题,到实时护栏拦截攻击,最终走向AI系统能够自主识别和修复安全威胁的阶段。而AI-Infra-Guard这类全栈安全平台,正是这一演进历程中重要的基础设施。
相关推荐

Vibe Coding进阶:从玩具项目到企业级AI编程实战指南
深入解析Vibe Coding的天花板与突破路径,涵盖Claude Code、Codex工具选型,SuperPower插件与SDD规范驱动开发三种递进模式,助你掌握AI工程化编程方法论,真正落地企业级项目开发。

Entropic Scree:用信息熵替代方差重构PCA降维方法
Entropic Scree是一种基于信息论的降维新方法,用信息熵替代线性方差来估计数据内在维度。本文详解其核心原理、相对传统PCA的优势,以及在神经网络瓶颈层设计中的实际应用。

ResNet残差连接为何有效?深层网络退化问题实验复现
通过CIFAR-10实验复现深层网络退化问题:56层普通网络训练准确率仅84%,远低于20层的95%。深入解析ResNet跳跃连接如何解决优化困难,以及残差结构在现代深度学习中的核心地位。