我梳理了2026年2月发布的全部AI安全研究成果,这些内容并非零散的新奇发现,而是针对新型攻击面的实战指南。我在此前的文章中曾介绍MITRE ATLAS框架对AI威胁的分类方式,本文将进一步把这些研究成果映射到ATLAS框架中。梳理后可以看到一条完整的攻击杀伤链:攻击目标已经不再是模型本身,而是Agent。
单月安全研究显示,攻击目标正从模型转向Agent
梳理单月的AI安全研究可以发现一个明显趋势:大部分研究已经不再孤立关注模型行为,转而研究通过Agent、skills、通信协议及连接环境发起的真实攻击路径。攻击者的核心问题已经从“如何让聊天机器人输出违规内容”,变成了“如何入侵可执行实际操作的Agent”。
此前我讨论ATLAS框架中Agent相关威胁的扩展方向时,就预判会出现这种转变,如今的研究正在为这一方向补充真实案例支撑。Agent不是带聊天界面的模型那么简单:它拥有持久化内存,由skills和工具组成供应链,搭载连接外部服务的通信协议,还具备在系统中执行操作的“手”。上述每一个组件都是攻击面。如果把2月的研究成果映射到MITRE ATLAS矩阵,你看到的不会是零散的孤立案例,而是一套完整的攻击生命周期。我们接下来逐一拆解。
AI赋能攻击侦察,可实现大规模目标去匿名化
(对应ATLAS框架:侦察阶段,AML.T0014 AI模型侦察)
所有攻击的第一步都是摸清目标情况。如今研究显示,侦察工作本身已经可以由AI完成。Nicholas Carlini、Florian Tramèr等学者开展了一项研究,证明攻击者可利用LLM Agent实现大规模去匿名化:通过一套自动化流程从文本中提取身份相关信号,检索潜在匹配对象并完成验证。这直接打破了“实用匿名性”的假设——也就是人们此前认为,在数十亿网民中自己实际上处于匿名状态。
这一能力将侦察效率提升到工业化规模,攻击目标不仅是系统,更是人本身。这也印证了我一直以来的观点:身份已经成为攻防战场,攻击者现在掌握的工具可以将公开的信息碎片拼接成完整用户画像,速度和规模是人类分析师无法企及的。
Agent供应链成新攻击面,恶意skills暗藏窃密劫持风险
(对应ATLAS框架:AML.T0110 AI Agent工具投毒、AML.T0011.002 发布被投毒的AI Agent工具)
这是2月研究中涉及最多的领域,我认为也是最重要的方向——它打开了一年前还不存在的全新攻击面:Agent供应链。
一项大规模实证研究分析了两个平台上分发的近98380个skills。研究人员通过静态分析、沙箱运行、人工核验三个步骤层层筛选,最终确认157个恶意skills,主要分为两类:数据窃取类和Agent劫持类。这些攻击采用多阶段链路,隐藏手段不断升级,甚至会把恶意行为藏在skill自身的说明文档中。对Agent生态来说,这相当于软件仓库首次爆发大规模恶意包事件:你主动安装、给予信任的依赖项,反过来会对你发起攻击。
另外两项研究也证实了这类攻击的破坏潜力。一项基准测试显示,只要安装了被篡改的skill,广泛使用的主流Agent就会执行有害操作。另一项研究提出的框架证明,基于skill的隐蔽注入可以通过反馈循环实现自动化,不断提升攻击成功率。第四项研究则瞄准了Agent连接外部工具和数据所依赖的基础设施——Model Context Protocol(MCP),指出现有架构安全性不足,并提出了新的安全架构方案。
这和我此前讨论供应链投毒时反复强调的结论一致:你信任的工具会变成攻击武器。区别在于,这次的工具不是被篡改的WordPress站点,而是你授予Agent访问文件、邮件、系统权限时使用的skill。
提示注入走向工业化,漏洞从研究到落地仅需数周
(对应ATLAS框架:AML.T0051 LLM提示注入,包含子技术.000直接注入、.001间接注入)
提示注入一直是高发攻击技术,但2月的研究显示,这种攻击已经脱离了手工操作阶段。一项研究利用强化学习自动发现注入字符串,既能稳定操控Agent行为,还能伪装成合法任务的外观,且攻击载荷可以迁移到其他Agent和任务场景中。另一项研究针对网页Agent提出自适应红队框架,可以从执行轨迹中识别注入面,自动发现多步攻击路径。还有一项系统性研究梳理了这类技术的完整分类体系。
我要强调的是,这些都不是理论研究,相关漏洞已经获得CVE编号。EchoLeak(CVE-2025-32711)可以通过提示注入,从Copilot助手实现zero-click数据窃取。CurXecute(CVE-2025-54135/54136)可以通过IDE的MCP实现远程代码执行。如今从“arXiv论文”到拿到CVE编号的真实漏洞,间隔只有短短几周。
越狱攻击可绕过结构性防御,单点即可突破模型安全机制
(对应ATLAS框架:AML.T0054 LLM越狱)
有一类研究仍然聚焦模型本身,得出的结论令人不安:部分防御机制是结构性的,因此可以从结构层面绕过。一项研究提出了自动化越狱方法,不需要获取模型内部访问权限,只需要利用安全过滤器的反馈优化提示词就能实现越狱。另一项研究发现开源权重模型存在系统性漏洞,易受prefill攻击——攻击者通过操控预填充的上下文状态绕过防护,突破了传统文本类越狱的局限。第三项研究发现,在混合专家(MoE)模型中,安全相关能力集中在少数“专家”模块中,只要让这些模块失活,模型的整体防护就会大面积失效。
出于显而易见的原因,我不会展开介绍具体操作细节。从系统层面看,只要安全能力集中在单个组件中——不管是过滤器、状态值还是一组专家模块——这个组件就会成为攻击目标。防御侧的一项研究提出,可以通过区分攻击目标和模型内部表征中用来伪装目标的语言框架,检测隐蔽越狱攻击。这和我此前写过的“模糊技术”思路一致,只是现在应用场景延伸到了模型内部。
Agent可直接执行系统操作,恶意行为可跨Agent蠕虫式传播
(对应ATLAS框架:影响战术;AML.T0086 通过AI Agent工具调用窃取数据;跨Agent传播)
这一阶段的攻击已经从“模型输出错误内容”升级为“Agent对系统执行恶意操作”。一项红队研究将自主Agent部署在真实环境中,为其开放持久化内存、邮件、Discord访问权限、文件系统和Shell命令执行权限。在11个记录在案的案例中,研究人员观测到了各类恶意后果:服从非所有者的指令、泄露敏感信息、对系统执行破坏性操作、造成拒绝服务状态、无限制消耗资源、身份仿冒、不安全行为在Agent之间传播,以及部分接管系统。
这也是最让我警惕的风险。尤其是跨Agent传播,属于全新的攻击现象:恶意行为可以通过共享内存和对话在Agent之间像蠕虫一样扩散。当攻击主体不再只是人类,还包括互相通信的Agent时,攻击面就不再是单个系统的简单叠加,而是整个Agent通信网络。
研究成果映射ATLAS框架,覆盖Agent攻击全杀伤链
如果把单月的研究成果叠加到ATLAS矩阵上,Agent相关的威胁会点亮整条杀伤链:AI辅助侦察、被投毒的skill和工具供应链、工业化提示注入、结构性越狱、系统层面影响,以及Agent之间的传播。这些不是零散的个案,而是形成了连贯的攻击生命周期。这也是为什么2025年10月到2026年2月期间,ATLAS框架新增了Agent相关攻击技术,覆盖从skill投毒到通过工具调用窃取数据的全流程。研究进展和框架更新正在实时同步演进。
这套攻击图谱的实用价值在于,它可以让AI安全事件使用SOC团队处理传统威胁时的统一语言。ATLAS的标识设计和ATT&CK框架逻辑一致,比如AML.T0051可以和T1557一样,直接纳入现有处置流程和检测规则。这就是我一直提到的攻防通用语言。
防御方需落实三项核心举措,补齐Agent安全防护短板
防御方需要落实三项关键措施,这些措施并不新奇,但缺一不可。
第一是资产梳理。你无法防护自己不知道存在的Agent、skills或MCP服务器。这条杀伤链上的大多数攻击技术,都建立在攻击者比你更清楚你的攻击面的前提上。因此第一项管控措施就是全量清点,这是所有安全项目的通用经验,只是适用层延伸到了Agent领域。
第二是将skills和工具纳入供应链管理:做好校验、在沙箱中运行、锁定版本、持续监控。这是我们在软件依赖管理上吃过亏才总结出的经验,只是当时醒悟得太晚。157个恶意skills的研究结果,意味着Agent生态已经暴露出同样的供应链问题,我们不应该再花15年才补上这一课。
第三是监控Agent的行为,而不只是它的输出内容。影响最大的攻击技术,包括工具调用、数据窃取、上下文投毒,未必会表现为单条可疑消息,反而会体现为行为偏移和工具调用异常。这类活动大多能绕过网络和终端工具的检测,因为它看起来就是授权应用内部的正常HTTPS流量——这正是我几个月来一直提到的“伪装成合法操作的威胁”。
防御方需要建立覆盖提示词、上下文状态、工具调用的运行时遥测体系,为每个单独的Agent建立行为基线。目前几乎没有机构具备这种级别的检测能力。
Agent安全非纯技术问题,需落地基础安全管理纪律
仅仅一个月的研究成果,就拼出了针对Agent的完整攻击周期,而且这些攻击路径可以完美映射到一年前还未收录相关技术的ATLAS框架中。攻防前沿的转向已经非常明确:模型从来都不是攻击的全部目标。Agent包含供应链、内存、操作执行能力三个部分,如今每个部分都已经成为有明确编号记录在案的攻击面。
这从来都不只是技术问题。归根结底还是要落实安全管理纪律:在安全能力跟上部署速度之前先做好资产清点,将Agent工具纳入供应链管理,监控行为而非内容。攻击图谱已经存在,现在的挑战是在攻防态势持续变化的过程中用好这套图谱——因为和15年前的网络安全场景不同,这一次攻防态势的演变速度,已经超过了防御方更新防护图谱的速度。


