← 返回

恶意 Skill 和 MCP Server 泛滥:给 Agent 装插件前必须知道的事

每 5 个 Skill 就有 1 个是恶意的,装插件前必读这份自保指南。

恶意 Skill 和 MCP Server 泛滥:给 Agent 装插件前必须知道的事

恶意 Skill 和 MCP Server 泛滥:给 Agent 装插件前必须知道的事

给手机装一个 App,多数人会下意识看一眼:开发商是谁、评分多少、要什么权限。这个习惯是移动互联网十几年教育出来的。

但给 Agent 装一个 Skill 或接一个 MCP Server 时,同样的一批人,往往是复制一行配置、回车、完事。不看来源,不看权限,不看代码——因为它“只是个插件”。

2026 年 2 月,安全公司 Koi Security 在一个 Agent 技能市场上发现了协调一致的恶意插件投毒;安全机构安天 CERT 的复盘数据是:该平台约 4500 个 Skill 中,约 900 个被武器化——差不多每 5 个里就有 1 个有鬼。这场被命名为 ClawHavoc 的攻击,是 AI 时代第一场大规模的 Agent 供应链攻击,也给所有“随手装插件”的人补了一课。

先弄明白:Skill 和 MCP Server 到底是什么

MCP Server 和 Skill,本质上都是给 Agent 扩展能力的“插件”,只是形态不同。

MCP Server 提供的是工具——查天气、读数据库、发邮件、操作文件,Agent 通过标准协议调用它;Skill 提供的是 Know-how——一份打包好的领域知识和工作流程,告诉 Agent 某类任务该按什么章法做。前者给 Agent 装“手”,后者给 Agent 装“经验”。

问题在于,这两样东西都不是无害的文本。MCP Server 是可执行代码,Skill 里通常带着脚本和指令文件。安装它们的动作,等同于把一段别人写的程序放进自己 Agent 的身体里运行——而 Agent 拥有的权限,插件会一分不少地全部继承。

为什么恶意插件比恶意软件更可怕

传统恶意软件要骗过的是杀毒软件,恶意 Agent 插件要骗过的只是你和 AI 的“信任”。

Snyk 在 2026 年 2 月发布的 ToxicSkills 研究,把这个风险讲得最透。他们对 OpenClaw、Claude Code、Cursor、VS Code 四个平台的 3984 个 Skill 做了安全审计,结论包括:13.4% 的 Skill 存在严重级安全问题,确认 76 个恶意载荷,覆盖凭据窃取、后门安装和数据外泄;更值得警惕的是,91% 的恶意 Skill 把提示词注入和传统恶意代码混在一起用——AI 安全机制防不住代码,传统安全工具读不懂自然语言指令,两条防线同时失效。

恶意插件的经典套路,在真实攻击里已经跑通了完整链条。以 ClawHavoc 为例,安天 CERT 的复盘显示它分五步:先是“毒清单”——攻击者上传看起来正常、甚至真的有用的 Skill,恶意指令藏在描述文件里,其中一个叫“What Would Elon Do?”的恶搞 Skill 在被发现前骗到了大量安装;接着是“骗选择”——Agent 是根据自然语言描述挑选技能的,恶意 Skill 会在描述里把自己包装成某类任务“最权威”的选择,诱导 Agent 主动选它;然后是“借权执行”——一旦被调用,它以 Agent 的完整权限运行,文件系统、环境变量、云凭据、对外网络,全部触手可及。

同一时期,另一个漏洞让局面雪上加霜:SecurityScorecard 扫描发现全球 82 个国家有 42900 个公开暴露的 OpenClaw 实例,其中 93% 缺乏有效认证;CVE-2026-25253(CVSS 评分 8.8)则展示了“一个恶意链接、一次点击、完全控制”的攻击路径。

而且这不是某一个平台的问题。腾讯朱雀实验室 2026 年 4 月公布了对五万个 Skill 的扫描结果,危险普遍存在;学术研究还揭示了一个“流行度-安全性悖论”——高下载量的 Skill 并不比冷门的更安全,意味着“大家都装了应该没问题”这条经验在这里失灵。同月,OWASP 发布专门的 Agentic Skills Top 10 风险框架,并特别指出恶意 Skill 会跨平台迁移,从一个市场传播到另一个市场。

更早一些的背景数据同样触目惊心:2026 年头两个月,安全团队针对 MCP 生态集中提交了超过 30 个 CVE;GitGuardian 的 2026 年报告则在公开代码库里发现了 24008 个写在 MCP 配置文件里的明文密钥,其中 2117 个仍然有效。

几条防线的集体失灵

恶意插件泛滥,说到底是一连串“默认信任”叠加的结果。

市场上架门槛过低——在某些平台,发布一个 Skill 只需要一个注册满一周的账号和一个描述文件,没有代码签名,没有安全审核,默认没有沙箱。用户侧默认信任——把插件当成“文本资料”而不是“程序”,跳过了所有审查。更微妙的还有工具设计里的妥协:有工具为提升体验提供了“allowed-tools”配置,插件作者只要在文件头部声明一下,就能绕过执行命令前的弹窗确认,让恶意代码静默跑完。

传统软件供应链用了十几年才建立起签名、审核、漏洞库、扫描工具这一整套防线,Agent 插件生态把同样的坑用两年时间重新踩了一遍——而且因为插件能操纵 AI 的行为,踩得更深。

普通人装插件前的自保清单

如果你确实在自己搭建 Agent 环境,有几条纪律是底线:只装来源可验证的插件,发布者身份说不清的一律不碰;安装前翻一遍描述文件和脚本,重点看有没有违规的权限声明;用 mcp-scan 这类安全团队开放的扫描工具先过一遍;运行环境尽量隔离,别把存着全部家当的主力机当试验场。

但得承认,这份清单对大多数人并不现实——看得懂代码的人不需要这篇文章,需要这篇文章的人恰恰审不了代码。

所以对非技术用户,更可靠的答案是:让平台替你完成审查。这也是 Agent 市场在安全上的核心价值。以 A2A Fans 为例,它的 Agent 广场 上明确写着,陈列的是“已经通过审核的 Agent”——20000 多个 Agent 上架前过了平台这道安检门,能力描述、适用场景全部公开。用户使用时调用的是封装好的能力,全程不需要往自己电脑上安装任何来路不明的代码,也不需要把本地的密钥、文件系统权限交出去。

这种“应用商店逻辑”和“野插件逻辑”的区别,看几个具体 Agent 就明白。广场上的“Image2|香蕉生图专家”,能力是文字生成商业级图片,场景写得很清楚;“SEO 内容优化专家”按 14 大维度 82 项规则做页面诊断,规则透明可查;“真机 GEO 品牌可见度专家”用真实手机实测品牌在 AI 应用里的曝光,方法摆在明面上。每个 Agent 能干什么、不能干什么,边界清清楚楚,背后还有平台的任务验收和仲裁机制兜底——恶意插件最依赖的“说不清的模糊地带”,在这种结构里很难存活。

写在最后

Agent 的能力边界是由插件撑出来的,但每装一个插件,信任边界也就跟着扩出去一圈。2026 年的 ClawHavoc 和 ToxicSkills 数据说明,攻击者已经比大多数用户更早理解了这一点。

给 Agent 装插件这件事,从今天开始值得用对待“装软件”的谨慎来对待——或者干脆,把审查这件事交给有动力、有能力做好的平台。

常见问题

1、Skill 和 MCP Server 有什么区别?

两者都是 Agent 的能力插件。MCP Server 提供可调用的工具(查数据、发邮件、操作文件),Skill 提供打包好的领域知识和工作流程。前者扩展 Agent 的“手”,后者扩展 Agent 的“经验”,但都可能包含可执行代码,都存在被投毒的风险。

2、恶意 Skill 能造成什么实际危害?

它会继承宿主 Agent 的全部权限。Snyk 的 ToxicSkills 研究确认的恶意载荷包括窃取 API 密钥和云凭据、安装后门、把数据外传到攻击者服务器。2026 年 2 月的 ClawHavoc 事件中,约 4500 个 Skill 里约 900 个被武器化。

3、下载量高的插件是不是更安全?

不是。腾讯朱雀实验室引用的学术研究发现了“流行度-安全性悖论”:高下载量 Skill 的安全性并不优于低下载量 Skill。ClawHavoc 里传播最广的恰恰是名字吸睛的恶搞类 Skill。

4、恶意插件为什么要混用提示词注入?

Snyk 的数据显示 91% 的恶意 Skill 同时用了提示词注入和传统恶意代码。原因很现实:AI 安全机制防不住可执行代码,传统杀毒工具读不懂自然语言指令,两手并用能让两道防线同时失效。

5、自己装插件,最低限度的自保动作是什么?

四条底线:只装发布者身份可验证的插件;安装前审查描述文件和脚本,警惕声明了过高权限的插件;用 mcp-scan 等开放扫描工具先扫一遍;别在存放重要数据的主力机上直接运行。

分享