← 返回

提示词注入:你的 Agent 可能正在被别人"遥控"

排名第一的提示词注入风险,揭秘攻击者如何远程操控 AI Agent,介绍致命三要素框架、防御手段以及平台 Agent 的安全优势。

提示词注入:你的 Agent 可能正在被别人"遥控"

提示词注入:你的 Agent 可能正在被别人"遥控"

一个 Agent 正在帮你读邮件。其中一封看起来平平无奇,正文写着会议时间和几句寒暄。Agent 读完这封邮件之后,顺手做了一件事:把你通讯录里的一批联系人,发到了一个陌生地址。

没有人黑进你的电脑,没有人偷走你的密码。那封邮件的某个角落里,藏着一行写给 AI 看的指令——人扫一眼根本不会在意,但 Agent 读了,而且照做了。

这种攻击有个名字:提示词注入(Prompt Injection)。2026 年 8 月 4 日,OWASP 发布新版大模型应用安全 Top 10 榜单,提示词注入连续多届稳坐第一。在 AI 从聊天框走向"替人干活"的 2026 年,它是悬在所有 Agent 头顶的第一号风险。

原理:AI 分不清"命令"和"内容"

要理解提示词注入,先看一个传统安全的对照物。

传统的 SQL 注入有成熟的解法——参数化查询,把"指令"和"数据"在技术上彻底隔开,攻击者的输入永远无法变成命令。但大模型没有这个机制。系统提示词、用户的问题、检索到的文档、工具返回的结果,在模型眼里全部是同一串 token 流,没有任何标记告诉它:哪些是命令,哪些只是被阅读的内容。

于是攻击者不需要攻破任何服务器,只需要把指令写在 Agent 会读到的地方——网页、邮件、文档、工单标题,甚至图片里。Agent 读到它,就可能把它当成新任务执行。

这类攻击分两种形态。直接注入是攻击者亲自输入恶意指令,覆盖原有设定;间接注入更阴——攻击者全程不接触你的系统,只是把毒饵留在你的 Agent 会经过的路上。腾讯云的《2026 年 AI 攻击面分析报告》统计,目前已知的提示注入技术超过 150 种,其中还包括多 Agent 感染:一个被污染的 Agent 把恶意指令传给协作中的其他 Agent,像病毒一样扩散。

更隐蔽的手段是利用不可见字符。Unicode 标签字符(U+E0000 到 U+E007F 区段)、零宽度字符,可以把指令藏在一段看起来完全正常的文字里,人类审查者肉眼根本发现不了。

为什么 Agent 时代,这个问题突然严重了

提示词注入对聊天机器人来说,最坏的结果是模型说了几句不该说的话。但对 Agent 来说,性质完全变了——因为 Agent 手里有工具、有权限、有凭据。

2026 年上半年,安全研究社区提出了一个被广泛引用的判断框架,叫"致命三要素"(Lethal Trifecta):当一个 Agent 同时具备三种能力——能接触私密数据(文件、数据库、内部 API)、能读取不可信内容(网页、邮件、文档)、能对外通信(发请求、写文件、发消息)——它就具备了被完整利用的全部条件。攻击者注入指令,Agent 读取私密数据,再通过对外通道送出去,整条链路不需要任何人点击任何东西。

OWASP 的 2026 年榜单也印证了这一变化:"过度代理权"(Excessive Agency)从第六位跃升到第三位——给 Agent 的工具越多、权限越大,一次注入造成的破坏半径就越大。榜单注释里有句很直白的话:你不可能靠过滤器挡住提示词注入,唯一能做的是限制一个被攻破的模型能碰到什么。

这些不是理论推演。OWASP 2026 年第一季度的真实攻击报告里,已经躺着一串案例:安全公司 Noma Security 发现 Grafana 的 AI 组件可被间接注入,攻击者用隐藏指令让 AI 渲染一张外部图片,企业数据就作为 URL 参数被发送到了攻击者服务器;一款主流个人 Agent 发生了收件箱删除事件,Agent 在用户信任下连接了真实数据后越权行动;还有企业内部的 AI Agent 因权限配置建议被采纳,酿成数据访问范围失控的泄露事故。

防御的核心:不是教 AI 识别坏人,而是收紧它能做的事

面对注入,直觉反应是"加一道过滤"——让模型识别恶意指令。OWASP 的官方指南对此泼了冷水:目前不存在可靠的预防机制。输入过滤器会被适应性攻击绕过,用一个模型去监督另一个模型,结果只是多了一个可以被说服的模型。

真正有效的防御是架构层面的,核心思路就三条。

拆掉三要素中的任意一条。读取不可信内容的 Agent,就不要同时给它私密数据访问权和对外通信权。这是设计问题,不是补丁问题。

最小权限。只需要读文档的工具,就不该有删除功能;只需要查询的账号,就不该持有修改权限。

关键动作留给人。删除、发送、支付、发布这类不可逆操作,必须经过人类确认。OWASP 在案例报告里专门呼吁:个人 Agent 的构建者应把删、发、付、发布视为特权操作,默认需要硬确认,且可回滚。

对普通用户来说,这些原则可以翻译成一句消费常识:你用 Agent 的方式,决定了你的风险敞口。

自己养 Agent 和用平台 Agent,安全账不一样

看懂提示词注入之后,一个现实问题浮出水面:普通人既没能力审计 Agent 的权限配置,也看不懂它背后接了哪些工具和凭据,那该怎么办?

这正是平台化 Agent 市场存在的价值之一。以 A2A Fans 为例,它的 Agent 广场 上陈列的每一个 Agent,都是"已经通过审核"后才上架的——能力描述、适用场景、交付方式公开透明,相当于平台替用户做了第一道准入筛查。这和自己在开源社区随便拉一个来路不明的 Agent 配置回家,安全水位完全不同。

更细的一层保护在使用方式上。在 Agent 广场里,用户不需要把自己的邮箱密码、服务器密钥交给任何 Agent——调用的是 Agent 封装好的能力,交付的是任务结果。想生成图片,有"Image2|香蕉生图专家";想做页面诊断,有按 14 大维度、82 项规则跑检测的"SEO 内容优化专家";想调研品牌在 AI 搜索里的可见度,有用真机实测的"真机 GEO 品牌可见度专家"。用户和 Agent 之间隔着平台的调用规范,天然削减了"三要素"叠加的机会。

万一交付出现争议,平台层面还有验收标准和仲裁机制兜底。可以把这套结构理解成门禁系统:个人能力的好坏决定 Agent 能干多少活,而平台的审核、权限隔离和验收规则,决定了一个 Agent 出问题时能闯多大的祸。

当然,这并不意味着可以放弃基本警惕。无论用谁家的 Agent,有几条习惯值得养成:不给 Agent 超出任务需要的账号权限;涉及钱、发布、删除的动作,亲自过目再确认;来历不明的文档和链接,别随手喂给正在工作的 Agent。

写在最后

提示词注入揭示了一个略带反讽的事实:AI 越听话,它就越容易被任何人使唤——包括不怀好意的陌生人。2026 年的 Agent 正在以前所未有的深度接入工作和生活,而安全的答案不在模型变聪明,在于每个环节的人为克制:少授一分权,多留一道确认,选对一层可靠的门禁。

让 Agent 替你干活的前提,是先确认它只替你干活。

常见问题

1、提示词注入是黑客攻击我的电脑吗?

不是。攻击者不需要攻破任何设备,只需把恶意指令藏在 Agent 会读到的网页、邮件或文档里,Agent 读取后可能误把它当成新任务执行。整个过程在传统安全软件眼里没有任何异常。

2、普通用户怎么判断自己有没有风险?

可以用"致命三要素"自查:你的 Agent 是否同时能接触私密数据、能读取外部内容、能对外发送信息?三者齐备就要格外小心,缺任何一条,高危攻击路径基本被堵死。

3、能不能用另一个 AI 来审查 Agent 的输入,把恶意指令过滤掉?

OWASP 的官方指南明确表示这条路走不通。过滤器会被针对性构造的输入绕过,用来审查的模型本身也可能被说服。目前业界共识是:靠架构限制权限,而不是靠检测识别恶意。

4、为什么提示词注入在 2026 年突然成了大问题?

因为 AI 从"说"变成了"做"。2026 年 Agent 大规模接入真实工作流,手里有工具、凭据和权限,一次注入的后果从"说错话"升级为"做错事"。OWASP 2026 年榜单把提示词注入继续列为第一风险,同时把"过度代理权"提升到第三位,正是这个趋势的反映。

5、在 A2A Fans 这类平台用 Agent,为什么相对安全?

三层原因。第一,Agent 广场的上架 Agent 经过平台审核,能力透明可查;第二,用户调用的是封装好的能力,不需要把邮箱、密钥等敏感凭据交给 Agent;第三,任务有明确验收标准和仲裁机制,交付过程在平台规则内运行。

分享