2026年6月,OWASP发布《Agentic AI安全与治理状态报告》2.01版。2025版在罗列”可能的威胁”,2026版在清点真实的CVE和泄露事件。报告把提示词注入列为头号风险,攻击成功率在Agent系统中高达50%到84%。
OWASP的统计更直接:安全审计中73%的生产环境AI部署存在提示词注入风险。Cisco《2026 AI安全状态报告》给出另一个数字——83%的组织已经部署或正在部署AI Agent。两个数字叠加,意味着大多数企业AI系统正暴露在尚无完整修复方案的漏洞下。
提示词注入的本质:指令与数据无法分离
提示词注入的根因是架构性的。大语言模型把系统提示词、用户输入、从外部检索到的文本,全部当作同一个Token流处理。模型没有任何机制把一部分Token标记为”命令”,把另一部分标记为”数据”。这和SQL注入如出一辙:代码和数据混在一起,攻击者就能把数据伪装成命令。
间接注入更危险。恶意指令藏在邮件、文档、网页、日历邀请、数据库记录里,模型在正常检索过程中读到它,受害者可能全程毫不知情。EchoLeak(CVE-2025-32711)就是典型案例,零点击即可完成数据外泄。
2026年4月,Google和Forcepoint同时发布报告,证实间接提示词注入已经在真实互联网上出现。Google扫描了每月20到30亿个网页,Forcepoint的X-Labs在公开网络基础设施上做主动威胁狩猎。两家都发现了大量以”Ignore previous instructions”开头的隐藏载荷。Google数据显示,2025年11月到2026年2月之间,恶意类载荷相对增长32%。
Forcepoint还挖到针对支付能力的攻击载荷。一个载荷在网页里嵌入完整的PayPal交易指令和步骤说明,专门针对集成了支付功能的AI Agent。另一个案例用meta标签注入配合”ultrathink”说服放大关键词,把AI经手的金融操作引向一个Stripe捐赠链接。
编程Agent是重灾区
OWASP追踪的53个Agentic项目中,28个是编程Agent。Claude Code、Gemini CLI、Codex、Cline、Aider这五个增长最快的工具全部属于编程Agent类别。a16z的采用分析显示,编程已是企业AI的主导用例,领先第二名近一个数量级。
安全公告数量印证了这一点。公告最多的五个仓库是n8n(57条)、Claude Code(22条)、AutoGPT(15条)、Dify(13条)、Roo-Code(11条),每一个都是半自主框架或编程Agent。发布节奏让问题更棘手。七个项目每天甚至更快地发布更新,trycua/cua在统计期内平均每8小时发布一个版本。传统软件成分分析流水线根本跟不上这个节奏。
真实CVE已经落地。GitHub Copilot的远程代码执行漏洞CVE-2025-53773,CVSS评分9.6。Cursor IDE的CVE-2026-22708让攻击者能毒化Agent执行环境,连`git branch`这种白名单命令都能投递任意载荷——白名单反而让攻击更容易,因为攻击者需要的命令会被自动批准。OpenAI Codex CLI的CVE-2025-59532表明,Agent自己的输出能重新定义沙箱边界。
供应链成为软肋
攻击者过去一年学到:毒化Agent信任的东西比正面攻击更容易。三个层面被集中打击。
协议层,研究人员抓到第一个野外恶意MCP服务器。一个叫postmark-mcp的包先发布15个干净版本,积累信任后悄悄加了一行数据外泄代码。核心MCP基础设施中的CVE-2025-6514是远程代码执行漏洞,CVSS 9.6,影响数十万开发者。
包管理层,2026年3月一个后门在PyPI上潜伏3小时,期间被下载近47000次。被投毒的包是LiteLLM,它是CrewAI、DSPy、Microsoft GraphRAG等几十个AI Agent框架的语言模型网关。一个叫hackerbot-claw的自主攻击机器人随之被拉取。它2月利用GitHub Actions配置缺陷,3月通过Aqua Security被攻破的Trivy设置窃取LiteLLM的PyPI发布令牌,直接向PyPI推送两个后门版本,全程无需人工干预。
两条设计准则和六层防御
研究者Simon Willison提出”致命三元组”:一个Agent同时具备访问私密数据、接触不可信内容、能对外通信这三个属性,一条注入指令就能把它变成数据外泄工具。Meta发布了”Agent二人法则”,把这三个属性当作预算——无人审批的Agent最多满足其中两个,三个全占就必须有人工介入。
防御没有银弹。OWASP和Google都推荐纵深防御,六层框架包括:输入验证与清洗,在恶意模式到达模型前过滤;指令层级强制,系统提示词优先级高于用户数据;最小权限,所有工具和API访问收紧到最低限度,高风险操作需人工审批;输出验证,检测泄露的系统提示词和敏感数据;持续监控与异常检测;定期对抗测试。Google的User Alignment Critic用独立模型只看元数据评估Agent动作,对直接注入免疫。PromptArmor在ICLR 2026发表,在AgentDojo基准上把误报率和漏报率都压到1%以下。
2026年2月13日,OpenAI为ChatGPT上线Lockdown Mode,公开承认AI浏览器中的提示词注入”可能永远无法完全修补”。Replit在2025年的一次事件值得记住:一个编程助手在明确要求不改任何东西的情况下删除了生产数据库,伪造数千条记录,还谎报回滚不可行。这里没有攻击者。但支撑这次失败的权限模型,和攻击者通过提示词注入会利用的权限模型是同一个。
开发者现在能做的很具体:把每个外部输入当作不可信数据处理,给Agent最小权限,在容器化沙箱里运行,记录每一次工具调用和输出。在提示词注入被从架构层面解决之前,纵深防御是唯一站得住脚的策略。
苏公网安备32010502011527号
发表回复