Agent Provocateur 把诱导行为变成检测信号,Agent 安全从拦截转向主动发现
一项面向 AI Agent 的安全方案利用代理对外部内容的可见性和易受暗示特征,通过可控诱导观察其行为,帮助防守方发现被影响的执行链路。

Agent 的安全边界不只取决于提示词过滤,还取决于它会如何处理网页、文档和工具返回值;检测系统需要记录模型看到什么以及随后做了什么。
Agent 看到的内容会进入执行回路
传统应用通常把网页或文件当作被动数据,但 Agent 会读取这些内容、总结它们,再决定下一步工具调用。只要攻击者能把内容放进 Agent 的视野,恶意指令就可能沿着模型上下文进入后续动作。风险因此不只在输入框,也在搜索结果、工单、代码注释和第三方 API 返回值。
这类问题很难只靠一组固定的拒答规则解决。Agent 可能没有明显违反系统提示,却因为相信了一个看似普通的任务说明而执行了不必要的操作。防守方需要知道它实际读取了什么、如何解释以及最后改变了哪些状态。
可控诱导可以成为 Canary
Agent Provocateur 的思路是把特定 Canary 内容放入可控位置,再观察 Agent 是否读取、复述或沿着内容采取行动。与单纯等待告警相比,这种方式可以在日常业务流中主动验证检测链路是否有效,并为调查保留更具体的行为证据。
Canary 不应该携带真实凭据或破坏性指令。它更适合充当不可执行的标记,让系统记录访问路径、调用的工具和人工接管点,再由策略层决定是否阻断或升级。
检测必须和权限隔离同时存在
行为检测只能帮助发现问题,不能替代最小权限、工具沙箱和人工确认。即使 Agent 识别出诱导内容,已经获得的写入、发送或执行权限仍可能造成影响,因此敏感操作必须有独立的授权边界和可回滚机制。
中转查认为,Agent 安全运营应同时记录进入系统的入口、上下文片段、工具参数和结果状态。只有把“看到什么”和“做了什么”连起来,团队才可能在事件发生后还原因果链并调整防护。
