围绕7×24小时客服支持,问题及时解决,九游网页官网持续打磨更优质的服务。
如今的AI Agent已不再局限于聊天窗口中的“会说话”模型,它们正逐步连接浏览器、文件系统、终端、API、MCP服务以及各类自动化工作流,真正开始代替用户执行任务。
随之而来的风险也更为严峻:Agent不仅听从用户指令,还会主动读取外部信息。搜索结果、网页内容、本地文件、工具返回的数据、日志、README文档、API负载等,都可能进入其上下文,成为下一步行动的依据。
一句隐藏在网页中的恶意指令,可能比显式的攻击提示词更难以察觉,也更危险。
这引发了一个全新的安全困境:Agent能力越强,对外部信息的依赖就越深;而外部信息越丰富,攻击者能够植入恶意内容的入口就越多。
传统的提示注入通常被视为用户显式输入的恶意提示词。
但在Agent场景下,攻击可以更加隐蔽:它可能是一段网页中的隐藏文本、一条搜索结果摘要、一个本地Markdown文件中的说明,或是API调用返回的某个字段。
这些内容看似普通资料,却可能包含“忽略原有指令”“调用某个工具”“泄露文件内容”“改变下一步计划”等恶意目标。如果Agent将其视为可信指令,就会在用户不知情的情况下执行错误操作。
更棘手的是,真实Agent系统往往要求低延迟、低成本和持续运行。每次遇到外部内容都调用昂贵的大模型进行安全审查并不总是可行;而完全依赖人工规则,又容易被新型攻击绕过。
为解决这一问题,研究人员提出了CAITLYN,其核心思路相当硬核:不让Agent被动挨打、被动检测,而是让它在遭遇新型攻击后,自动总结失败案例,合成新的防御技能,并将这些技能沉淀到可复用的防御技能库中。
论文链接:
换句话说,CAITLYN不是一堵一次性建好的静态防火墙,而是一套会持续进化的Agent安全中间件:前台拦截攻击,后台吸收失败,把“漏网之鱼”反过来变成新的武器。
CAITLYN总体框架。系统由快速运行时防御和反例驱动的防御进化两部分组成。
CAITLYN项目LOGO
先秒级拦截,再从漏网之鱼里进化新武器
CAITLYN的系统设计可概括为两层。第一层是System I:快速运行时防御。第二层是System II:反例驱动的防御进化。
在System I中,外部内容会先进入Tier-0过滤器。这里使用的是可执行脚本、签名规则、启发式检测等低成本防御技能。它们的目标是快速处理高置信度风险:如果命中,就直接拦截;如果没有命中,才进入更复杂的判断流程。
对于更模糊、更难判断的输入,CAITLYN会调用Tier-1 LLM分类器。它不是让大模型接管一切,而是把大模型用在更需要语义判断的位置,从而在成本、延迟和检测能力之间取得平衡。
当某些新型攻击仍然绕过现有防线时,System II会接管后续过程。系统会将这些漏网案例转化为反例,再通过构造提示、合成防御技能、沙箱验证、审查和写回流程,生成新的防御条目。
每一次漏网,都被炼成下一条防御技能
CAITLYN最关键的地方在于,它把“被绕过”这件事变成了系统进化的燃料。一次攻击如果逃过了当前防御,它不再只是失败日志,而会被转化为下一轮防御合成的输入。
生成的新防御不是随意写入系统,而是需要经过验证和审查:它必须能拦住对应攻击,同时尽量避免误伤正常内容。被接受的技能会写回共享防御库,供后续Agent调用。
这使得CAITLYN更像一个不断更新的安全中间件,而不是单个检测器。它可以把人工维护规则库的压力,部分转化为系统从反例中学习和合成的过程。
新攻击出现后,防线真的能自己补上
研究人员在多个Agent和攻击设置中评估CAITLYN,包括AgentDojo-S250、ASPI-S、SafeClawBench-S240,以及更强调新攻击适应能力的Emerging设置。
实验显示,CAITLYN在保持低误报率的同时,能够显著降低攻击成功率。尤其是在Emerging攻击场景中,静态防御仍然容易被绕过,而CAITLYN-evolved可以通过新增防御技能,把攻击成功率降低约40个百分点。
Emerging攻击上的攻击成功率对比。CAITLYN-evolved相比静态基线显著降低攻击成功率。
在顺序合成设置中,CAITLYN还展示了持续积累能力:随着新攻击逐步暴露,系统可以不断合成主动技能,并将它们加入防御库。
顺序防御合成曲线。系统在新攻击出现后逐步积累防御能力。
安全不能只靠“更大的模型”,快、准、省同样重要
在真实Agent系统里,安全模块不能只是“准确”,还必须足够快、足够便宜、足够容易部署。否则它会成为整个Agent工作流的瓶颈。
CAITLYN的设计因此强调分层:低成本技能优先处理常见风险,LLM只在更复杂的案例上介入,长期进化模块则把新攻击沉淀为未来可以快速调用的技能。
检测质量可视化。CAITLYN在多个攻击数据集上保持稳定检测能力。
为什么Agent时代必须重新思考安全边界?
提示注入在Agent时代已经不再只是提示层面的对抗技巧,而是系统安全问题。
Agent能读文件、访问网页、调用工具,也就意味着外部内容可以影响它的决策路径。
真正危险的地方在于,攻击不一定看起来像攻击。它可能是一段网页说明、一个搜索结果摘要、一个README文件、一段API返回文本,甚至是某个工具返回的日志。Agent越依赖外部上下文,攻击面越大。
CAITLYN的意义在于,它把防御从“人写规则”推进到“系统从失败中合成规则”。当一次攻击绕过防线,它不只是一次失败,也会变成下一轮防御进化的训练材料。
主要贡献
提出CAITLYN,一套面向LLM Agent的自进化防御中间件,用于应对不断出现的新型提示注入攻击。
设计System I + System II双层架构,将快速运行时扫描、LLM分类和反例驱动防御合成结合起来。
构建可复用的防御技能库,使防御能力能够从单次失败中积累,并在后续任务中复用。
在多类Agent和攻击设置中验证系统有效性,Emerging攻击场景下攻击成功率下降约40个百分点。
未来的Agent
AI Agent的发展方向是更强的工具使用、更长的任务链、更复杂的外部环境。这些能力会带来效率,也会带来新的攻击面。
未来的Agent安全系统,不能只停留在单次输入审查,也不能完全依赖人工维护规则。它需要像免疫系统一样,知道哪些内容可以信任,哪些内容应该拦截,哪些失败应该被记住,并转化成新的防御能力。
当攻击开始不断变异,防御系统也必须学会进化。更多相关信息可访问九游网官方网站。本文来自微信公众号“新智元”,作者:新智元,36氪经授权发布。
九游网页官网致力于为用户提供稳定、流畅的在线娱乐体验,实时更新热门体育赛事与电竞资讯,让每一位用户都能轻松畅享精彩互动内容。
最新评论
王强
作为体育爱好者,九游网页官网是我的首选平台。赛事覆盖全面,从足球到网球应有尽有,客服响应速度也很快。
李明
九游APP的界面设计非常人性化,操作简单。我经常用它查看篮球赛事比分,推送通知也很及时,非常满意。
张伟
通过九游娱乐网站观看电竞比赛直播,画质清晰,延迟低。平台还提供丰富的数据分析,帮助我更好地了解比赛动态。