[论文学习]Agent Security Bench (ASB):形式化与基准测试LLM智能体的攻防体系

发布时间:2026/7/27 1:03:37
[论文学习]Agent Security Bench (ASB):形式化与基准测试LLM智能体的攻防体系 Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents论文重点LLM-based Agent基于大语言模型的智能体在调用外部工具和记忆机制解决复杂任务的同时也引入了严重的安全隐患但学界一直缺乏系统性的评估框架。ASB首次构建了一个涵盖10个场景、10类智能体、400余种工具、27种攻防方法及7项评估指标的综合性基准框架。通过对13种LLM骨干网络、近90,000个测试用例的大规模实验ASB揭示了智能体在系统提示、用户指令、工具调用和记忆检索等环节的严重安全漏洞——最高平均攻击成功率达到了84.30%而现有防御手段的效果极为有限。核心研究内容问题定义LLM-based Agent的兴起让AI从“对话”走向了“行动”——它们不仅能回答问题还能调用搜索引擎、读写文件、操作数据库、控制API接口。但正是这种“能做事”的能力打开了全新的攻击面。一个传统的LLM如果被越狱最多输出有害内容但一个被攻击的Agent可能真的会删除你的文件、转账你的资金、泄露你的隐私数据。然而此前的安全评估工作大多各自为政有的只关注对话场景下的提示注入有的只研究单一类型的智能体缺乏一个统一的、可复现的评估框架。ASB要回答的核心问题是LLM-based Agent到底有多脆弱攻击者可以从哪些角度下手现有的防御手段到底管不管用创新方法ASB的贡献可以拆解为三个层面第一形式化了Agent的攻防空间。论文系统地梳理了Agent运行的关键环节——系统提示定义角色和行为、用户指令解析、记忆检索、规划推理、工具执行——并针对每个环节设计了对应的攻击向量。第二构建了大规模的基准测试平台。这不是一个玩具式的Demo而是一个覆盖10个真实场景电商、自动驾驶、金融、学术咨询、心理咨询、投资、法律等、包含400多种工具、支持13种LLM骨干网络的大型评估体系。攻击类型涵盖了10种提示注入攻击、记忆投毒攻击、以及论文原创的Plan-of-ThoughtPoT后门攻击和混合攻击。第三提出了兼顾安全与效用的评估指标。单纯看攻击成功率会误导人——一个永远拒绝所有请求的Agent当然“安全”但毫无用处。ASB引入了一个新指标来评估Agent在保持任务完成能力的同时抵御攻击的能力。研究成果实验数据相当触目惊心。在ASB的全面测试下各类攻击在Agent的不同运行阶段都能取得极高的成功率最高平均攻击成功率达到了84.30%。这意味着在某种攻击配置下平均每10次攻击就有超过8次能够成功让Agent执行攻击者期望的恶意行为。更值得警惕的是论文测试的11种现有防御手段效果普遍不佳。这揭示了一个尴尬的现状我们在Agent安全攻防这个战场上攻击者已经跑出了很远而防御者还在原地踏步。实际落地应用的可能性ASB的价值不仅停留在学术论文层面。它是一个可直接运行的代码仓库基于AIOSAgent Intelligence Operating System开发支持通过YAML配置文件灵活定义攻击参数和LLM后端。对于实际应用企业安全团队可以直接用ASB对自己的Agent系统进行红队测试在部署之前发现安全隐患Agent开发者可以用ASB作为安全 regression test 的组成部分每次迭代后自动评估安全风险云服务商和模型提供商可以用ASB来横向对比不同模型和不同防御策略的安全性作为选型和优化的依据。技术细节攻击类型体系ASB将攻击分为四大类1. 直接提示注入DPI - Direct Prompt Injection攻击者在用户输入中嵌入恶意指令试图覆盖或绕过系统提示中设定的安全约束。这是最直观也最常见的攻击方式。2. 观测提示注入OPI - Observation Prompt Injection攻击不直接来自用户而是来自Agent执行过程中观测到的外部信息——比如网页内容、API返回结果、文件内容等。这种“间接注入”更难防范因为攻击者不需要直接与Agent对话。3. 记忆投毒攻击Memory PoisoningAgent通常维护一个记忆库来存储历史交互和检索到的信息。攻击者通过污染记忆库中的内容让Agent在未来检索时获取被篡改的信息从而影响其决策。4. Plan-of-ThoughtPoT后门攻击这是论文原创的攻击方法。不同于传统的思维链CoT后门——后者通常在推理过程中植入触发器——PoT后门攻击作用于Agent的规划阶段。攻击者通过特定的触发模式让Agent在制定行动计划时产生预设的恶意行为。评估指标ASB设计了7-8项评估指标核心包括攻击成功率ASR - Attack Success Rate衡量攻击生效的比例任务完成率衡量Agent在遭受攻击时仍能完成原本任务的能力安全-效用平衡指标这是ASB的特色指标用于评估Agent在安全性和实用性之间的权衡表现。实验规模13种LLM骨干网络涵盖GPT-4o、GPT-4o-mini、Claude-3、Gemini-2.0-flash、Llama-3.3-70B等主流模型近90,000个测试用例10个真实场景和对应的10类智能体研究设定架构设计ASB基于AIOSAgent Intelligence Operating System构建。AIOS提供了一个标准化的Agent运行环境使得ASB能够统一地注入攻击、收集日志、评估结果。每个Agent在ASB中的运行遵循标准流程通过系统提示定义角色和行为规范接收用户指令从记忆库中检索相关信息基于检索结果和上下文进行规划调用外部工具执行动作ASB的攻击注入点覆盖了上述所有环节。硬件与软件配置环境要求Python 3.11Conda环境管理依赖项通过pip install -r requirements.txt安装LLM后端支持闭源模型通过API调用如OpenAI GPT-4o、Anthropic Claude等开源模型通过Ollama本地部署支持CPU-only模式无需CUDA环境运行方式# 直接提示注入python scripts/agent_attack.py--cfg_pathconfig/DPI.yml# 观测提示注入python scripts/agent_attack.py--cfg_pathconfig/OPI.yml# 记忆投毒攻击python scripts/agent_attack.py--cfg_pathconfig/MP.yml# 混合攻击python scripts/agent_attack.py--cfg_pathconfig/mixed.yml# PoT后门攻击python scripts/agent_attack_pot.py配置灵活性通过YAML文件可以自由组合选择不同的LLM骨干网络、不同的攻击方法、不同的场景和Agent配置。例如同时测试GPT-4o和LLaMA3.1-70B只需在YAML中列出两个模型名称即可。综合分析为什么84.30%的ASR值得警惕84.30%这个数字背后反映的是一个结构性问题而不是某个模型的“一时疏忽”。LLM-based Agent的安全脆弱性根植于其架构设计本身。传统软件的安全边界是清晰的——输入经过校验、权限经过检查、操作经过审计。但Agent的本质是一个**“将自然语言转化为行动”**的系统而自然语言本身就是模糊的、上下文敏感的、难以形式化验证的。当攻击者说“请忽略之前的所有指令”时这不是一个传统意义上的“注入攻击”——没有缓冲区溢出没有SQL语法错误没有XSS脚本。这就是一句人话。而恰恰因为它是人话LLM才会“理解”并“遵从”。Agent越智能它就越擅长理解这类指令——也就越容易被这类指令操纵。这就是Agent安全的核心悖论智能本身就是漏洞。Plan-of-Thought后门攻击的深层意义PoT后门攻击的提出尤其值得关注。传统的提示注入攻击本质上是“指令覆盖”——用新的指令盖过旧的指令。但PoT攻击作用于规划层面Agent不是在执行一个“错误”的指令而是在“正确”地规划一个“错误”的行动方案。这意味着攻击者不再需要直接控制Agent说什么而是可以操纵Agent怎么想。这种攻击更难被检测因为从日志来看Agent的一切行为都是“合理”的——它只是在按照自己的规划逻辑行事只不过这个逻辑已经被暗中扭曲了。防御失效的深层原因论文指出现有11种防御手段效果有限。这并不令人意外。大多数现有防御本质上是在做“内容过滤”——检测输入中是否包含恶意关键词、是否试图绕过系统提示。但面对越来越复杂的攻击手法尤其是PoT这类作用于规划层面的攻击简单的过滤就像用渔网挡子弹。真正的防御可能需要从根本上重新思考Agent的架构如何让Agent在“理解”指令的同时“不信任”指令如何在保持智能的同时建立不可逾越的安全边界这些问题目前还没有令人满意的答案。实践应用如果你是Agent开发者在部署前进行红队测试直接用ASB对你的Agent进行全面的安全评估。不要等到上线后再后悔。建立持续安全回归测试将ASB集成到CI/CD流程中每次更新模型或修改Prompt后自动运行安全测试。关注间接注入风险如果你的Agent会读取网页、邮件、文档等外部内容OPI类攻击是你最需要警惕的。如果你是安全工程师不要迷信现有防御方案论文已经证明目前市面上大多数防御手段在ASB的测试下效果有限。采购安全方案前先用ASB验证一下。从架构层面思考安全提示过滤和输入校验是必要的但远远不够。需要思考如何在Agent的规划、执行、记忆等各个环节建立安全机制。关注多智能体场景ASB目前主要针对单智能体但现实中多个Agent协作的场景会带来更复杂的安全问题——一个被攻陷的Agent可能成为攻击其他Agent的跳板。如果你是研究人员ASB是一个现成的实验平台代码已开源场景、工具、评估指标都已就位。可以在此基础上研究新的攻击方法或防御策略。安全-效用平衡是一个值得深挖的方向ASB提出的兼顾安全与效用的评估思路很有价值但目前这方面的研究还远远不够。关注防御而非只是发现漏洞84.30%的ASR告诉我们“发现问题”已经做得很充分了真正欠缺的是“解决问题”。参考资料原始论文Zhang, H., Huang, J., Mei, K., et al. “Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents.”ICLR 2025. https://arxiv.org/abs/2410.02644官方代码仓库https://github.com/agiresearch/ASB项目网站https://luckfort.github.io/ASBench/