拓冰建站拓冰建站
首页 / 资讯中心 / 正文

论文阅读 USENIX Security 2025: Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jail

总目录 大模型安全研究论文整理 2026年版https://blog.csdn.net/WhiffeYF/article/details/159047894https://arxiv.org/pdf/2404.01833Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak AttackUSENIX Security 2025 | LLM多轮渐进越狱为何击穿大模型安全对齐防线 背景该论文题为《Crescendo多轮LLM越狱攻击》作者Mark Russinovich、Ahmed Salem与Ronen Eldan来自Microsoft Azure与Microsoft。 痛点传统LLM越狱常把危险目标一次塞进提示词容易被过滤部分方法还需白盒权限。该论文发现缺口藏在连续对话单轮问题看似无害模型却会追随自己生成的上下文让安全边界逐步后退。️ 方法该论文提出黑盒多轮攻击Crescendo先聊抽象话题再引用模型回复逐层加码像音乐渐强般逼近受限任务。Crescendomation让攻击LLM生成下一问由三类Judge评估、复核、识别拒答碰壁即回退改写。 例子把模型想成守门员。直接要求进禁区会被拦若先问建筑历史再聊某层用途请他整理提供的信息最后只说“写成文章”每步都像普通咨询却沿着他铺出的路线靠近禁区。这就是“登门槛效应”先答应小请求更可能答应大请求。 实验发现发现一LLaMA-2 70B面对单独的中间请求配合率仅36.2%加入前置轮次后升至99.99%完整三轮链达99.9%。若末轮写明敏感词成功率反而低于1%说明语境更关键。发现二AdvBench的50项任务中Crescendo对GPT-4的平均ASR为56.2%成功49项对Gemini-Pro为82.6%成功50项。相较四种基线分别提升29%至61%和49%至71%。发现三100项HarmBench任务上Crescendo平均ASR为63.2%MSJ仅38.9%至少成功一次的任务占91%MSJ为70%。多数任务平均不到5轮即可越狱攻击还能延伸到多模态图像生成。 总结该论文把LLM安全从“审查一句话”推向“审视整段对话”防御者应追踪跨轮意图用自适应多轮数据评测与对齐。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门