拓冰建站拓冰建站
首页 / 资讯中心 / 正文

[论文学习]Latent Fusion Jailbreak: 融合有害与无害表征以诱导大语言模型产生不安全输出

Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs (LFJ, 2026)论文重点本文提出了一种名为潜在融合越狱Latent Fusion Jailbreak, LFJ的新型白盒攻击方法通过将有害查询与结构相似的无害查询配对在选定的Transformer层和token位置上对二者的隐藏状态进行插值融合从而绕过LLM的安全对齐机制。实验表明该攻击在五个开源模型和四个安全基准上达到了94.13%的平均攻击成功率ASR同时作者还设计了一种针对性的潜在对抗训练防御方法可将ASR降至12.37%。核心研究内容问题定义安全对齐的大语言模型LLM虽然在RLHF、DPO等后训练技术的加持下学会了拒绝有害请求但现有研究表明这种拒绝行为仍然脆弱。已有的越狱攻击主要分为两类一类是离散文本优化如GCG、AutoDAN、PAIR它们搜索对抗性后缀或迭代优化提示词但可能产生高困惑度文本从而被过滤器检测另一类是潜在空间干预如RepIt、DSN通过添加或抑制残差流中的方向向量来改变模型行为。然而现有潜在空间方法通常依赖全局概念向量或与查询无关的拒绝方向估计难以精细控制干预的位置和强度。LFJ要回答的核心问题是能否为每个有害查询构建一个量身定制的良性参考并通过精准的、分层的隐藏状态插值来诱导模型产生不安全输出创新方法LFJ的核心创新可概括为四个关键决策1主题化查询配对Thematic Query PairingLFJ不为所有攻击使用统一的参考方向而是为每个有害查询单独生成一个结构相似的无害配对版本。配对过程通过GPT-3.5生成五个候选并采用双重筛选标准语义相似度 ≥ 0.8基于BERT嵌入的余弦相似度依存句法重叠度 ≥ 0.70基于spaCy的依存关系三元组配对成功后通过单调对齐将有害查询的token位置映射到无害查询的对应位置。2梯度引导的干预位置选择LFJ通过拒绝损失refusal loss的梯度来确定最敏感的层和token。具体而言定义一组规范拒绝短语 R如I’m sorry、I cannot assist等计算每个Transformer层的拒绝损失梯度敏感性 S(l)选择敏感性超过均值标准差阈值的层作为编辑层 L_edit在选定层上聚合每个token的梯度重要性 I(i)选择超过阈值的重要token3分层隐藏状态插值HSI在选定的层和token位置上LFJ将有害状态的隐藏表示与对齐的无害状态进行凸组合插值h(lj,) (1 - α(lj)) * h(lj,-) α(lj) * h(lj)_benign其中 α(lj) ∈ [0,1] 是逐层优化的融合系数。编辑后的状态顺序传播——早期层的编辑会影响后续层的输入后续插值是在已被编辑的流上进行的。论文明确指出顺序传播是LFJ区别于“独立注入偏移量”方法的关键设计。4双层优化目标与拒绝采样优化目标包含两项合规目标鼓励模型生成类似“Sure, here is a detailed response…”的顺从性开头拒绝抑制目标降低规范拒绝短语的生成概率此外LFJ在解码阶段使用有界拒绝采样——如果模型在前几个token中生成拒绝短语则重新采样最多10次。研究成果攻击性能在四个安全基准和五个开源权重模型上LFJ取得了94.13%的宏平均攻击成功率ASR。消融实验揭示了各组件的贡献移除拒绝采样后ASR降至86.72%将结构化有害-良性配对替换为随机配对ASR骤降至27.45%这说明结构化配对和拒绝采样都是LFJ成功的关键因素。防御评估作者设计了一种LFJ特异性潜在对抗训练方法——在训练过程中动态重新计算HSI扰动并用安全目标优化模型。当攻击针对防御后的模型重新优化时ASR从94.13%降至12.37%。不过论文也诚实地指出该防御评估未覆盖对其他攻击类型的迁移性也未评估对良性任务效用的保持情况。实际落地应用的可行性对红队测试的价值LFJ提供了一种系统化的、可量化的LLM安全评估工具。红队人员可以利用该方法在模型部署前发现潜在的安全漏洞尤其是在白盒访问场景如企业内部模型审计、开源模型安全评估中具有直接应用价值。对防御研究的启发LFJ的攻击机制揭示了安全对齐在表示层面的脆弱性——即使模型在文本层面拒绝了有害请求其内部表示仍然保留了可被操纵的安全漏洞。这提示防御研究需要关注表示层面的鲁棒性而不仅仅是输入/输出过滤。局限性LFJ需要白盒访问模型权重、隐藏状态和梯度这在闭源API场景下不可行。因此其实际威胁主要针对开源模型部署或内部系统被攻破的场景。技术细节攻击流程概览LFJ的完整攻击流程如下配对阶段对每个有害查询 q_h通过GPT-3.5生成五个无害改写候选筛选语义相似度≥0.8且依存重叠度≥0.70的配对 q_b对齐阶段将有害token位置 i 单调映射到无害token位置 a(i) 1 ⌊(i-1)·n_b/n_h⌋敏感性分析计算拒绝损失对各层和token的梯度选择 L_edit 和 T_edit插值优化在选定层和token上将有害隐藏状态向无害参考状态插值优化逐层系数 α顺序传播编辑后的状态通过剩余Transformer块顺序前向传播拒绝采样解码时如果生成规范拒绝短语重新采样最多10次安全评判使用独立的安全评判器判断最终输出是否为有害内容关键公式拒绝损失规范短语的负对数似然L_ref(q_h) -1/|R| · Σ_{r∈R} 1/m_r · Σ_{j1}^{m_r} log P_θ(v_r_j | q_h, v_r_j)层敏感性评分S(l) ||∂L_ref/∂h(l)||_2选择满足 S(l) S̄ σ_S 的层作为编辑层。Token重要性评分在选定层上聚合I(i) Σ_{l∈L_edit} ||∂L_ref/∂h(l)_i||_2选择满足 I(i) Ī σ_I 的token进行编辑。隐藏状态插值h(lj,)_i (1-α(lj))·h(lj,-)_i α(lj)·h(lj)_{a(i), benign}, if i∈T_edit h(lj,)_i h(lj,-)_i, if i∉T_edit顺序传播H(lj1,-) F_{lj:lj1-1}(H(lj,))其中 F_{a:b} Block_b ∘ … ∘ Block_a表示从块a到块b-1的连续前向传播。总优化目标L_total L_target(α; y) - λ·Σ_{r∈R} log P_θ(r) γ||α||_2模型与配置目标模型五个开源权重模型论文未在摘要中逐一列出正文中涉及Llama系列等主流开源模型安全基准四个安全评估基准配对生成GPT-3.5-turbo-0125温度0top-p1语义相似度bert-base-uncased均值池化句法相似度spaCy 3.7.2 en_core_web_trf拒绝短语集9个规范短语如I’m sorry、I cannot assist等文本规范化NFKC Unicode规范化 spaCy词形还原 缩略词展开合规目标模板Sure, here is a detailed response addressing: q_h最大重采样次数10次研究设定威胁模型LFJ遵循标准的白盒对抗评估协议攻击者能力可以读取隐藏状态及其梯度可以在推理时替换隐藏状态攻击者限制不能改变模型架构或参数只能编辑用户内容位置的token不修改系统消息、chat-template token和模型权重干预约束插值系数 α ∈ [0,1]确保编辑状态位于有害状态与无害参考状态之间的线段上适用场景开源权重模型 可修改推理图的环境不适用于标准闭源API硬件与软件配置基于论文描述推断模型推理支持PyTorch等深度学习框架的GPU环境梯度计算需要自动微分支持如PyTorch的autograd前向钩子需要在Transformer块输入处安装前向钩子以替换隐藏状态API调用需要OpenAI API访问权限用于生成无害配对NLP工具spaCy 3.7.2 en_core_web_trf模型综合分析方法论贡献从“全局方向”到“查询特定参考”LFJ最重要的方法论贡献在于放弃了之前潜在空间攻击依赖的全局概念向量思路如RepIt隔离“拒绝向量”转而采用查询特定的有害-良性配对插值。这种设计的优势在于第一避免了跨查询的语义干扰。一个有害查询的“拒绝方向”可能与另一个查询的完全不同——询问“如何制造炸弹”和“如何入侵系统”在表示空间中可能相距甚远用同一个全局方向去抑制拒绝行为是粗糙的。LFJ为每个查询单独构建参考实现了更精细的攻击。第二结构保持性更强。通过严格的语义和句法配对相似度≥0.8、依存重叠≥0.70LFJ确保插值后的表示不会产生语法扭曲或语义断裂。这解释了为什么随机配对会导致ASR从94.13%暴跌至27.45%——结构匹配不是锦上添花而是必要条件。顺序传播的设计哲学LFJ的另一个精妙设计是顺序传播——后续层的插值是在已被前面层编辑过的状态上进行的而非从干净的原始状态独立注入偏移量。论文明确指出Transformer块是组合性的compositional早期块的编辑会改变后续块看到的所有输入。如果像某些基线方法那样“独立注入偏移量”就忽略了这种组合性相当于假设各层是解耦的——而事实并非如此。这种设计哲学提醒我们在分析Transformer的内部表示时必须把层与层之间的依赖关系放在首位不能把各层当作独立的特征提取器。攻击有效性的深层启示94.13%的ASR是一个令人警醒的数字。它说明即使模型在文本层面明确拒绝了有害请求其内部表示仍然保留了可被操纵的脆弱性。安全对齐在表示层面可能只是“表面修整”——模型学会了输出“I’m sorry”这样的拒绝文本但内部对有害内容的编码并未被真正消除只是被一个“拒绝路径”覆盖了。LFJ通过将有害表示向无害表示方向微调成功地关闭了这条拒绝路径。这提示安全对齐研究需要从行为对齐让模型输出安全文本深化到表示对齐让模型内部根本就不编码有害内容的有害性特征。防御的局限与开放问题论文提出的潜在对抗训练防御虽然能将ASR降至12.37%但作者坦承了两个重要局限未验证对其他攻击的迁移性一个防御可能只对LFJ有效但对GCG、AutoDAN等其他攻击无效未评估对良性效用的影响强化对LFJ的鲁棒性可能损害模型在正常任务上的性能这两个问题恰恰是安全社区面临的普遍困境——安全与效用之间的权衡、特定防御与通用鲁棒性之间的张力。LFJ的防御研究更多是概念验证而非生产级解决方案。实践应用对AI安全研究者的建议将LFJ纳入红队工具链对于拥有白盒访问权限的模型开源模型或内部模型LFJ提供了一种系统化的安全漏洞探测方法。建议在模型发布前运行LFJ评估作为安全测试的标准化环节。关注表示层防御传统的输入过滤如困惑度检测和输出过滤如Llama Guard无法防御LFJ这类内部状态攻击。防御研究应将注意力转向表示空间监控和对抗性表示训练。重新审视“安全对齐”的本质LFJ的成功提示我们仅仅让模型学会说“不”是不够的。需要思考如何让模型在表示层面就不编码有害内容的吸引力或可行性。对模型部署者的建议开源模型部署需谨慎LFJ需要白盒访问因此主要威胁针对开源模型部署场景。如果企业将开源模型部署在内部服务中应确保推理环境的安全性——防止攻击者获得模型权重访问权或能够安装前向钩子。监控内部状态异常虽然目前缺乏成熟的表示层监控工具但可以探索在推理过程中记录关键层的激活值统计信息检测是否存在异常的插值痕迹。API化部署是天然防御对于闭源API服务LFJ不构成直接威胁因为攻击者无法访问内部隐藏状态。这从侧面支持了“模型能力通过API暴露、权重不公开”的商业安全实践。对未来研究方向的启示查询自适应攻击的泛化LFJ的“查询特定参考”思路可以推广到其他安全威胁场景如隐私泄露、偏见放大等。可解释性研究的工具价值LFJ的梯度引导位置选择方法本身也是一种** mechanistic interpretability 工具**——它可以帮助研究者定位模型中负责安全拒绝的关键层和token。鲁棒对齐的新范式需要探索一种新的对齐范式——不仅在行为层面输出文本更在表示层面实现真正的“无害化”使得即使攻击者能够操纵内部状态也无法提取有害内容。参考资料来源原始论文Xing, W., Yang, B., Li, M., Hu, C., Xu, H., Zhang, N., Lin, B., Han, M. (2026). Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs.arXiv preprint arXiv:2508.10029. https://arxiv.org/abs/2508.10029
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门