[论文学习]Trace:面向LLM-Agent轨迹的双通道鲁棒归属水印
Trace: A Two-Channel Robust Attribution Watermark for LLM-Agent Trajectories论文重点本文提出TRACE一个面向LLM Agent轨迹的双通道归属水印方案通过叠加选择通道selection channel和计数通道tally channel同时抵御删除攻击和重写攻击。这是首个在行为选择上无失真、在删除下自同步、在重写下无条件不变的水印方案。核心研究内容问题定义LLM Agent通过分销商reseller触达终端用户。分销商可能将开发者的Agent重新包装后以自己的品牌出售或用更便宜的模型替换底层模型。当归属权发生争议时唯一可用的证据是轨迹日志trajectory log——即工具调用、观察结果和执行动作的记录而非模型的推理过程。问题在于分销商对这份证据拥有完全的读写权限现有Agent水印方案无法在这样的威胁模型下存活。具体而言分销商可通过两种操作破坏水印删除攻击删除日志中的记录如观察记录使依赖位置的水印失同步重写攻击改写观察文本、重命名工具改变日志内容但保持骨架结构不变两类攻击对水印设计提出了截然相反的要求——删除攻击要求密钥基于内容位置被删除后丢失重写攻击要求密钥基于位置内容可被任意修改。没有单一密钥能同时满足这两个需求。创新方法TRACE的核心洞察是一条轨迹有足够的空间容纳两个水印。选择通道Selection Channel载体每个决策组中选择的具体行为action密钥来源前序内容的局部上下文ctxi : enc(Ai-1) || key1实现方式通过指数竞赛exponential race对Agent的原始分布进行无失真采样——每个候选行为获得一个密钥驱动的随机时钟时钟最先响应的行为胜出关键性质采样分布严格等于Agent原始分布Theorem 5.1因此不影响任务成功率删除仅影响相邻一个决策组的密钥blast radius one检测器可在下一个决策组重新同步计数通道Tally Channel载体每个决策组包含的记录数量密钥来源组在轨迹骨架中的位置实现方式在决策组后追加上下文无关的冗余记录数量由位置密钥决定关键性质计数和密钥都是轨迹骨架skeleton的函数——骨架由决策/观察标签序列构成重写攻击无法改变标签——因此该通道在任意强度的重写攻击下严格不变Theorem 5.3两个通道使用独立的密钥互不干扰且分别针对删除和重写攻击设计。理论保证选择通道的检测信号以决策熵为代价每个决策至少贡献其熵的一半确定性决策贡献为零Theorem 5.2同时擦除两个通道的代价是攻击者必须破坏轨迹骨架且至少改变常数比例的组内容Theorem 5.4研究成果论文在ToolBench和ALFWorld两个基准上进行了评估指标结果任务成功率与未加水印的Agent持平选择通道检测得分长轨迹接近z 10070%删除率下的可检测性保持可检测计数通道在LLM重写下的变化严格不变任意强度TRACE在零失真不改变Agent原始行为分布的前提下实现了强归属能力这是其与现有方案最本质的区别。实际落地应用的可能性高度可行。TRACE的设计紧贴真实商业场景分销商场景任何通过第三方分销的Agent服务都面临归属风险TRACE提供了一种无需信任分销商的归属验证手段合规与审计当Agent行为造成损害时TRACE可帮助确定责任归属无需修改推理过程水印嵌入在决策层不触及模型内部的推理轨迹部署侵入性极低日志/执行一致性审计检测器支持从分销商发布的日志和从执行重构的分组两个来源进行验证两者差异本身就是篡改证据技术细节1. 轨迹建模Agent轨迹定义为带标签的有限序列τ : (e₁, ..., e_T)每个记录带有角色标签ρ(e_t) ∈ {dec, obs}。骨架s(τ) : (ρ(e₁), ..., ρ(e_T))是标签序列本身。重写攻击不改变骨架。决策边界分组将轨迹划分为连续块g₁, ..., g_m每个块包含恰好一个dec记录及其后直到下一个dec记录之前的所有obs记录。记k_i为第i个组中obs记录的数量。2. 选择通道指数竞赛上下文构建ctx_i : enc(A_{i-1}) || key₁ ctx₁ : bootstrap || key₁其中enc是动作身份序列的保序编码。候选行为评分r_b : DRBG(key H(ctx_i), nonce b) ∈ (0,1), b ∈ B_i每个候选行为b获得一个由密钥驱动的伪随机值。选择规则指数竞赛b_i : argmin_{b∈B_i} (-ln r_b) / P_i[b] argmax_{b∈B_i} r_b^{1/P_i[b]}每个候选行为运行自己的密钥驱动时钟Agent选择最先响应的行为。检测统计量φ_i : -ln(1 - r_{b_i})当轨迹未加水印时φ_i ~ Exp(1)。汇总有效组X₁ : Σᵢ φᵢ, z₁ : (X₁ - n) / √nz₁服从上Gamma尾分布用于假设检验。3. 计数通道基于骨架的冗余记录计数通道的密钥和计数都是骨架s(τ)的函数。由于重写攻击不改变骨架该通道在重写下严格不变。4. 伪随机基础两个通道共享一个确定性随机数生成器使用HMAC-SHA512实现。嵌入器和检测器从相同输入重新计算相同值不传输任何侧信息。研究设定威胁模型Provider防御方持有密钥(key₁, key₂)在决策时嵌入TRACE水印目标以预设的假阳性率判定轨迹是否由其Agent生成Reseller攻击方无密钥无法伪造水印只能试图移除无重执行只能编辑已记录的日志不能重新执行效用与一致性约束编辑后的日志必须仍然有用且一致实验设置项目详情基准测试ToolBench、ALFWorld对比基线Red-Green方案、Multi-bit方案删除攻击每条obs记录以概率r独立删除r从0到0.7扫描重写攻击LLM Rewriter论文首次提出的知情、保真性重写攻击LLM在看到真实选择后返回一个合理的替代动作重写强度q从0到1扫描综合分析理论贡献的深度TRACE在理论层面的贡献值得特别关注。现有Agent水印方案大多通过实验测量鲁棒性而TRACE提供了结构性的理论保证精确的零假设分布两个检测器的零假设分布是精确的exact null laws而非渐近近似熵下界无失真可检测性的代价被量化为每个决策至少一半的熵——这意味着在确定性决策熵为0的场景下选择通道无法携带信号这一定量刻画了水印能力的根本边界联合擦除定理任何同时沉默两个通道的攻击必须编辑骨架且至少改变常数比例的组内容与现有工作的对比方案无失真删除鲁棒重写鲁棒Agent Guide✗未证明未证明AgentMark✓未证明未证明AgentWM✗未证明未证明ActHook✗未证明未证明TRACE✓✓✓TRACE区别于所有现有工作的核心在于其威胁模型攻击者就是持有证据的一方。传统的日志签名可以证明日志的完整性但无法归因于一个已被编辑过的轨迹——分销商只需丢弃提供者的签名。TRACE的 behavioral watermarking 是在更广泛的 provenance 架构中的一个互补信号——当持有记录的当事人本身就是 adversary 时这个信号仍然有效。设计哲学互补嵌入TRACE最精妙的设计在于两个通道的互补性选择通道的内容密钥使其在删除下自同步但在重写下脆弱计数通道的位置密钥使其在重写下不变但在删除下脆弱两者叠加后任何单一攻击只能破坏其中一个通道而同时破坏两个通道的代价极高这种设计让人联想到SLICE在图像水印中的思路——将信号绑定到不同的语义因素上使它们在互补的攻击下失效。实践应用1. Agent服务分销场景如果您的Agent通过第三方平台如API市场、云服务商分销TRACE可在无需信任分销商的前提下提供归属验证在服务端嵌入水印后所有发出的轨迹自动携带归属信息当分销商声称某条轨迹来自其自研系统时您可通过检测器验证真实来源2. 合规审计场景对于受监管的Agent应用如金融交易、医疗决策、安全响应审计人员可在事后从日志中提取水印信号确认行为是否来自声称的Agent日志与执行的一致性审计可检测分销商是否篡改了记录3. 部署注意事项密钥管理选择通道和计数通道使用独立密钥建议分别存储在不同的安全环境中熵感知在确定性决策较多的场景如规则驱动的Agent选择通道的检测能力会下降——此时计数通道提供补充保障短轨迹处理短轨迹的信号较弱论文通过显式 pooling rate 处理了这一问题不依赖推理轨迹TRACE只读取和标记执行轨迹工具调用、观察、动作不触及可能被隐藏或加密的推理过程参考资料来源原始论文Trace: A Two-Channel Robust Attribution Watermark for LLM-Agent Trajectories