Large Language Models Are Effective Code Watermarkers
该文章提出了基于大语言模型(LLM)的代码水印框架CodeMark-LLM,解决了传统代码水印技术在跨语言通用性、鲁棒性和部署效率上的不足,通过语义一致嵌入和差异比较提取两大核心模块,实现了无需训练、语言无关的高效代码水印方案。一、文章主要内容总结1. 研究背景与问题背景:LLM和开源代码的广泛应用,引发了代码未授权分发、许可证违规等伦理与安全问题,亟需可靠的代码溯源与所有权验证机制。传统方案局限:依赖手工设计的转换规则、抽象语法树(AST)操作或特定任务训练,存在跨语言通用性差、鲁棒性弱、部署成本高的问题。2. CodeMark-LLM框架核心设计框架包含两大核心模块,整体流程为“嵌入-提取”闭环:语义一致嵌入模块(Semantically Consistent Embedding):通过LLM自动生成并应用语义保留的代码转换(如变量命名格式切换、循环类型转换、数学表达式重组等),将水印比特编码到代码中,且确保代码功能、语法正确性不变。差异比较提取模块(Differential Comparison Extraction):通过多粒度特征(方法签名、变量使用、结构、语义)比较原始代码与含水印代码,识别已应用的转换规则,解码出水印信息。3. 实验验证与结果实验覆盖多编程语言(C、