新水印方案SBW:让LLM文本标记速度提升,开销低于 1%
Stateless Bernoulli Watermarking通过每token独立伯努利试验实现O(1) 复杂度检测,支持全词汇自盐标记,端到端生成开销小于 1%,论文被EMNLP 2026主会接收。
AI解读:这篇论文解决的是大语言模型文本水印的速度瓶颈。此前的水印方法如KGW需要打乱词表或用多层结构(SynthID),每次生成token都要额外计算,拖慢推理。SBW改用每个token独立的伯努利试验,只和计数器随机数比较一次,复杂度降到O(1),所以在所有批次大小下生成开销都低于 1%,还支持分布式推理。对AI服务商来说,这意味着可以给用户输出加水印而几乎不增加延迟或成本,更容易落地到生产环境。对检测方而言,它保持了和固定绿色列表相同的统计保证(z检验在零假设下仍为标准正态),所以不牺牲质量。研究还发现哈希函数设计会影响水印质量,用GPU原生的Jenkins哈希可将零假设校准提升 1.8 倍。不过实验只覆盖两种播种方案和八组参数,检测效果与实际部署限制仍需更多验证。
arXiv预印本论文(编号 2609.03844)介绍了一种名为Stateless Bernoulli Watermarking (SBW) 的新型统计水印方法,用于大语言模型。SBW通过每个token独立的伯努利试验确定绿色列表成员资格,仅需单次比较即可完成,将成员复杂度降为O(1)。论文已被EMNLP 2026主会接收,作者为Simone Ceppi和Ignacio Sanchez。
方法与性能
与KGW的词汇表置换或SynthID的多层锦标赛不同,SBW仅需将每个token与基于计数器的随机数生成器进行一次比较,无需中间分配,支持单内核执行。作者证明,该形式保留了与固定大小绿色列表相同的检测保证:在零假设下z检验仍为N(0,1) 分布。
端到端生成基准测试显示,SBW在所有批次大小下增加的额外开销低于 1%。实验采用两种播种方案和八组 (γ, δ) 配置,ROC-AUC差异低于 0.01,确认了统计等效性。
新能力:全词汇自盐与哈希优化
SBW的无状态架构支持全词汇自盐水印,尽管对整个词汇表进行了基于候选依赖种子的偏置,其速度仍比KGW的自盐快 6000 倍以上,比SynthID快 2 倍。该架构设计还兼容分布式推理。
论文额外发现哈希函数设计是此前未探索的水印质量维度。使用GPU原生的Jenkins哈希将零假设校准提高了 1.8 倍,并生成更多样化的文本。