新方法用金丝雀令牌识别AI抓取器,22个LLM系统中发现未公开数据源
研究人员部署动态网站向抓取器发放唯一令牌,再查询LLM输出,可自动推断哪些抓取器为哪些模型供数,实验中识别出多个公司未披露的抓取器。
AI解读:网站主想阻止AI公司抓取数据,但现有识别手段——靠公司自愿披露、研究者一次性实验或众包报告——既不可靠也难以规模化。这篇论文提出一种主动检测法:研究者搭建动态网站,给每个来访的抓取器发放独一无二的“金丝雀令牌”,然后向LLM提问网站内容。如果某个模型的回答稳定出现某个抓取器专属的令牌,就说明它接触过该抓取器抓取的数据。实验覆盖了22个生产级LLM系统,成功定位了哪些抓取器为哪些模型供数,甚至包括公司未公开承认的抓取器。对网站主来说,这意味着无需依赖公司配合,就能识别并针对性屏蔽抓取器,从而更好地控制数据被用于AI训练或查询增强。该方法的局限在于需要主动部署诱饵网站,且只能证明模型接触过特定数据,不能直接阻止抓取行为本身。
arXiv上一项新研究提出用“金丝雀令牌”(canary tokens)自动识别向大语言模型(LLM)供数的网络抓取器。研究人员部署动态网站,为每个来访抓取器发放唯一令牌,再提示LLM获取网站信息;若模型输出稳定包含某抓取器专属令牌,即证明其接触过该抓取器数据。实验覆盖22个生产级LLM系统,识别出多个公司未公开或未披露的抓取器。
论文作者为Steven Seiden、Triss Ren、Caroline Zhang、Taein Kim、Enze Liu和Emily Wenger,提交于2026年5月13日,9月3日更新第二版,涉及密码学与安全、人工智能、计算机与社会、网络与互联网架构等学科。
方法主要面向网站所有者:若担心大规模抓取影响站点稳定性或引发法律、隐私、伦理问题,可借助Robots排除协议等机制限制LLM相关抓取,但前提是先用User-Agent字符串等方式识别目标抓取器——这正是现有方法难以可靠完成的部分。
识别机制:从被动依赖到主动探测
现有识别LLM相关抓取器的手段依赖公司自愿披露、研究者一次性实验或众包报告,论文称这些方法“既不可靠也不可扩展”。新方案改被动为主动:托管动态网站,向每个访问的抓取器发出独有金丝雀令牌,再对LLM提示关于这些网站的信息。
如果某LLM的输出持续包含特定抓取器独有的令牌,就构成该模型暴露于该抓取器的证据。论文称这种途径让无特权第三方也能推断哪些抓取器为哪些LLM供数,有望实现对非预期抓取的更好控制。
- 实验在22个生产级LLM系统上进行,验证了方法的可靠性。
- 识别结果包括多个公司未公开或未披露的抓取器。
- 方法针对从预训练到查询时增强(query-time augmentation)的多种数据使用场景。