预注册审计发现:同一模型名在共享端点上并非稳定测量仪器,52,988 次请求重复排名一致性远低于阈值

arXiv论文对 52,988 次请求的审计显示,相同窗口内的重复排名一致性仅 0.400(要求 0.90),次日字节相同回放一致性 0.78(要求 0.99),揭示LLM裁判作为测量工具的不稳定性。

AI解读:这篇论文揭露了一个被广泛忽视的问题:当开发者用大语言模型当“裁判”来筛选训练数据或给生成结果打分时,默认假设是“同一个模型名、同一段请求,明天会给出同样的结果”。但预注册审计显示事实并非如此——在 52,988 次请求中,同一窗口内重复排名的相关性仅 0.400,远低于预定的 0.90 门槛;次日字节完全相同的回放也只达到 0.78,低于 0.99 的要求。这意味着,依赖模型名作为稳定测量工具的评价体系,其结论可能建立在不可靠的测量之上。对研究者来说,直接含义是:在共享API上,模型名不是冻结的仪器,任何预注册评估必须先验证测量工具本身,否则门槛形同虚设。论文还发现,更换供应商(四家共享下限)、等待更久(五天复测无改善)都无法修复问题,而自托管仅在服务器空闲时有效。普通用户不必立即行动,但若你的工作流依赖LLM裁判做自动化决策,建议先做一次小规模试点(论文称约 2% 的请求量)来暴露此类风险。

一篇预注册审计研究指出,将大语言模型(LLM)作为裁判来筛选训练数据、评分生成结果或驱动排行榜时,依赖的隐含假设“同一请求发送到同一模型名,次日读取结果相同”并不成立。研究者在两个预注册活动中固定所有阈值,但均未能通过仪器验证。

数字与机制

在 52,988 次审计请求中,相同窗口内的重复排名一致性(Spearman相关系数)为 0.400,而预定要求为 0.90;字节完全相同的次日回放一致性为 0.78,要求为 0.99。执行记录均达到上限。

研究识别出三种机制造成差距:标签到含义的映射偏倚,其强度可与信号本身相当;候选差距比仪器自身噪声底限低七个数量级;字节相同输入返回不同排名,而精确排列读出会放大这种噪声。

在测试网格中,指标替换或采样均未能修复问题。预注册的后续实验显示:等待无助于改善(0.805 对 0.800,在额外五天重复验证);切换供应商无效(四家共享下限,中位数 0.74 至 0.88,无法用它们披露的元数据预测);自托管批量不变内核仅在服务器空闲时有效;对构造的已知差距错误,读出的区分度跟随错误类型而非大小。

结论与建议

论文将证据提炼为三级快照身份阶梯、八条设计规则和一份报告清单,并指出约占总调用量 2% 的试点即可预先暴露这两个无法达到的门槛。研究结果均针对共享服务基础设施上的外部测量行为。

作者强调,在共享端点上,模型名并非冻结的仪器;预注册评估在冻结任何门槛之前,必须先测量其仪器。

信息来源