研究者提出“掷骰子法”:为反复查询LLM品牌推荐建立标准化审计协议
新协议将响应方差分解为采样、提示措辞、运行间和模型版本四类,基于约19万次观测提出探索性、验证性和严格三档迭代次数建议。
AI解读:这项研究解决的是LLM审计中的一个操作性问题:用相同提示反复问模型品牌推荐时,答案每次都会随机波动,研究人员不知道问多少次、用什么指标才算可靠。作者提出了“掷骰子法”协议,把总方差拆成采样、提示措辞、运行间和模型版本四部分,并用统计工具给出三档迭代次数——探索性5次、验证性10次、严格15次,对应不同的可靠性水平(G系数0.58到0.81)。对做品牌排名或合规审计的人来说,这套协议提供了一个可复用的流程:先跑小规模试点确定需要多少轮,再选互补的指标组合,而不是只看单一指标。外部验证在39个测试单元中复现了37个的可靠性预测,但固定的迭代档位不能直接套用,意味着每项审计仍需根据自身数据调整。目前协议基于arXiv预印本论文,尚未经过同行评审,实际采用时需自行验证其适用性。
一项发表于arXiv的预印本研究(编号2609.04047)提出了“掷骰子法”(Dice Roll Method),作为对大型语言模型(LLM)品牌推荐进行重复查询审计的标准化协议。作者为Dmitrij Żatuchin,论文共30页,含2张图和19张表,已超Research Square预印本版本,但尚未经过正式同行评审。
协议内容与统计方法
论文指出,研究者越来越多地使用重复相同提示来审计LLM品牌推荐中的随机变化,但目前没有标准化协议来设定迭代次数、选择稳定性指标或确定可靠性阈值。该协议将总响应方差分解为四个组成部分:采样、提示措辞、运行间和模型版本。
技术栈包括:以迭代次数为重复测量的负二项混合模型;作为无分布效应量的Cliff's delta;保持依赖关系的bootstrap方法;基于模拟的统计功效分析;概括性理论(generalizability theory)分解;以及对固定快照的漂移诊断。
迭代次数档位与外部验证结果
作者重新分析了五项品牌推荐审计研究,涵盖约19万次观测、270多个品牌、6种语言,迭代次数从5到40不等。基于D-study分析,论文提出三档迭代指导:探索性(n=5,G=0.58)、验证性(n=10,G=0.74)和严格(n=15,G=0.81),并与效应量和概括性目标挂钩。
研究还发现四类指标族(计数、集合、嵌入和经公平性调整的PASOR)具有互补性,因此建议使用紧凑的指标组而非单一指标。
预注册的外部验证使用了三个独立语料库(Motoki等人的100轮数据、Rozado的24个模型、llm-stability),在39个测试单元中复现了37个D-study可靠性预测,其中n=5的统计功效值精确到两位小数;但论文明确指出固定档位不能跨语料库迁移,支持先试点再求解的解读方式。