新研究将LLM评估建模为张量补全,提出半参数推断框架

来自MIT等机构的研究者提出用低秩张量补全刻画基于成对人类判断的LLM评估,并开发了得分白化方法以提供不确定性量化。

AI解读:基于成对人类判断的LLM排行榜往往噪声大、数据稀疏且采样不均,却很少给出置信区间,这让用户难以判断排名差异是否真实。这项研究把底层能力看作一个低秩张量,通过成对比较数据做半参数推断,目标是能力差、胜率等指标,并给出可计算的效率界与渐近正态的估计量。核心难点在于这类问题的信息算子各向异性,不能简单沿用各向同性模型的方法;作者由此提出得分白化,平衡局部Fisher信息,在最优样本复杂度上恢复稳定推断。对实际评测方来说,这意味着未来排行榜可能附带基于严格统计理论的不确定性区间,而不再只是点估计;但要落地仍需在真实平台数据上验证方法的数值表现与计算成本,论文目前只提供理论框架。

4月7日提交、9月3日更新的arXiv预印本论文(arXiv:2604.05460v2)中,Jiachun Li、David Simchi-Levi和Will Wei Sun提出将大规模语言模型(LLM)评估视为一种低秩张量补全问题,并在此设定下推导半参数效率界与去偏估计量,为排行榜提供不确定性量化。

信息来源