新基准PAWBench评估视频生成模型多可能结局分布,11个系统无一达标

研究定义“概率对齐”标准,通过50个场景测试发现当前视频生成模型无法在重复生成中恢复正确结果分布。

AI解读:视频生成模型常被当作世界模型,但现实中同一初始状态可能导向多种合法结果。现有评测只检查单个视频是否合理,不检验多次生成的分布是否正确。这项研究把“概率对齐”定义为衡量标准,提出PAWBench基准和PAWEval评估协议,将重复生成的视频转化为行为分布,在50个场景中测试了11个主流系统,结果没有模型能同时匹配参考概率并覆盖有效行为范围。对开发者的直接意义是:如果把这类模型用于需要可靠多可能性的模拟(如机器人规划、自动驾驶预测),当前系统会产生与实际概率有偏差的样本。论文还测试了提示词、初始噪声和训练方式对分布的影响,但未提供可行方案,因此普通用户无需立即调整使用方式,而是应留意未来针对分布校准的训练方法。

arXiv论文PAWBench提出新的评估基准,首次为视频生成模型的“多结局分布准确性”建立标准。作者团队(包括Yuandong Pu、Le Zhuo、Xi Chen等)研究发现,在50个场景和11个当前主流系统上,没有模型能同时匹配参考概率又覆盖所有有效行为。

信息来源