ScoreMix:无需外部数据的扩散模型合成数据方法,人脸识别精度最高提升7个百分点

ICML 2026论文提出ScoreMix,通过在反向扩散轨迹中混合类别条件分数生成合成样本,不依赖第三方基础模型或数据集,在8个公开人脸识别基准上将准确率最高提升7个百分点。

AI解读:这篇论文解决的是AI训练中合成数据受政策或法律限制的问题——很多场景不允许调用外部基础模型或数据集,而现有合成策略又普遍依赖这些外部资源。ScoreMix的做法是只用手头已有的数据集,通过在扩散模型反向采样时混合不同类别的条件分数,生成难样本用于数据增强。关键发现有两点:一是混合判别器嵌入空间中距离较远的类别效果更好,能额外提升最多3个百分点;二是生成器的条件空间对下游性能影响很小。直接效果是,在8个人脸识别公开基准上,ScoreMix不调超参数就把准确率提高了最多7个百分点。这篇是ICML 2026的论文,已发布到arXiv。对人脸识别或受限场景做视觉识别的团队来说,这意味着可以绕开外部数据限制来自主增强数据;普通读者无需特别关注,除非你在做类似受限环境下的模型训练。需要注意的是,论文报告的是基准测试成绩,文中没有提供实际部署的效率或成本数据,结论是否完全复现还要看后续验证。

ICML 2026论文提出ScoreMix——一种无需外部基础模型或数据集的自包含合成数据方法。研究者在多个类别的反向扩散轨迹中混合各自的条件分数,以生成用于识别任务的难样本,从而进行不依赖第三方资源的领域特定数据增强。

论文由Parsa Rahimi和Sebastien Marcel撰写,预印本于2025年6月11日首次上传,2026年9月3日发布第三版。该研究发现,与邻近类混合相比,混合判别器嵌入空间中距离较远的类别平均能让准确率最多再提高3个百分点。

在8个人脸识别基准上提升最多7个百分点

研究者评估了ScoreMix在不进行超参数搜索时的表现。他们在8个公开人脸识别基准上,将准确率提升了最多7个百分点,并将其归结为该方法鲁棒且实用。

论文还报告,在标准对齐指标下,条件和嵌入空间基本不相关,且生成器条件空间对下游性能的影响可以忽略。

  • 研究对象:用于识别任务的合成难样本生成
  • 使用场景:政策或法律限制禁止使用外部基础模型或数据集的场景
  • 方法:基于扩散模型的分数组合性,类条件分数沿反向扩散轨迹混合
  • 关键发现:混合判别器嵌入空间中距离较远的类别比邻近类别多带来约3%平均提升
  • 下游扩展:条件空间对齐对下游性能的影响可忽略

信息来源