融资Google DeepMind·2026年9月5日

Google DeepMind与新加坡AI安全研究所试点全球首个AI双重盲评

Google DeepMind联合新加坡AI安全研究所等机构,在加密环境中对Gemini Flash Lite模型进行外部基准测试,防止模型提前接触测试问题。

AI解读:这项试点解决的是AI基准测试中的"数据污染"问题:如果模型在训练或开发过程中提前接触过测试题,其成绩就会被夸大,外界无法判断真实能力。Google DeepMind与新加坡AI安全研究所、OpenMined、AVERI和MLCommons合作,把外部评估放在一个加密的"盒子"里,测试问题对模型完全不可见,直到正式评估时才会暴露,从而保证成绩的可靠性。对于需要依赖第三方基准来挑选模型的企业、审核AI安全性的监管机构以及做模型对比的研究者而言,这意味着评估结果能更真实反映模型的水平,而非应试技巧。不过,这套方法目前只在一个模型(Gemini Flash Lite)上试点,且Google未公布试点的时间表和具体数据,外界还不清楚其扩展性和实际操作成本。

Google DeepMind于2026年8月27日宣布,与新加坡AI安全研究所、OpenMined、AVERI和MLCommons合作,启动全球首个专有前沿AI模型的双重盲评估试点。该试点将Gemini Flash Lite模型放在加密环境中运行,防止外部基准测试题被模型提前接触(即"基准污染"),以提升评估的完整性。DeepMind研究员William Isaac、Sol Messing与Kristian Lum在官方博客中作出上述说明。

信息来源

Google DeepMind原始来源