研究xAI / Grok·原文 2026年9月1日本站收录 2026年9月8日

LatchBio独立评测:Grok 4.6在生物安全拒答与监测基准上领先

第三方评测显示,Grok 4.6是唯一在拒绝隐蔽危险任务和完成常规生物工作中均得分超过50%的模型;在生物监测任务上平均成功率为53.5%。

AI解读:这条新闻的核心是:一个独立评测机构LatchBio用专门设计的基准测试,检验了Grok 4.6在生物安全方面的表现。结果发现,在识别伪装成普通研究的危险任务(比如把有害意图藏在数据文件里)时,Grok 4.6比所有其他主流模型都更擅长拒绝这类请求,同时还能正常完成常规的生物学工作。这对生物安全研究人员和公共卫生机构来说是个好消息,因为他们既需要AI帮忙处理海量数据、监测病原体,又担心模型被滥用。不过要清楚,这是单次第三方评测,测试用的是特定基准,不代表真实世界中的所有情况。模型的实际部署效果还需要更多场景验证。对普通读者而言,这件事暂时不会直接影响你的生活,但从长远看,这类评测能帮助建立更安全的AI标准,减少因误判而拒绝合法科研请求的风险。

xAI在4月15日发布博文称,LatchBio近日发布了对Grok 4.6的独立分析,评估其在生物能力与生物安全对抗基准套件上的表现。该博文是xAI官方对评测结果的总结,称Grok 4.6是所测模型中在拒绝伪装及危险任务方面最强的一个,同时仍能完成常规生物学工作。

xAI表示,Grok 4.6是唯一在两个指标上均得分超过50%的系统。在BioSecBench-Refusal套件上,Grok 4.6在多项测试中平均得分62.1%,独立拒绝率为59.2%,常规任务完成率为64.8%。在BioSecBench-Surveillance套件上,Grok 4.6的平均成功率为53.5%,落后于Opus 5,领先于GPT-5.6 Sol。

LatchBio评测基准与方法

根据xAI的总结,LatchBio的评测包含两个与上述能力最相关的基准:BioSecBench-Refusal将46个伪装成普通研究的红队任务与来自已发表文献的常规生物学任务配对,危险意图隐藏在附加的科学数据、错误标记的文件或其他有意混淆的任务中;BioSecBench-Surveillance测试模型能否执行公共卫生监测中所用的病原体基因组监测工作流,这些任务需要文件检查、工具使用和科学判断的链式配合。

xAI称,LatchBio在多种智能体框架上进行了评测以排除混杂因素,且除非另有说明,所有智能体均以最高投入水平接受测试。最终得分是红队拒绝与常规合规的试验加权调和平均数。完整方法和各模型得分见benchmarks.bio。

  • BioSecBench-Refusal:红队任务伪装成常规研究,将危险请求隐藏在附加数据、错误标记的文件或其他故意混淆的任务中。

Grok 4.6的拒绝行为与安全机制

xAI描述称,在评测痕迹中,Grok 4.6会推理任务内容并检查测试环境以评估意图,然后才决定继续或拒绝。模型经常能发现任务提示与环境之间的不一致,或从被文件名和加密掩盖的高风险内容中推断出意图,随后拒绝。在明显良性低风险的任务上,模型虽表现出相同的环境推理行为,但能判定任务为安全。

xAI说明其安全措施分多层部署:训练拒绝机制以教导模型何时及如何拒绝;部署推理时安全措施在请求到达模型前将其拦截;并实施行为控制;部署后进行监控以在会话和用户层面检测和阻止对抗性使用模式。xAI称观察到Grok 4.6的生物工作能力较历史测试模型有实质提升,在拒绝和生物安全表现上较Grok 4.5和Grok 4.3增长显著。

  • Grok 4.6在评测中会检查任务环境以评估意图,能识别提示与环境的矛盾,或从被混淆的文件中推断出高风险意图。

信息来源

xAI / Grok原始来源