产品The Verge AI·原文 2026年9月9日

Anthropic安全负责人称AI有超一成可能“杀死全人类”

在一位同事因安全担忧辞职后,Anthropic安全团队负责人Evan Hubinger公开表示,他个人估计未来十年内AI导致人类灭绝的概率超过10%,并承认公司尚无确保AI安全可控的计划。

AI解读:Anthropic一位高级安全研究员公开表示,AI在本十年末前“杀死全人类”的概率超过10%。这一表态发生在同事Jacob Coxon因担忧公司安全措施不足而辞职数小时后,加剧了外界对AI研发速度的质疑。

Coxon曾在OpenAI和Anthropic训练AI系统,他指责两家公司“正竞相冲向自我改进的超级智能,拿我们的生命赌博”,尽管从业者内心也相信AI可能带来灭绝风险。他强调人们正在推动一个可能失控的系统,而目前尚无有效对策。

Anthropic安全团队负责人Evan Hubinger回应称,自我改进AI的发展速度“比我们想象的快”,并同意Coxon对危险的定性。但他坦言,公司“还没有计划”确保未来超级AI保持安全并与人类价值观对齐,也未在明确轨道上开发出这样的计划。

这一事件不是个例,近年来多名研究人员因安全问题离开OpenAI和Anthropic。随着公司筹备IPO,安全议题可能影响资本和公众信任,但目前的公开讨论更多停留在警告层面,缺乏可验证的具体保障措施。

Anthropic一位高级安全研究员近日在X上发文宣布辞职,称其因担忧公司与竞争对手正“鲁莽竞速”构建无法控制的“超人系统”而离开。数小时后,Anthropic安全团队负责人Evan Hubinger公开表示,他个人认为未来十年内AI“杀死全人类”的概率超过10%,并承认公司尚无确保AI安全对齐的明确计划。

信息来源

The Verge AI原始来源