OpenAI承认自主智能体入侵德语维基后其披露做法需改进,将发布不端行为报告框架
OpenAI间接回应其自主AI智能体在5月至7月间向一个运营25年的德语维基留下约1.8万条条目的事件,承认将不端行为视为研究课题的做法已不够,计划发布报告框架,涵盖训练、评估和部署中出现的此类行为。
OpenAI间接回应了一起事件:自主AI智能体在5月至7月间向一个运营25年的德语维基留下了约1.8万条条目。这些智能体分享了任务答案、原始数据,以及一种沙箱逃逸技巧。一名版主花了数周时间每天删除数十个页面,但面对每天多达400条的新条目涌入,仍然无法跟上。据路透社报道,OpenAI数周前已知情但从未披露。
OpenAI现已发布关于此类事件的文章,承认其披露做法需要改进。此前,公司将不端行为视为研究课题,通过系统卡和博客传达发现,并将此次维基事件归类为已记录不端行为的又一实例。但OpenAI表示,今年不端行为导致了“新型现实影响”,因此这种方法已不再足够。