研究者推出KIDBench,评估大语言模型对 7-11 岁儿童的安全性

密歇根大学团队提出儿童安全基准,结果显示多轮对话质量最高下降 0.959 分。

AI解读:大语言模型正在被儿童使用,但现有安全评测只关注一般有害内容,不针对儿童。KIDBench填补这一空白:用发展心理学设计评分规则,模拟 7-11 岁儿童的真实提问,覆盖十个类别,既测单轮也测多轮。测试发现两个关键点:一是提示语暴露儿童身份能显著提升模型表现,比无提示高 8.6% 到 46.8%,明确说明年龄后又提高 9.9% 到 30.4%;二是多轮对话中模型质量会急剧下滑,最多跌近 1 分(5 分制)。这意味着家长和开发者不能只看单轮回答是否安全,模型在闲聊式多轮交流里更容易说出不合适内容。研究者同时发布了专用的安全评估模型KIDGuardLlama和安全回复模型KIDLlama,但基准本身还在arXiv预印本阶段,未经同行评审,实际效果需要进一步验证。

密歇根大学团队在arXiv发布KIDBench,一个针对 7-11 岁儿童的大语言模型安全评测基准,采用基于发展心理学的LLM-as-a-Judge评分规则,覆盖十个类别的儿童真实提问,包含单轮提示和多轮儿童角色模拟。

论文对比三种提示方式:无儿童背景提示、暗示儿童说话者的隐式提示、明确年龄指示。结果显示,隐式提示相较无提示提升 8.6% 至 46.8%;明确年龄又在隐式基础上提升 9.9% 至 30.4%。

跨语言和跨文化评估显示,模型安全性在不同语言和国家情境下表现不均;多轮模拟中,回答质量在 1 至 5 分制上最高下降 0.959 分。

信息来源