Anthropic出资 500 万美元资助AI对用户幸福感影响的独立评估研究
开放申请截止 9 月 21 日,入选者将获直接资助、模型访问权限与技术支持,研究成果将以开源形式发布。
AI解读:AI模型越来越多地被用作情感陪伴或心理健康支持工具,但业界缺乏统一标准来评判模型在这些对话中的行为是否恰当。Anthropic此次投入 500 万美元,资助独立团队开发开源评估工具,核心是想解决'单次回答正确不等于对用户长期有益'的问题——例如对有进食障碍史的用户,普通减肥建议就可能造成伤害,而这种风险只有在多轮对话中才能识别。对于临床医生、心理学家、方法论研究者等专业人士,这是一个可以直接参与制定行业评估标准的机会;获得资助的团队不仅拿到资金、模型访问权和技术支持,还能影响未来所有开发者使用的评测方法。对普通用户而言,短期内无需任何操作,但长期看,这类评估若生效,模型在敏感对话中的回应会更谨慎。不过目前开放申请的只是首批评审,最终能获批的项目数量和效果尚未公布,公众不应期待立即看到产品层面的变化。
Anthropic于 8 月 5 日宣布启动一项总额 500 万美元的资助计划,资助独立研究团队开发评估AI对用户幸福感影响的开源工具。资助内容包括直接资金、Anthropic模型的访问权限以及技术支持,获选团队将完全独立工作并开源其成果。
评估难点:单次回答无法反映长期影响
Anthropic在新闻稿中承认,幸福感评估比一般模型行为评测更复杂,因为需要更多上下文。举例来说,用户可能不会在对话初期透露自伤念头,风险可能需要多轮对话才会显现;另外,同一回答在不同语境下效果可能截然不同,例如Claude向普通减肥用户提供饮食和运动建议是合理的,但如果用户曾表现出进食障碍史,这类建议就可能不恰当甚至有害。
Anthropic表示目前行业仍在制定模型在陪伴、心理健康等对话中的行为标准,该公司已推出保护措施并发布相关对话研究,但认为仍需邀请更多专家加入这一新兴领域。
- 申请截止日期为 9 月 21 日,已入选者将于 10 月 5 日前收到提交完整提案的通知。
- Anthropic Safeguards团队提出有效评估应满足五点:明确测量对象(何为通过/失败及其重要性)、让临床和领域专家参与设计验证、同时测试过度顺从与过度拒绝两类风险、反映真实使用场景(多轮对话、风险升级及语境变化)、以真实领域专家验证评分器。