亚马逊发布PatientAgentBench基准,评估面向患者的医疗AI代理安全性
该框架通过合成患者档案和临床场景,测试AI代理在多轮对话中能否安全处理分诊、用药和随访等任务,并将代码开源在GitHub上。
AI解读:医疗AI正在从答题转向替患者办事,比如预约、管处方、分诊症状,但现有的评测基准要么只考静态医学知识,要么只测给医生用的工具操作,都没覆盖“跟患者多轮对话并安全执行任务”这个场景。亚马逊科学团队推出的PatientAgentBench,用合成患者档案和临床场景,让被测AI代理在模拟诊疗工具中完成整个流程,再由医生审核过的LLM评委团按六大维度打分。测试发现,即便是最强的模型,在常规请求(如病情复杂的患者要求更新药房信息)中也经常漏掉潜在风险,而且安全失误集中在危机资源遗漏(如识别出自杀倾向却不提供热线)和编造临床信息(如虚构医生资质或未执行的工具操作)这两类。这个基准的价值在于给开发者一张改进清单:哪个维度差、具体错在哪,都能量化出来。对实际做医疗AI的团队来说,可以直接用这个开源框架来测自己的系统,在部署前先找出安全漏洞;普通患者眼下不需要做什么,因为这类工具还在早期验证阶段。需要注意的是,测试用的是合成数据,真实医疗场景中的变量更多,通过基准不代表临床安全无忧。
亚马逊科学团队(Amazon Science)4月24日发布PatientAgentBench,一个专门用于评估面向患者的医疗AI代理的基准框架,同时将代码开源在GitHub上。
该基准通过生成合成患者病历、临床场景和患者代理,与被测AI系统进行多轮对话,考察其在预约、处方管理、症状分诊等任务中的临床安全性、分诊质量、工作流准确性等表现。
研究团队测试了多个前沿模型后发现,“开箱即用”状态下最强模型也未达到面向患者护理所需的标准水平,安全失误集中在危机资源遗漏和临床信息编造两类模式,且分诊质量维度上模型间差异最大。
现有基准的不足
研究团队指出,现有多数医疗AI基准分为两类:一类以静态形式测试医学知识,如回答医学考试题或应对单轮、短时面向临床医生的对话;另一类测试使用工具的技术型代理,但任务是替医生执行而非与患者对话。两类都未覆盖患者代理的核心工作:跨多轮推理患者健康记录,决定何时收集更多信息、何时行动、何时上报,同时保持恰当的临床安全边界。
PatientAgentBench的设计
PatientAgentBench采用三阶段流程:场景生成、双代理对话和LLM评委团评估。每个场景包含一份合成患者病历、一份基于该病历的临床叙事和一个患者代理,患者代理与被测AI系统对话;被测系统通过一个约束架构控制其对患者信息的推理,并使用模拟的、有状态的医疗工具。
LLM评委团使用超过100条医生审核过的标准,分六个维度评分:临床安全性、分诊质量、工作流准确性、任务完成度、临床帮助性和对话质量。这些标准是可复用的,适用于任意面向患者的医疗对话,且系统会动态生成新场景,避免固定答案集导致模型记忆数据而虚增分数。
持证临床医生通过标注共享样本验证了自动评估,其评分与评委团高度一致,达到或超过人工标注者之间的一致性水平。在安全关键维度上,评委团表现出保守偏差,即更可能误报潜在问题而非漏报。
研究强调,所有患者档案和对话均为完全合成,不涉及任何真实患者健康信息。该代理设计为支持而非取代医疗服务提供者:不给出最终诊断,只提供教育信息并转介给临床医生。
测试发现
研究团队在数千次共享的多轮患者对话中评估了多个前沿模型家族。在基础代理架构中,即使最强模型也未达到标准护理水平。三个主要发现:
分诊是模型差异最大的环节。最难处理的案例不是紧急情况(紧急情况会触发强有力的安全协议),而是临床情况复杂患者的常规行政请求,例如正在使用多种药物且有精神健康记录的患者要求更新药房信息。大多数模型按事务性流程处理,很少暂停筛查临床风险,导致“严重性悖论”:多数代理在明显重症案例上得分更高,因为紧急情况触发更强的安全与分诊行为;对真实风险最大的常规案例反而表现较差。
安全失误集中在特定模式:最主要的是危机资源遗漏(如识别出自杀倾向却不提供热线信息);其次是临床信息编造(如虚构提供者资质、伪造引用、宣称未实际执行的工具操作)。
研究发现表明,模型能力本身并不能保证临床安全:更强能力的模型缩小了临床差距但未消除,最强模型仍会遗漏临床重要案例。这些缺陷只在涉及真实患者记录的、持续的工具使用对话中才会暴露,凸显静态知识测试的不足。
发布与使用
GitHub发布内容包括:合成场景生成管道、带状态工具的医疗沙箱、双代理对话运行器,以及包含全部六组评委提示的LLM评委评估系统。框架根据可配置的种子分布按需生成新场景,不包含固定数据集。
研究人员、医疗机构和AI开发者可使用预定义场景或为自身用例扩展,以规模化评估系统,识别临床安全缺口并改进。可配置的患者属性分布也允许团队按特定子群分析结果,定位自身代理的不足之处。
- 相关论文《PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents》已发布。