新方法TAHI通过人机交互实现智能体个性适配,成功率提升最高20.9%

arXiv预印本论文提出测试时适配方法TAHI,可将AI智能体适配到单个用户的个人标准,在30名受试者共600项写作与视觉创作任务上,单任务成功率提升4.5%至20.9%。

AI解读:AI智能体通常在大规模数据上训练,生成的成果未必符合个人专业标准。这项研究指出,用户与智能体在多轮任务中的交互数据(如反馈和修正)是未被充分利用的信号。基于此,TAHI方法将这些信号纳入智能体的上下文和权重,并用一个可进化的评分标准模块记录个人的训练与评估标准。在30名用户的写作和视觉创作任务测试中,TAHI将单任务成功率提升4.5%到20.9%,且仅需几十个任务即可见效。对创作者、文案和设计师而言,这意味着工具能逐步学会你的偏好,减少反复改稿。此外,该方法生成的评估标准能比单独使用语言模型或人工发现多16.0%到22.3%的失败案例,但效果仍限于论文场景,尚未有商用产品落地,实际应用尚待验证。

arXiv预印本论文提出一种测试时适配方法TAHI(test-time adaptation through human-agent interaction),通过整合跨会话的人机交互数据来将AI智能体适配到单一用户的个人标准。论文研究者在写作和视觉创作两个高实用性领域对30名用户、共600项任务进行了适配实验,声称单任务成功率相对基线提升4.5%至20.9%,且仅需数十个任务即可实现。

研究者指出,AI智能体通常在规模化数据上训练,产出往往达不到专业人士需要以个人名誉担保的标准;在成功标准多样且记录不足的真实开放任务中,个体专业知识恰恰体现于偏离平均水平的判断。用户难以在一开始就完整描述成功标准,但在反复人机交互中会不断显露出这些标准并会在同类任务中重复使用。论文认为这类跨会话的交互数据是弥补个性化差距的关键但被忽视的信号。

TAHI方法将交互信号整合进上下文与权重

TAHI将交互信号整合进智能体的上下文和权重中,并通过一个可进化的评分标准模块(evolving rubric module)把每个用户提出的训练与评估标准固化为结构化形式。该模块既用于指导后续任务执行,也作为可扩展的标注工具。论文显示,TAHI生成的评估标准比仅由语言模型或仅由人工创建的评估标准多发现16.0%至22.3%的失败案例。

论文表明,尽管智能体是针对个体进行适配,这些个性化智能体在跨用户场景中仍表现出最高8.8%的成功率提升,说明适配中学会的某些标准具有一定通用性。

信息来源