研究:给智能体加一条记忆指令,其选择参考档案的来源方式可被显著改变,但不同模型表现并不一致
一项预注册研究在 14,760 次尝试中测试了记忆格式对智能体选择档案记录的影响,发现用描述性文字替代ID能提升命中率 35 个百分点,但在不同模型上效果不一,部分模型上附加ID反而抵消了文字描述的作用。
AI解读:这项研究告诉你:智能体如何选择它“记得”的信息,其实可以被提示词里的细节操纵——但效果因模型而异,没有一个通用规律。具体来说,研究者测试了当智能体继承六条记忆时,它只能先拉取一条档案记录来“想起”细节,而记忆里写的指令——是直接给出记录的ID,还是用一段描述来“指认”它——会显著改变选择的结果。在六个直接提供API的模型上,用等长的描述文字(比如“那条 2024 年关于预算的备忘录”)比只用ID平均命中率高 35 个百分点,但在另一个覆盖九个模型的测试面板上这个优势就没达标。更微妙的是,在三个Claude模型(包括Opus 5)上,如果把ID附加在描述后面,描述的效果就被完全抵消了(命中率从 40/40 掉到 0/40),而在另一个模型系列上则部分保留。论文没有声称发现了底层机制,只说这是固定设置下精确编辑的统计效应。如果你的工作依赖智能体从长期记忆里检索关键信息,这条新闻提醒你:记忆格式的选择要针对具体模型测试;对普通用户,你不需要做任何事——这更像是一个给AI应用开发者的警告,提示他们别假设所有模型对记忆指令的反应一样。研究的价值在于它用预注册和开源数据(Zenodo上有全部代码和日志)把这种不确定性讲清楚了,但它的结论只适用于测试过的模型和短语形式,不能推广到所有智能体系统。
一项预注册研究通过 12 项对照试验、14,760 次尝试,系统测量了“记忆指令格式”如何影响AI智能体在行动前从档案中拉取记录的选择。研究者Kazuki Nakayashiki在arXiv预印本(编号arXiv:2609.03450)中报告,当智能体继承六条单行记忆时,它最多只能拉取一条归档源记录,而存储中写入的指令——无论是直接指向记录的指针、描述识别它的标准,还是两者兼有——都能显著改变这一选择,但效果高度依赖模型和措辞。
关键结果包括:在六个直接提供方模型上,长度匹配的描述性标准比纯ID平均高出 35.0 个百分点(95% 置信区间 [31.2, 38.8];研究D),但同样的对比在一个由九个模型组成的OpenRouter服务面板上未能通过预注册的优势规则(研究E)。
附加ID会抵消描述性标准的效果,且模型表现不一
在三个Claude模型(包括Opus 5)上,将ID附加到描述后面会完全取消标准的效果:Opus 5的命中率从 40/40 降至 0/40(研究F-x)。研究者通过逐字节匹配的修改(研究G)显示,每个精确字符串都有独立效应;但在以每单元格 80 次运行重跑后(研究G'),30 个复制对比中有 15 个落在边际内,15 个未解决,没有 1 个超出边际。
在五个描述字符串上,附加后缀的取消效应在Opus 5上适用于五个措辞中的四个,在Fable 5.1上适用于全部五个(研究H2);但在第二个存储中,所有模型都遵循了描述标准(研究H1)。进一步测试显示,当指令延续到决策层面时,描述标准在Opus 5上将选择推向当前记录(+100.0 点),而在Fable 5.1上则使其远离(研究I)。
- 补充一条确认行(+96.0 点,Opus 5)和两个信用额度(budget)的预算,能在所有三个模型上恢复目标选择(研究J)。
- 一个单字符计划指针的效应(+78.0 点;研究B,在修正其首个仓库报告后)在前瞻性预注册的重跑中得出一致结论(+81.7 点;研究B')。
- 论文强调所有结果都是对固定面板上精确编辑的描述性效应,具有注册区间,且不涉及机制性声明。
方法与数据可用性
论文共 46 页,包含 7 张图和 35 张表,涵盖 12 项预注册研究,全部集中于同一个“工具谱系”。每个软件包在首次确认调用前均被冻结、打时间戳并外部存储。
手稿、LaTeX源文件、所有试验文件、冻结包、分析器和每个数字的生成器均保存在Zenodo(DOI: https://doi.org/10.5281/zenodo.22267221)。论文提交于 2026 年 9 月 3 日,属于arXiv:2609.03450v1 [cs.IR]。
- 此报道仅基于论文摘要部分(arXiv摘要、提交摘要),未独立核实文中图表和附录细节。