NVIDIA推出基于NemoClaw的记忆驱动型Chief of Staff智能体,显著提升任务准确率

NVIDIA技术博客发布了一个开源配方,展示如何使用NemoClaw构建具备持久记忆的智能体,通过名为self model的知识层提升企业工作流中的任务表现。

AI解读:企业日常工作依赖大量随时间变化的信息——消息、决策、项目状态和待办义务。传统AI智能体缺乏这种背景,每次都要从头理解,容易出错。英伟达用自家的NemoClaw框架做了个“记忆驱动型Chief of Staff”智能体,核心是在标准对话历史之外,维护一个Markdown格式的结构化知识层(self model),记录人员、项目、优先级、工作模式,并用SQLite账本保存判断和纠错记录。这个设计让智能体在回答问题时能关联过去的决策、识别同一实体的不同名称、区分优先级而非被“紧急”标签牵着走。评估显示,在186个问题上,整体准确率从82.8%提到90.9%,追踪随时间变化的事实从60%提高到100%,实体消歧准确率也涨了20个百分点。代价是简单的单跳查找和严格基于语料的忠实回答略有下降。该配方已开源,但当前版本只做内存管理,不实际发送消息或连接外部系统。对于想在企业场景用AI处理复杂协作的人来说,这提供了一条把记忆结构化并与安全边界解耦的可行路径。

NVIDIA技术博客发布了一篇新文章,介绍其团队使用NVIDIA NemoClaw构建“记忆驱动型Chief of Staff”智能体的方法和代码配方。该智能体通过维护一个名为self model的人类可读知识层(记录相关人员、项目、优先级和工作模式),让AI在没有预先背景的情况下也能更好地处理跨时间的企业工作信息。

记忆驱动型智能体的核心设计:self model与三层分离

博客文章称,企业工作跨越消息、决策、项目和随时间变化的义务。一个没有这种背景的AI智能体必须先重建它才能做出贡献。为了解决这个问题,团队在NVIDIA NemoClaw中构建了记忆驱动型Chief of Staff,它维护一个名为self model的知识层,以结构化的Markdown页面组织人员、项目、优先级、目标、概念和重复工作模式等信息。self model存储的是派生解释,而非替代源证据,将两者分开,便于开发者判断错误回答源自证据、记忆维护、检索还是模型最终决策。

该示例中存储两类信息:知识(人员、项目、优先级、工作模式)和判断(某项是否需要关注、优先级排序、用户是否忽略)。知识存储在Markdown智能体记忆中,而义务、排名、纠正和审计事件存储在SQLite账本中。这种设计保留了智能体的判断,而不会将其写入源消息作为已读标志、标签或文件夹。

在运行时,分离由NVIDIA NemoClaw和NVIDIA OpenShell安全运行时强制执行。NemoClaw集成示例并管理其生命周期,NVIDIA OpenShell在沙箱中运行智能体,为文件系统、进程和网络访问提供治理和策略执行。用于托管推理和MCP连接的凭据保留在沙箱之外。文章强调,记忆和检索内容只是模型的输入,不是可信的安全策略。

要调整该记忆设计,用户可以参考NVIDIA/nemoclaw-community GitHub仓库中的开源“Memory-Driven Chief of Staff”配方。该配方打包为可部署的Hermes配置文件,包含结构化记忆模式、持久义务账本、有界排名逻辑、用户纠正和审计路径、定时记忆维护、合成消息和记忆页面、离线演练以及单元测试套件。配方的当前版本侧重于记忆基础,不发送消息或修改源系统;直播连接器需要单独处理凭据、隐私、保留和删除。

评估结果与设计经验

将该记忆驱动型Chief of Staff添加到NemoClaw后,多个智能体任务的表现有可测量的提升。评估比较了执行多轮检索的智能体RAG基线与self model的效果。在 186 个问题上,self model的整体准确率为 90.9%,而智能体RAG基线的准确率为 82.8%,提升了 8.1 个百分点。在困难问题上,准确率从 67.7% 提高到 87.1%(+19.4 个百分点);在追踪随时间变化的事实上,从 60.0% 提高到 100.0%(+40.0 个百分点);在时间点推理上,从 33.3% 提高到 66.7%(+33.3 个百分点);在实体消歧上,从 66.7% 提高到 86.7%(+20.0 个百分点);在多源综合上,从 87.7% 提高到 94.5%(+6.8 个百分点)。但并非所有指标都提升:基于语料的忠实回答从 100.0% 降至 92.3%(-7.7 个百分点),单跳查找从 86.7% 降至 83.3%(-3.3 个百分点)。引用覆盖率从 92.5% 提高到 97.8%(+5.4 个百分点)。两种配置均使用NVIDIA Nemotron 3 Ultra。评估指标和示例见示例仓库。

文章最后分享了五条适用于智能体构建的设计经验:在每日工作中保留上下文以提升任务质量;分离证据、知识和行动以帮助智能体做出更好的判断;记忆驱动型智能体设计可优先考虑用户意图而非短期紧急性;允许用户纠正智能体决策以建立信任;用NVIDIA OpenShell强制执行安全和授权边界。文章特别指出,传入的请求常自称“紧急”,但紧急性未必反映用户的优先事项,因此意图门将最高层级保留给与用户明确优先事务相关的义务。在公开配方中,一个紧急的费用政策证明仍保持可见,但排名低于一个与明确优先事项相关的安静请求。

信息来源