编程 NVIDIA NemoClaw:构建记忆驱动的 Chief of Staff Agent,准确率达 90.9%

2026-09-06 16:26:55

NVIDIA NemoClaw:构建记忆驱动的 Chief of Staff Agent,准确率达 90.9%

NVIDIA 技术博客发表文章,介绍了如何使用 NVIDIA NemoClaw 构建一个记忆驱动的 Chief of Staff(幕僚长)Agent。该 Agent 维护一个结构化的"自我模型"(self model),记录人员、项目、优先级和工作模式等知识,能够在日常企业工作中持续学习和适应。基于 Agent Memory Benchmark 的评估显示,self model 将整体准确率从 82.8% 提升到 90.9%,将变更事实的追踪能力从 60.0% 提升到 100%。

背景:企业 Agent 的记忆挑战

传统 Agent 的局限性

传统的 AI Agent 在企业环境中面临记忆挑战:

  • 每次对话从零开始,缺乏对用户和组织的了解
  • 无法记住之前的决策、偏好和工作模式
  • 重要信息(如人员关系、项目状态)容易丢失
  • 无法从过去的错误中学习
  • 随着时间推移,性能不会改善

企业工作的复杂性

企业工作涉及大量随时间变化的信息:

  • 消息和沟通记录
  • 决策和行动项
  • 项目状态和里程碑
  • 义务和承诺
  • 人员关系和角色
  • 优先级和偏好

一个有用的企业 Agent 需要能够持续跟踪和理解这些信息,而不是每次都重新构建上下文。

NemoClaw:记忆驱动的 Agent 框架

什么是 NemoClaw

NVIDIA NemoClaw 是一个用于构建记忆驱动 Agent 的框架,核心设计理念是:

  • Agent 应该拥有结构化的、可检查的记忆
  • 记忆应该区分"证据"和"判断"
  • 用户应该能够纠正 Agent 的判断
  • 纠正模式应该更新可读的偏好策略
  • 运行时应该强制执行安全边界

self model:结构化知识层

Chief of Staff Agent 的核心是 self model——一个人类可读的知识层:

  • 记录相关人员、项目、优先级和工作模式
  • 以 Markdown 页面形式存储派生知识
  • 定期审查新活动,跟踪义务,整合用户反馈
  • 可以被用户检查和编辑

self model 不同于传统的向量数据库记忆:

  • 结构化而非纯语义
  • 人类可读而非黑盒
  • 区分事实和推断
  • 支持审计和修正

SQLite 账本:义务和审计记录

除了 self model,Agent 还维护一个 SQLite 账本:

  • 记录义务(obligations)
  • 记录排名(rankings)
  • 记录用户纠正(corrections)
  • 记录审计事件(audit events)

账本采用追加-only(append-only)设计,确保完整的审计追踪。

核心设计原则

1. 证据与判断分离

NemoClaw 的关键设计原则是将证据和判断分离:

  • 证据:来自原始数据源的事实(邮件、消息、文档等)
  • 判断:Agent 基于证据做出的推断和决策

这种分离使得:

  • 用户可以检查 Agent 的判断是否合理
  • 错误的判断可以被纠正而不影响证据
  • 判断的演变可以被追踪
  • 审计时可以区分事实和解释

2. 意图门控(Intent Gate)

Agent 使用意图门控来优先级排序:

  • 将与用户声明的优先级相关的义务排在前面
  • 优先于短期紧急但不重要的任务
  • 帮助 Agent 专注于真正重要的工作
  • 避免被琐碎任务分散注意力

3. 确定性代码执行关键逻辑

某些关键逻辑使用确定性代码而非 LLM 来执行:

  • 层级大小限制(tier size)
  • 溢出行为(overflow behavior)
  • 排名顺序(ranking order)

这确保了关键行为的可预测性和一致性,不受 LLM 非确定性的影响。

4. 用户纠正和偏好学习

用户可以通过追加-only 的审计追踪纠正 Agent 的判断:

  • 纠正记录被保存和分析
  • 重复的纠正模式更新可读的偏好策略
  • 偏好策略保持可检查和可编辑
  • Agent 从纠正中学习,持续改进

运行时安全:NVIDIA OpenShell

沙箱执行

Agent 的运行时使用 NVIDIA OpenShell 进行沙箱化:

  • 文件系统访问控制
  • 进程管理和隔离
  • 网络访问控制
  • 凭证管理(凭证保存在沙箱外)

托管推理和 MCP 连接

  • 托管推理在沙箱外执行,保护 API 密钥
  • MCP(Model Context Protocol)连接也在沙箱外管理
  • Agent 通过受控接口与外部系统交互
  • 最小化攻击面和安全风险

性能评估

Agent Memory Benchmark

NVIDIA 团队使用 Agent Memory Benchmark 评估记忆驱动 Agent 的性能:

指标Agentic RAG 基线Self Model提升
整体准确率82.8%90.9%+8.1%
变更事实追踪60.0%100%+40.0%

关键发现

  1. self model 显著提升准确率:整体准确率提升 8.1 个百分点,说明结构化记忆比纯 RAG 更有效
  2. 变更事实追踪大幅改善:从 60% 提升到 100%,这是 self model 最显著的优势——它能正确跟踪随时间变化的事实
  3. 人类可读的记忆:self model 以 Markdown 存储,用户可以检查和编辑,建立信任
  4. 可审计的决策:证据与判断分离,加上追加-only 审计追踪,使得 Agent 的决策可以被审查

适用场景

1. 行政助理和日程管理

  • 跟踪会议和行动项
  • 管理日程冲突
  • 提醒重要截止日期
  • 准备会议材料

2. 项目管理

  • 跟踪项目状态和里程碑
  • 管理团队成员的任务分配
  • 识别风险和阻塞
  • 生成项目状态报告

3. 知识管理

  • 组织和索引企业知识
  • 回答关于人员、项目、决策的问题
  • 跟踪知识的演变
  • 确保信息的准确性和时效性

4. 决策支持

  • 基于历史数据提供建议
  • 识别模式和趋势
  • 提醒潜在的冲突和矛盾
  • 支持数据驱动的决策

与传统 RAG 的对比

特性传统 Agentic RAGNemoClaw Self Model
记忆形式向量嵌入结构化 Markdown + SQLite
人类可读
证据/判断分离
变更追踪强(100%)
用户纠正困难容易(审计追踪)
可审计性
偏好学习有限系统的(可读策略)
运行时安全依赖实现NVIDIA OpenShell 沙箱

总结

NVIDIA NemoClaw 的记忆驱动 Chief of Staff Agent 展示了结构化记忆在企业 Agent 中的重要价值。通过 self model(人类可读的 Markdown 知识层)和 SQLite 账本(义务、排名、纠正和审计记录),Agent 能够持续学习和适应用户的工作模式。证据与判断分离、意图门控、确定性代码执行关键逻辑、用户纠正和偏好学习等设计原则,确保了 Agent 的可靠性、可审计性和持续改进能力。基于 Agent Memory Benchmark 的评估显示,self model 将整体准确率从 82.8% 提升到 90.9%,将变更事实追踪从 60% 提升到 100%。NVIDIA OpenShell 沙箱则为 Agent 提供了安全的运行时环境。对于构建企业级 Agent 的团队来说,NemoClaw 的记忆架构设计提供了有价值的参考——结构化、可读、可审计的记忆比纯向量数据库 RAG 更能支撑复杂的企业场景。

来源:https://developer.nvidia.com/blog/building-a-memory-driven-agent-with-nvidia-nemoclaw

推荐文章

程序员茄子在线接单