NVIDIA NemoClaw:构建记忆驱动的 Chief of Staff Agent,准确率达 90.9%
NVIDIA 技术博客发表文章,介绍了如何使用 NVIDIA NemoClaw 构建一个记忆驱动的 Chief of Staff(幕僚长)Agent。该 Agent 维护一个结构化的"自我模型"(self model),记录人员、项目、优先级和工作模式等知识,能够在日常企业工作中持续学习和适应。基于 Agent Memory Benchmark 的评估显示,self model 将整体准确率从 82.8% 提升到 90.9%,将变更事实的追踪能力从 60.0% 提升到 100%。
背景:企业 Agent 的记忆挑战
传统 Agent 的局限性
传统的 AI Agent 在企业环境中面临记忆挑战:
- 每次对话从零开始,缺乏对用户和组织的了解
- 无法记住之前的决策、偏好和工作模式
- 重要信息(如人员关系、项目状态)容易丢失
- 无法从过去的错误中学习
- 随着时间推移,性能不会改善
企业工作的复杂性
企业工作涉及大量随时间变化的信息:
- 消息和沟通记录
- 决策和行动项
- 项目状态和里程碑
- 义务和承诺
- 人员关系和角色
- 优先级和偏好
一个有用的企业 Agent 需要能够持续跟踪和理解这些信息,而不是每次都重新构建上下文。
NemoClaw:记忆驱动的 Agent 框架
什么是 NemoClaw
NVIDIA NemoClaw 是一个用于构建记忆驱动 Agent 的框架,核心设计理念是:
- Agent 应该拥有结构化的、可检查的记忆
- 记忆应该区分"证据"和"判断"
- 用户应该能够纠正 Agent 的判断
- 纠正模式应该更新可读的偏好策略
- 运行时应该强制执行安全边界
self model:结构化知识层
Chief of Staff Agent 的核心是 self model——一个人类可读的知识层:
- 记录相关人员、项目、优先级和工作模式
- 以 Markdown 页面形式存储派生知识
- 定期审查新活动,跟踪义务,整合用户反馈
- 可以被用户检查和编辑
self model 不同于传统的向量数据库记忆:
- 结构化而非纯语义
- 人类可读而非黑盒
- 区分事实和推断
- 支持审计和修正
SQLite 账本:义务和审计记录
除了 self model,Agent 还维护一个 SQLite 账本:
- 记录义务(obligations)
- 记录排名(rankings)
- 记录用户纠正(corrections)
- 记录审计事件(audit events)
账本采用追加-only(append-only)设计,确保完整的审计追踪。
核心设计原则
1. 证据与判断分离
NemoClaw 的关键设计原则是将证据和判断分离:
- 证据:来自原始数据源的事实(邮件、消息、文档等)
- 判断:Agent 基于证据做出的推断和决策
这种分离使得:
- 用户可以检查 Agent 的判断是否合理
- 错误的判断可以被纠正而不影响证据
- 判断的演变可以被追踪
- 审计时可以区分事实和解释
2. 意图门控(Intent Gate)
Agent 使用意图门控来优先级排序:
- 将与用户声明的优先级相关的义务排在前面
- 优先于短期紧急但不重要的任务
- 帮助 Agent 专注于真正重要的工作
- 避免被琐碎任务分散注意力
3. 确定性代码执行关键逻辑
某些关键逻辑使用确定性代码而非 LLM 来执行:
- 层级大小限制(tier size)
- 溢出行为(overflow behavior)
- 排名顺序(ranking order)
这确保了关键行为的可预测性和一致性,不受 LLM 非确定性的影响。
4. 用户纠正和偏好学习
用户可以通过追加-only 的审计追踪纠正 Agent 的判断:
- 纠正记录被保存和分析
- 重复的纠正模式更新可读的偏好策略
- 偏好策略保持可检查和可编辑
- Agent 从纠正中学习,持续改进
运行时安全:NVIDIA OpenShell
沙箱执行
Agent 的运行时使用 NVIDIA OpenShell 进行沙箱化:
- 文件系统访问控制
- 进程管理和隔离
- 网络访问控制
- 凭证管理(凭证保存在沙箱外)
托管推理和 MCP 连接
- 托管推理在沙箱外执行,保护 API 密钥
- MCP(Model Context Protocol)连接也在沙箱外管理
- Agent 通过受控接口与外部系统交互
- 最小化攻击面和安全风险
性能评估
Agent Memory Benchmark
NVIDIA 团队使用 Agent Memory Benchmark 评估记忆驱动 Agent 的性能:
| 指标 | Agentic RAG 基线 | Self Model | 提升 |
|---|---|---|---|
| 整体准确率 | 82.8% | 90.9% | +8.1% |
| 变更事实追踪 | 60.0% | 100% | +40.0% |
关键发现
- self model 显著提升准确率:整体准确率提升 8.1 个百分点,说明结构化记忆比纯 RAG 更有效
- 变更事实追踪大幅改善:从 60% 提升到 100%,这是 self model 最显著的优势——它能正确跟踪随时间变化的事实
- 人类可读的记忆:self model 以 Markdown 存储,用户可以检查和编辑,建立信任
- 可审计的决策:证据与判断分离,加上追加-only 审计追踪,使得 Agent 的决策可以被审查
适用场景
1. 行政助理和日程管理
- 跟踪会议和行动项
- 管理日程冲突
- 提醒重要截止日期
- 准备会议材料
2. 项目管理
- 跟踪项目状态和里程碑
- 管理团队成员的任务分配
- 识别风险和阻塞
- 生成项目状态报告
3. 知识管理
- 组织和索引企业知识
- 回答关于人员、项目、决策的问题
- 跟踪知识的演变
- 确保信息的准确性和时效性
4. 决策支持
- 基于历史数据提供建议
- 识别模式和趋势
- 提醒潜在的冲突和矛盾
- 支持数据驱动的决策
与传统 RAG 的对比
| 特性 | 传统 Agentic RAG | NemoClaw Self Model |
|---|---|---|
| 记忆形式 | 向量嵌入 | 结构化 Markdown + SQLite |
| 人类可读 | 否 | 是 |
| 证据/判断分离 | 否 | 是 |
| 变更追踪 | 弱 | 强(100%) |
| 用户纠正 | 困难 | 容易(审计追踪) |
| 可审计性 | 低 | 高 |
| 偏好学习 | 有限 | 系统的(可读策略) |
| 运行时安全 | 依赖实现 | NVIDIA OpenShell 沙箱 |
总结
NVIDIA NemoClaw 的记忆驱动 Chief of Staff Agent 展示了结构化记忆在企业 Agent 中的重要价值。通过 self model(人类可读的 Markdown 知识层)和 SQLite 账本(义务、排名、纠正和审计记录),Agent 能够持续学习和适应用户的工作模式。证据与判断分离、意图门控、确定性代码执行关键逻辑、用户纠正和偏好学习等设计原则,确保了 Agent 的可靠性、可审计性和持续改进能力。基于 Agent Memory Benchmark 的评估显示,self model 将整体准确率从 82.8% 提升到 90.9%,将变更事实追踪从 60% 提升到 100%。NVIDIA OpenShell 沙箱则为 Agent 提供了安全的运行时环境。对于构建企业级 Agent 的团队来说,NemoClaw 的记忆架构设计提供了有价值的参考——结构化、可读、可审计的记忆比纯向量数据库 RAG 更能支撑复杂的企业场景。
来源:https://developer.nvidia.com/blog/building-a-memory-driven-agent-with-nvidia-nemoclaw