Theory of Agent 综述:Agent 该内化什么,该外化什么
北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学、北京工业大学、中国科学院计算技术研究所、百度等 8 家机构的 19 位研究者联合完成了一篇 Theory of Agent 综述,讨论 LLM Agent 的能力应该放在模型内部还是外部 harness,并沿这个视角梳理学习、对齐、演化与评测。
- 论文:Theory of Agent: The Science of Internalization and Externalization for LLM-based Agents
- 论文链接:
- GitHub:
综述覆盖约 600 项近期研究,统一用内化(internalization)与外化(externalization)两个方向来分析 Agent 从设计到学习、对齐、演化和评测的全过程。
问题从哪里来
一个本可直接推理的问题,Agent 却连续搜索网页、调用多个工具。任务完成了,时间和费用多花了不少,这是过度行动(overacting)。另一种情况是,问题需要实时信息,Agent 一直在模型内部推理,最后给出流畅但没有依据的答案,这往往同时涉及过度思考(overthinking)和行动不足(underacting)。
这两类失败都不是单纯的模型能力问题,而是能力配置问题:哪些信息与过程应当固化在模型里,哪些必须留在外部系统中动态获取。
模型与 Harness,能力放在哪一侧
LLM Agent 通常由模型和外部 Harness 两个紧密耦合的部分组成。
稳定、反复使用的知识和程序适合内化进模型,可以减少重复检索和工具调用、降低延迟。实时事实、精确计算、可验证执行、可编辑记忆和环境状态则适合外化在 harness 中,便于更新信息、追溯来源、控制执行过程。
同样的配置问题出现在几组常见的技术选择里:长上下文还是 RAG;参数化记忆还是外部记忆;工具集成推理(TIR)还是工具内化推理(TInR);单模型能力还是多智能体工作流;更长的思维链还是更及时的搜索、执行与验证。
Foundations:下一步该做什么
Agent 在每个时刻都持有关于任务答案、下一步动作或环境状态的某种信念,并据此判断三件事:
- 当前信念是否已足以作出决策;
- 如果仍有不确定性,应该通过内部推理继续处理,还是通过外部行动获取新信息;
- 这一步带来的信息增益,是否值得其成本与风险。
推理与行动在这个框架下都属于减少不确定性的"知识操作",区别只在于操作发生在模型内部还是环境里。
知识边界随模型、任务和环境变化
- 内部任务集:当前 Agent 仅依靠内部推理就能可靠完成的任务。
- 世界任务集:允许适当外部交互时,原则上可以在环境中完成的任务。
两者之间的分界就是 Agent 的知识边界(knowledge boundary)。工具的可用性与必要性需要分开判断:任务落在内部任务集时,调用工具可能有帮助,但并非必需;任务超出内部能力时,外部行动才具有认知必要性。
四种常见失误
Agent 可能高估或低估自身能力,对应的失误分别出现在推理侧或行动侧:过度思考、思考不足、过度行动、行动不足。工具调用次数和推理长度都不能单独用来判断决策好坏——论文用认知智能比率(epistemic intelligence ratio)衡量单位努力带来的有效信息增益。
Learning:如何配置模型与 Harness 的能力
内化方向有四条路径:
- 内化记忆:稳定的用户规律、反复出现的任务模式和高频经验逐步进入模型状态、适配器或参数;
- 内化规划与推理:把任务分解、搜索、反思和验证等临时生成的过程转化为较稳定的程序性能力;
- 内化工具使用策略:学习何时调用、选择哪个工具、如何构造参数;
- 内化世界模型:通过学习环境动力学和动作后果,在执行前进行内部模拟。
外化方向有三条:
- 外部记忆保存状态、交互历史和证据,支持写入、检索、合并、遗忘;
- 外部技能把程序性知识封装为可检查、可复用、可组合的操作单元;
- 外部编排把控制流、权限、验证、回滚、Agent 协作和工具协议放在 harness 中,使执行过程可观察、可恢复、可治理。
什么时候内化,什么时候外化
判断维度有六条:
- 稳定性:是否长期不变;
- 复现频率:是否会高频重复;
- 摊销价值:训练一次后能否在大量任务中降低成本;
- 新鲜度:是否必须实时更新;
- 可验证性与可回滚性:是否需要保留来源、审计和撤销能力;
- 用户控制与安全治理:是否应允许用户编辑,或必须由外部权限系统约束。
长期稳定、经常复现且有摊销价值的规律适合内化;实时变化、高风险或需要审计的证据与操作适合留在外部。许多实际系统最终会采用混合配置:模型内化通用策略,harness 提供实时证据、执行接口和安全边界。
Aligning:校准思考、行动、委派与停止的时机
不确定性估计需要落到具体的行为选择上。工具路由要区分可用性与必要性,并随模型能力、任务和当前状态动态调整。个性化需要区分信息类型:稳定低风险的偏好可以内化,敏感可撤销的信息保留在可审计的外部记忆。安全检查要覆盖整条轨迹,只看最终回答无法判断过程是否安全。多智能体协作同样要核算成本,新增 Agent、角色或通信边带来的边际信息价值应高于协作成本。
Evolving:用经验降低后续决策成本
分为三个层次:内部演化把经验转化为可复用的模型能力;外部演化改进 harness;生态演化把群体与环境反馈用于下一轮适配。
衡量一次更新是否有效,要看长期是否降低了有用信息的获取成本、提高了可靠性,或者改善了边界判断。单独增加工具、记忆或 Agent 数量,并不能保证改进。
Evaluation:成功率之外还要看什么
两个 Agent 得到同样的正确答案,一个只做了必要的推理和一次验证,另一个调用了十几个工具、经历多轮无效循环。只看成功率,两者得分相同。因此准确率、内部成本、外部成本、安全、校准和过程质量需要分别报告。
现有 benchmark 分三类:
- 内化能力评测,建立内部基线(知识、推理、live evaluation、认知自我监测);
- 外化能力评测,考察工具、Web/GUI/OS、软件仓库、研究环境,以及外部记忆、技能与 harness;
- 权衡导向评测,关注边界判断。
反事实评测协议对同一任务设置三种访问条件(no-tool / 固定支持 / 自适应支持),用来检查几件事:no-tool 已能成功但 adaptive 仍大量调用工具,说明过度行动;no-tool 无法成功却拒绝求助,说明行动不足;工具提供错误信息时,Agent 能否验证;外部行动提高完成率却带来安全风险时,Agent 是否知道停止。
四个待解决的问题(开放方向)
总结
论文把内化与外化的边界当作 Agent 设计的治理轴。是否调用工具,取决于任务本身是否需要外部信息;是否继续思考,取决于剩余不确定性能否在内部消解。经验是否进入参数、外部记忆与工作流是否留在 harness,则要依据稳定性、复用价值和治理要求来定。