编程 Blume:把编码 agent 的纠正变成规则、hooks 和 skills

2026-09-07 18:12:26

Blume:把编码 agent 的纠正变成规则、hooks 和 skills

每个编码 agent 会话都以同样的方式结束:某处你打了"不,我们用仓库模式"、"别再加 console.log"、或"你怎么又这样"。agent 修了,会话结束,下一个会话从零开始——第二天你又打了一遍同样的纠正。

问题:agent drift

作者在上家创业公司用 agent 快速交付,后来付出代价:同功能的重复函数用不同名字、一个服务里三种错误处理方式、架构决策只维持一周(新会话的 agent 不知道)、生产 bug 追溯到"人类在聊天里解释了五遍的规则,agent 不知道"。常规修法是手工维护 CLAUDE.md / AGENTS.md / Cursor rules——Claude Code 作者 Boris Cherny 的建议直白:每次 Claude 犯错,别告诉它改做法,告诉它把修复写进 CLAUDE.md。这是好建议,几乎没人坚持,因为它是和实际工作抢时间的杂务。

两个失败路径:手工维护(有人负责规则文件,约两周后文件过期、没人信、纠正退回聊天);朴素自动化(每次被纠正就让 agent 追加一条规则——上下文文件无限增长、充满互相矛盾的一次性指令、agent 因为上下文大部分是噪音而变差)。上下文膨胀是真实成本:过长的 CLAUDE.md 更慢、更贵、更不可能被遵循。两个方法都没回答真问题:哪些纠正是信号?

想法:从会话本身提取意图

会话已经包含答案:同一件事三周内纠正五次,那是规则;纠正一次就过去,不是。信息在模式里,不在任何单条消息里。Blume 读取 agent 存在磁盘上的会话历史,找三类信号:纠正("不,不是那样""用 X 替代 Y"——对 agent 行为的直接反转);挫败(短促、重复、升级的消息;本该简单却高 token 消耗——"你怎么又这样"时刻);轻推(不是纠正但反复出现的软引导——"记得跑测试""检查类型")。

按主题聚类。当聚类越过阈值,Blume 提议一个具体变更:上下文文件的规则、自动运行的 hook、或打包你反复解释的工作流的 skill。你读提议,批准或拒绝——不经你同意不写入任何配置

阈值

保守设计:同一主题聚类出现五次;或两次被分类为 pain(带挫败信号或异常高 token 消耗)。以下都保持为可查看的观察而非建议。目标:建议出现时是你点头的那种,而不是要费劲想的那种。它不尝试读任何单条消息里的情绪——等复现。一晚不好是一次数据点,同一晚三次是规则。

日常形态

桌面应用后台运行:主屏显示本机每个 agent 会话的状态(工作/完成/等你批准),可同时跑多个会话;映射塑造 agent 行为的隐藏文件(rules、skills、hooks、散在各项目的上下文文件)——多数人不知道自己有多少这类文件、哪些还在被读取。Setup 页:每个 CLAUDE.md、skill、hook、MCP server(跨 harness 与项目)。建议卡片显示产生它的会话时刻簇(证据)与提议的规则或 hook。Improve 页:纠正/引导频率分析与产生的建议。兼容 Claude Code、Codex、Cursor,免费,macOS/Linux/Windows,数据不出本机。

工程要点

核心取舍:规则的质量由信号提取阈值决定——太松上下文爆炸、太紧留不住教训;"等复现"是防噪音的关键机制。对用编码 agent 的团队,这条路线(会话模式 → 聚类 → 人类批准的规则/hook)比手工维护和朴素自动追加都更可持续,因为它把"哪些纠正是信号"的判定从意志力转移给了可审计的阈值。

来源:I built Blume: it turns your coding-agent corrections into rules - DEV Community

复制全文 生成海报 AI agent 开发工具 开源项目

推荐文章

程序员茄子在线接单