PenguinHarness 工程笔记:Agent 能改写自己的 Skill,token 还省到 1/70
先讲结论
PenguinHarness 是 TypeScript 写的开源多智能体应用开发平台,Apache-2.0,本地优先、数据不出机器、最低单 CPU 可运行。仓库是 Prism-Shadow/penguin-harness(1810 stars,2026-07-19 创建)。官方定位一句话:"用 Agent 构建 Agent",并宣称比 LangChain 手搭快 100~200 倍——这是宣称,听听就好。
真正值得工程师琢磨的是两个互相咬合的机制,下面都给出证据。
机制 1:Skill 就是磁盘文件,Agent 能改写自己的 Skill
这是整个"自进化"闭环能成立的地基,工程设计上朴素得有点漂亮:
- Skill 以文件形式放在磁盘上
- 无缓存,每次读取直接走磁盘
- 因此 Agent 读 Skill → 改 Skill 文件 → 下一轮按新 Skill 行动,整个链路就是普通的文件读写
"框架支持 Agent 自进化"在这里没有任何黑盒:你去磁盘上 diff 一下就知道 Agent 把 Skill 改成了什么,改坏了可以回滚。所谓自进化支持,本质上是"允许 Agent 写文件"加一层护栏。
护栏由 CONTRACT.md 定义:
- Agent 只能改三处可编辑状态:
AGENTS.md、Skills/、config - 内核代码不可写,Agent 试图动内核文件会被自动拦截
- 每轮自动打快照,可随时回滚
意思是:它可以自由迭代自己的"技能",但碰不到引擎本身。
机制 2:刻意精简,所以 token 花得少
两个层面的证据。
1. 系统提示词体积:默认约 1300 token,Claude Code 对比值约 15000 token,差一个数量级。来源是刻意精简的工具集 + 干净底层接口:工具少,工具调用次数就少,token 自然省。同时对 DeepSeek 这类开放模型做了深度适配。
2. 官方 benchmark(数据分析任务)对比:
| 工具 | 模型 | 准确率 | 总 token | 成本 |
|---|---|---|---|---|
| PenguinHarness | DeepSeek V4 Pro | 66.67% | 18.04M | $0.55 |
| Claude Code | Claude Opus 4.8 | 53.33% | 22.20M | $38.48 |
| OpenAI Codex | GPT-5.5 | 53.33% | 13.72M | $19.41 |
三点结论:
- 准确率最高(66.67% vs 两个 53.33%)
- 成本约为 Claude Code 的 1/70($0.55 vs $38.48)
- 但注意一个老实细节:总 token 不是三者最低(Codex 是 13.72M)。低成本来自模型选型 + 调用结构,别把"省 token"误读成"绝对 token 最少"
另一个成本参考:官方演示用一句话生成一个带引用来源 + 流式输出的完整 RAG 应用,DeepSeek V4 Pro,约 $0.02(¥0.2)。注意:这是演示成本,不是保证价。
自进化怎么工作:四角色 + 四步闭环
四个角色
- Builder(顶层):先跑
agent-creation生成 Agent 应用,再跑benchmark-design设计/校准 Benchmark,并冻结 Baseline - Target Agent(被改进对象):只在隔离 Workspace 里跑评估
- Evaluator(叶子):由
run_subagent创建,运行并私下打分一条 Case - Optimizer(顶层):独立开新 Session 跑
agent-optimization
四步闭环
- 并行评估:用
run_subagent派发 Evaluators,覆盖 Case × runs 矩阵 - 提候选:根据分数和 Trace,提出一个候选改动(内部循环:证据 → 假设 → 候选 → 评估 → 接受/回滚)
- 应用改动:只编辑 Target Agent 的可编辑状态(
AGENTS.md、Skills/、config),生成 N+1 版 - 判定:候选分数严格高于 Formal Baseline 才接受,否则回滚;达目标分提前停,否则跑完配置轮次,保留最高分
防止作弊的设计
- Evaluator 私下评分,rubric 对 Optimizer 不可读——防止 Optimizer 针对评分标准过拟合
- 评估运行时固定:provider / model / thinking_level 全部冻结,评分前比对会话元数据,保证分数可比
官方演示:某 Agent 从 53 分提升到 95 分,用 DeepSeek V4 Flash,token 成本约 0.5 元。同样标注:演示成本,不是保证价。
安装与上手
- CLI:一行命令装出
penguin(原文未提供具体命令,以仓库 README 为准) - 桌面端:双击安装,内嵌服务端
- Web UI:
penguin web起在http://127.0.0.1:7364,包含多会话、Agent/Skill/模型管理、用量统计、Trace 观测、评估中心
配置模型:
penguin config model add --provider deepseek --model-id deepseek-v4-flash --api-key sk-... --set-default
三种跑法:
penguin run -m "..." # 单次任务
penguin chat # 交互式 REPL
penguin server # 无界面服务,API 与 Web 相同
SDK 最小示例
import {
createAgent,
isCompleteModelMessage,
userText,
} from "@prismshadow/penguin-core";
const agent = await createAgent({ agentId: "default_agent" });
const session = await agent.createSession({ workspaceDir: process.cwd() });
// 遍历 session.run 的事件流,过滤完整文本消息
for await (const message of session.run([userText("你的问题")], {
approve: () => "allow",
})) {
if (isCompleteModelMessage(message) && message.type === "text") {
console.log(message.payload.text);
}
}
approve: () => "allow" 是无脑放行工具调用,demo 够用;生产环境建议接人工审批。
内置 Skills 与模型支持
四组 Skill:
- 办公效率:
data-analysis、firecrawl - 软件开发:
web-design、software-engineering - AI 应用开发:
penguin-sdk、penguin-cli、agenthub-models、vllm、ollama、llamafactory - Agent 调优:
agent-creation、benchmark-design、agent-evaluation、agent-optimization
其中"Agent 调优"四个 Skill 就是自进化闭环的具体实现:benchmark-design 负责设计/校准 Benchmark、冻结 Baseline;agent-evaluation 负责隔离执行 + 私下评分,输出协议是 YAML;agent-optimization 跑证据 → 假设 → 候选 → 评估 → 接受/回滚循环;agent-creation 一句话生成 Agent 应用(脚手架、prompt、Skill、config、前端、运行说明)。
模型供应商:DeepSeek V4、Kimi K3、GLM 5.2、Hunyuan 3、Qwen 3.8 Max、GPT 5.6、Gemini 3.6 Flash、Claude 5、Inkling。DeepSeek 可走 OpenRouter / Fireworks / SiliconFlow / Qwen Token Plan 等通道。
边界:什么时候别用它
- 把演示成本当 SLA:$0.02 生成 RAG 应用、0.5 元完成一次自进化,都是特定模型 + 特定任务下的演示数字。换任务、换模型、换渠道,成本会变。省不省,拿你自己的任务跑一次 benchmark 再说。
- 需要灵活的评估/模型对比:评估运行时是固定的(provider/model/thinking_level 冻结),评分前还要比对会话元数据。它是为"固定条件下的持续改进"设计的,不是给你天天换模型重跑对比实验的。
- 需要改内核代码:Agent 被
CONTRACT.md限制在AGENTS.md/Skills//config三个可编辑区域,动内核会被自动拦截。这是自进化的护栏,但也意味着"深度定制框架内核"不在机制支持范围内——那需要 fork 自己做。
另外,它的设计取向是本地优先、数据不出机器、单 CPU 可跑。这是特性也是形态边界:要做成中心化多租户服务,外层得自己搭。
链接
- GitHub:https://github.com/Prism-Shadow/penguin-harness
- 官网:https://penguin.ooo/