writing-dna-skill 解读:六层蒸馏,让 AI 复刻任意作者的写作风格
让 AI 模仿某个作者的文风,是很多人尝试过、又常常失败的需求。最近 GitHub 上有个开源项目试图正面解决这个问题——它不靠"塞几篇范文进 Prompt"这种笨办法,而是先让 AI 把一批文章系统性地拆解分析,提炼出一套可以反复套用的规则,再用规则指导写作。这个项目就是 writing-dna-skill(中文名"写作蒸馏器")。
项目由 GitHub 用户 larashero3-dotcom 开发,采用 MIT 协议开源,目前已经收获 1.2K Star、128 个 Fork。
项目地址:https://github.com/larashero3-dotcom/writing-dna-skill
一、它到底在做什么
简单来说:给 AI 提供 20 篇以上的完整文章,让它把这个作者或账号的写作风格拆解成一份"写作 DNA 报告"——包括语言习惯、文章结构、选题逻辑、素材偏好、认知框架甚至视觉风格。之后每次动笔前,AI 先读一遍这份报告再写。
需要强调的是,它既不是模型微调,也不是训练新的人格。它本质上是一套流程规范:告诉 Agent 按什么顺序、用什么方法去分析文章,然后把分析结果落成一组 Markdown 文件。写作时 AI 先读文件、再干活。
二、传统模仿方式为什么总是翻车
常见的做法一般是:找 3-5 篇范文 → 塞进 Prompt → 说一句"请参考以上风格写一篇 XX"。这套流程有三个明显缺陷:
样本量太少。 三五篇文章里的偶然写法,很容易被 AI 当成"固定风格"。比如某位作者某天心情好连用了几个感叹号,AI 就可能以为他每篇都要这么写。
只看表面、看不到本质。 AI 能模仿的往往是词句、段落这类表层特征,而真正让一个作者"像他自己"的东西藏得更深——他为什么选这个话题、为什么从这个角度切入、为什么引用这条数据而不是那条。这些靠几篇范文根本学不出来。
注意力容易漂移。 文章越长,AI 越容易写着写着就忘了开头"模仿风格"的要求,慢慢退回自己的表达习惯。
writing-dna-skill 的思路,相当于把这三个问题一次性解决:扩大样本、拆解深层特征、把风格规则显式化让 AI 随时对照。
三、核心设计:把风格拆成六个层次
这个项目最值得称道的地方,是不把"风格"当成一种模糊的感觉,而是拆成六个层次逐层分析:
| 层次 | 分析对象 | 提取方法 | 输出形式 |
|---|---|---|---|
| L1 表层语言 | 词频、句长、标点、修辞 | 脚本统计 | 词频表 + 句式清单 |
| L2 文章结构 | 开头 hook、正文架构、结尾收束 | 人工标注 | 结构模板(按类型分类) |
| L3 选题逻辑 | 发布时机、切入角度、话题优先级 | 归纳分类 | 选题判断树 |
| L4 素材策略 | 引用来源、权威对象选取、数据使用 | 阅读归纳 | 素材偏好清单 |
| L5 认知框架 | 世界观、价值判断、核心假设 | 深度阅读 | 核心命题列表 |
| L6 视觉风格 | 配图策略、排版、字体、色彩 | 图文统计 + 截图采样 | 视觉风格指南 |
这六层可以用三句话概括:
- L1-L2 解决"怎么写"——语言习惯和文章骨架
- L3-L5 解决"怎么想"——选题逻辑、素材策略、认知框架
- L6 解决"怎么呈现"——图文搭配和视觉风格
缺了任何一层都不完整:只复刻 L1-L2,写出来"读着像但想法不像";只复刻 L3-L5,"框架像但语气不像";忽略 L6,图文内容就会"文字像但看着不像"。
四、蒸馏产物长什么样
一次完整的蒸馏会产出一组结构化的 Markdown 文件:
作者或账号名称/
├── raw/ # 原始文章语料(至少20篇)
├── _meta/ # 元数据标注(标题、日期、类型等)
├── 语言DNA.md # ← L1 分析产物
├── 文章结构模板.md # ← L2 分析产物
├── 写作视角与认知框架.md # ← L3-L5 分析产物
├── 视觉风格指南.md # ← L6 分析产物
└── Writing-DNA.md # ← 最终整合文档(写作时最常用)
里面记录的内容非常具体。比如 语言DNA.md 可能包含:高频动词排行("指出""对比""意味着""关键是")、平均句长(27 字、15 字以下短句占 38%)、标点偏好(破折号使用频率是引号的 1.8 倍)、中英文混用模式(技术术语保留英文原文)等。
文章结构模板.md 则可能给出:深度分析类文章的"反直觉开篇 → 三个论点展开 → 一个反例 → 总结收束"结构、评论类文章的"事件简述 → 多数观点 → 我的角度 → 为什么别人看错了"结构,甚至标题习惯(80% 标题用"XX 其实是 XX"句式)。
写作视角与认知框架.md 里则沉淀了反复出现的核心命题(如"技术是双刃剑""信息差即价值")、素材偏好(优先英文一手来源、不信任二手转述)和选题判断树。
这些产物都是 AI 可以直接读取、逐条检查的规则,而不是一段模糊的"请模仿以下风格"。
五、快速上手:三步走
第一步:准备语料
收集目标作者至少 20 篇完整文章放进一个文件夹。要求:.md 或 .txt 格式均可;建议 30-50 篇;尽量覆盖不同时期、不同主题、不同类型;图文内容连配图一起保留(很多风格藏在图里)。可以手动收集,也可以让 Agent 帮忙从公众号、博客、Newsletter 抓取。
第二步:执行蒸馏
对 Agent 说一句话即可:
请使用 writing-dna-skill 蒸馏分析 raw/ 目录里的所有文章。
Agent 会自动按六层流程分析并输出那组 Markdown 文件。如果用的是 Claude Code、OpenClaw、Moxt 这类支持 Skill 的 Agent 工具,直接克隆仓库就能用:
git clone https://github.com/larashero3-dotcom/writing-dna-skill
第三步:用 DNA 写作
之后想按这个风格写文章,只需让 Agent 先读蒸馏产物再动笔:
请先阅读这个作者目录下的所有蒸馏产物,
尤其是 Writing-DNA.md、语言DNA.md、文章结构模板.md。
然后根据这些风格规则,帮我写一篇文章。
主题是:……
如果写出来不像,别让 Agent 自己瞎琢磨,直接让它逐项自检:
请对照 语言DNA.md、文章结构模板.md、写作视角与认知框架.md,
逐项自检刚才的输出,找出不符合风格规则的地方,然后重写。
这个"逐条检查"的指令往往比"整体感觉"可靠得多,是项目里很实用的一招。
六、边界与注意事项
项目文档里也明确写了几条边界,需要正视:
- 它不是万能的。 这是 Context Engineering 系统,不是模型微调工具。底层模型表达能力有限的话,DNA 再精准也救不了——Skill 解决的是"怎么约束模型",模型本身的天花板还在那里。
- 语料质量决定上限。 如果喂进去的 20 篇全是某一时期、某一种类型的文章,蒸馏出的 DNA 只能代表那个切片。想复刻完整风格,需要足够多样的样本。
- 不要用于冒充作者本人。 项目文档特别强调了这一条:工具用于学习、分析、风格研究和个人写作资产沉淀,不要用于冒充作者本人、误导读者或侵犯他人版权。
七、适用场景
- 沉淀个人写作资产:把自己过去写的公众号文章、博客、Newsletter 蒸馏一遍,以后换模型、换 Agent 直接喂 DNA,相当于给写作习惯做了一份"备份"。
- 拆解行业标杆:想研究某个博主为什么火,把他 50 篇文章蒸馏一下,选题逻辑、素材偏好、认知框架全部变成明明白白的规则,学习效率远高于通读。
- 统一团队风格:内容团队多人写作风格不一时,把"定调"的核心文章蒸馏成一份 DNA,所有人写之前先读一遍。
- 对比作者差异:把两个作者的 DNA 并排对比,能看到"同一个话题,A 从数据切入、B 从故事切入;A 核心命题是效率优先、B 是人文关怀"这类高价值洞察。
写在最后
writing-dna-skill 最大的启发,不是"如何更好地模仿风格",而是提供了一套把模糊感受变成可执行规则的方法论。这个思路不止适用于写作——说话方式、产品审美、代码风格,凡是能拆出可量化维度的东西,都可以用类似方式"蒸馏"后再交给 AI 执行。
项目地址:https://github.com/larashero3-dotcom/writing-dna-skill