LLM Wiki:会生长的个人知识库,编译一次持续更新,2300+ Star
X 上有个人把自己多年的日记、Apple Notes、iMessage 对话全部喂给 LLM,编译出了一套个人百科——2500 条个人笔记变成了 400 篇互链百科。更有意思的是,他让 Agent 去 Wiki 里找审美灵感,Agent 不光做了语义搜索,还沿着图谱关联路径,翻出了他看吉卜力纪录片的笔记、截图保存的 YC 公司落地页、连几年前存的披头士周边图片都翻出来了,结果拼出了一份极其懂他的创意方案。
最近在 GitHub 上看到一个叫 LLM Wiki 的项目,能以工程化的方式来干类似的事,已经获得了 2300+ Star。
一句话概括:这是一个跨平台桌面应用,你把文档丢进去,LLM 自动帮你生成结构化、互链的知识库,而且这个知识库会随着你不断添加资料而生长。
它的思路来自 Karpathy 的一条浏览量超过 1700 万的帖子。好多人都想让知识库自己"长"起来,传统 RAG 每次提问都从零检索,用完就忘。LLM Wiki 和传统 RAG 的核心区别是:RAG 每次提问都从零检索、用完就忘,LLM Wiki 是编译一次、持续更新,知识会沉淀、会复利。你问过的复杂问题,答案也可以回写成新页面,让探索本身也成为知识积累的一部分。
两步摄入:先分析,再生成
LLM Wiki 把处理拆成了两步。首先 LLM 读取源文档,提取关键实体、概念、论点,找出和已有 Wiki 的关联与矛盾。然后再把分析结果生成 Wiki 页面——实体页、概念页、来源摘要页,同时更新 index.md、log.md 和 overview.md。拆开之后,LLM 不再同时做理解和创作两件事,生成的东西自然更靠谱。
举个例子,你在做一个 AI Agent 的深度研究,陆续投入了 20 篇论文和 10 份技术报告。分析阶段,LLM 会发现第 3 篇论文提到的"Tool Use"和第 17 篇的"Function Calling"其实是同一个概念的不同表述,还会标记出第 5 篇和第 12 篇在 Agent 自主性上的观点矛盾。生成阶段,LLM 把它们合并为一个概念页,在矛盾处标注分歧来源。这些洞察,单独阅读任何一篇论文都得不到。
知识图谱与图洞察
LLM Wiki 不只是生成页面,它还在页面之间构建了一张知识图谱。相关性用四个信号决定:直接链接(×3.0 权重)、来源重叠(×4.0)、Adamic-Adar 共同邻居(×1.5)、类型亲和度(×1.0)。技术用的是 sigma.js + graphology + ForceAtlas2 来实现页面可视化,节点按页面类型或社区着色,大小按链接数缩放,边的粗细和颜色按相关性权重显示。
基于这张图谱,Louvain 算法自动发现知识集群,每个社区还会计算内聚度评分,低于 0.15 的集群会被标记为"稀疏社区",提示你可能需要补充资料。
真正好用的是"图洞察"功能。系统会自动分析结构,标出三类问题:
- 孤立页面:几乎没人链过来(入度 ≤ 1),容易被忽略
- 稀疏社区:里面页面互相引用太少,要补一补
- 桥接节点:连着 3 个以上集群的关键页面,表示好几个知识领域的交叉点
比如你读《三体》的时候,图洞察可能会告诉你,黑暗森林法则是个桥接节点,同时连着宇宙社会学和威慑纪元两个集群。你点击任意洞察卡片,图谱中对应的节点和边会高亮显示,旁边还有 Deep Research 按钮——点一下,LLM 自动生成搜索主题、联网搜索、把结果摄入 Wiki,一步补全。
purpose.md:让 Wiki 知道为什么存在
Karpathy 原版只有 Schema(Wiki 该怎么组织),没有 Purpose(Wiki 到底为什么存在)。LLM Wiki 多加了一个 purpose.md 文件,让你明确定义这个 Wiki 的目标是什么、核心问题有哪些、研究范围划到哪儿。每次读内容、查东西的时候,都会先看这个 purpose.md。甚至它还能根据你最近的使用习惯主动提醒——"你最近老查 AI Agent,要不要把研究方向调整一下?"
没有 purpose.md,LLM 只知道"怎么写";有了它,LLM 才真正明白"为什么写"。
项目一共内置了 5 个场景模板:Research(深度研究)、Reading(读书笔记)、Personal Growth(个人成长)、Business(商业分析)、General(通用)。对于同一个文档集合,不同的 purpose 会产出完全不同的 Wiki。
检索与存储
背后跑的是一个 4 阶段管线:先分词搜索找出候选页面,然后用图扩展找更多相关页面,接着按预算控制分配上下文,最后把完整内容组装好扔给 LLM。上下文窗口可以自己配置,4K 到 1M tokens 都可以,分配比例大概是 60% 给 Wiki 页面,20% 给聊天历史,5% 给索引,15% 给系统提示。LLM 拿到的不是摘要,而是每个页面的完整内容,回答的时候会按编号引用具体来源。
另外还支持向量语义搜索,用 LanceDB 存的,能接任何 OpenAI 兼容的接口,基准测试里召回率从 58.2% 提升到了 71.4%。
整个 Wiki 目录就是标准 Markdown 文件,[[wikilink]] 语法交叉引用,每个页面带 YAML frontmatter。直接用 Obsidian 打开就是一个完整 Vault,图谱、反向链接、搜索全都能用。就算哪天项目不更新了,你的知识库还在 Obsidian 里活得好好的。
安装
到 GitHub Releases 下载对应系统的安装包,macOS .dmg、Windows .msi、Linux .deb / .AppImage 都有。装好启动,配置 LLM 端点就行,想零成本本地可以装 Ollama 跑本地大模型,数据完全不出本机。
官方也提供了 Chrome 扩展(Manifest V3),用 Mozilla Readability.js 提取正文,Turndown.js 转 Markdown,一键剪藏。支持多项目选择,剪藏后自动触发两步摄入。支持的格式有 PDF、DOCX、PPTX、XLSX,导入后 Activity Panel 实时显示进度。
当然目前还有个坎:Token 消耗是现实问题,两步摄入意味着双倍 Token,本地模型能缓解但效果打折扣。
项目基于 GPL 3.0 协议开放。
项目地址:https://github.com/nashsu/llm_wiki