你的知识库是仓库还是系统?
大多数人建知识库的方式:收藏一篇文章 → 写一段摘要 → 扔进文件夹 → 下次要用的时候重新翻找。
这不是因为你存得不够多,而是你的知识库只是一个仓库,不是一个系统。资料进来了,但没人帮你持续消化,也没人帮你整理成下次还能直接调用的中间层。
LLM Wiki 的做法是:资料进来 → Agent 帮你整理 → 更新概念页、主题页、索引页 → 下次提问时优先站在已整理过的 wiki 层回答。
区别在于:前者是存资料,后者是编译知识。
第一步:创建实验仓库
不要直接用你现有的复杂 Obsidian vault 开刀。新建一个独立文件夹作为实验仓,比如:
llm-wiki-lab/
├── AGENTS.md ← 规则文件(见下一步)
├── raw/ ← 原始资料放这里
└── wiki/ ← 编译后的知识页放这里
用 Obsidian 打开这个文件夹作为新 vault。
第二步:写 AGENTS.md(核心规则文件)
这是整个系统最关键的一步。AGENTS.md 不是给人看的说明书,而是给 Agent 的工作规则。
极简版本示例:
# LLM Wiki Rules
## 目标
这个仓库用于维护一个可持续进化的知识系统。
## 目录约定
- raw/:原始资料
- wiki/:整理后的知识页
- AGENTS.md(本文件):仓库根目录下的工作规则
## ingest 原则
当有新资料进入 raw/ 时:
1. 生成对应的来源页
2. 提炼关键观点
3. 更新相关的 wiki 页面
4. 增加必要的交叉链接
5. 如无对应页面,则创建新页面
## 查询原则
回答问题时,优先参考 wiki/ 中已经整理过的页面;
必要时再回看 raw/。
第三步:往 raw/ 放第一份资料
选一篇你觉得有价值的文章,手动存入 raw/ 目录。文件名建议用日期前缀:
raw/2026-09-10-karpathy-llm-wiki.md
文件内容至少包含:标题、原文链接、作者/来源、正文要点、你的备注。
经验:第一次别一口气塞十篇文章,先塞一篇,验证链路是否跑得通。
第四步:让 Codex 执行第一次 ingest
打开 Codex,进入这个实验仓目录:
cd ~/path/to/llm-wiki-lab
codex
然后给出明确指令:
请读取 raw/2026-09-10-karpathy-llm-wiki.md。
基于其中内容:
1. 在 wiki/ 下创建一页来源总结页
2. 提炼关键概念
3. 如果需要,新建相关概念页
4. 为新旧页面增加交叉链接
5. 最后告诉我这次新增了哪些文件、更新了哪些文件
第五步:回到 Obsidian 检查结果
Codex 执行完后,去 Obsidian 里检查三件事:
- 有没有生成来源页 — wiki/ 下是否有类似
source-karpathy-llm-wiki.md的页面 - 有没有生成概念页 — 是否有
llm-wiki.md、ingest-workflow.md等概念页 - 有没有加交叉链接 — 页面之间是否有
[[LLM Wiki]]这类双向链接
如果只生成了孤立摘要没有链接,那这次 ingest 只完成了一半。
第六步:基于 wiki 层提第一个问题
真正的价值不在自动建页,而在于以后提问时能优先站在已整理过的 wiki 层回答。
继续在 Codex 中问:
请基于 wiki/ 中已经整理好的内容回答:
LLM Wiki 和传统 RAG 的差别到底是什么?
如果还需要补充,再回看 raw/ 里的原始资料。
如果 Codex 的回答明显先引用了已整理好的 wiki 页面,再去补充 raw 层,说明这套结构开始工作了。
第七步:把优质问答回写到 wiki
如果你得到了一个特别清晰的对比答案,让它继续沉淀:
请把刚才关于"LLM Wiki vs RAG"的回答,
整理成 wiki/ 下的一页对比页,补上必要链接,
并关联到已有页面。
一旦你开始这样做,知识库就会出现一个信号:它不再只吸收新资料,也开始吸收新问题。
三种 MCP 接入方案对比
| 方案 | 工具数量 | 是否需要 Obsidian 插件 | 检索能力 | 适用场景 |
|---|---|---|---|---|
| obsidian-codex-mcp | 12 个 | 不需要 | 基础全文搜索 | Codex CLI 专用,轻量接入 |
| mcp-obsidian | 7 个 | 需要 Local REST API | 基础全文搜索 | 通用 MCP 客户端 |
| enquire-mcp | 44 个 | 不需要 | 六层混合检索+RAG | 大型 vault,研究场景 |
推荐从 obsidian-codex-mcp 开始,12 个工具覆盖读写、检索、结构管理基本需求,无需安装任何 Obsidian 插件。
安装步骤:
git clone https://github.com/dot-RealityTest/obsidian-codex-mcp.git
cd obsidian-codex-mcp
python3 -m venv .venv
.venv/bin/python -m pip install -r requirements.txt
然后在 ~/.codex/config.toml 中配置:
[mcp.obsidian]
command = "/path/to/obsidian-codex-mcp/.venv/bin/python"
args = ["-m", "obsidian_codex_mcp"]
env = { OBSIDIAN_VAULT_PATH = "/你的/vault/路径" }
最容易翻车的三个地方
- 一上来就设计超级复杂的结构 — 还没导入第一篇资料就先花两小时设计 schema。先跑通最小闭环,再优化。
- 把 raw 和 wiki 混在一起 — 原始资料和整理后的知识不是同一层东西,必须分层。
- 只让 Agent 做摘要,不让它更新知识网络 — 如果只会"总结一篇文章",那你得到的只是一个自动摘要器,不是知识库。
来源
本文根据 SegmentFault《Obsidian + Codex 完整教程》、CSDN《我用 Obsidian + Codex 搭了一个会持续进化的 AI 知识库》及腾讯云相关实战内容整理改写。
资料最后核对日期:2026-09-10 · 内容整理自 CodexGuide 社区公开教程