实战

Obsidian + Codex:从零搭建会持续进化的个人知识库

2026/9/105 分钟阅读

你的知识库是仓库还是系统?

大多数人建知识库的方式:收藏一篇文章 → 写一段摘要 → 扔进文件夹 → 下次要用的时候重新翻找。

这不是因为你存得不够多,而是你的知识库只是一个仓库,不是一个系统。资料进来了,但没人帮你持续消化,也没人帮你整理成下次还能直接调用的中间层。

LLM Wiki 的做法是:资料进来 → Agent 帮你整理 → 更新概念页、主题页、索引页 → 下次提问时优先站在已整理过的 wiki 层回答。

区别在于:前者是存资料,后者是编译知识。


第一步:创建实验仓库

不要直接用你现有的复杂 Obsidian vault 开刀。新建一个独立文件夹作为实验仓,比如:

llm-wiki-lab/
├── AGENTS.md          ← 规则文件(见下一步)
├── raw/               ← 原始资料放这里
└── wiki/              ← 编译后的知识页放这里

用 Obsidian 打开这个文件夹作为新 vault。


第二步:写 AGENTS.md(核心规则文件)

这是整个系统最关键的一步。AGENTS.md 不是给人看的说明书,而是给 Agent 的工作规则。

极简版本示例:

# LLM Wiki Rules

## 目标
这个仓库用于维护一个可持续进化的知识系统。

## 目录约定
- raw/:原始资料
- wiki/:整理后的知识页
- AGENTS.md(本文件):仓库根目录下的工作规则

## ingest 原则
当有新资料进入 raw/ 时:
1. 生成对应的来源页
2. 提炼关键观点
3. 更新相关的 wiki 页面
4. 增加必要的交叉链接
5. 如无对应页面,则创建新页面

## 查询原则
回答问题时,优先参考 wiki/ 中已经整理过的页面;
必要时再回看 raw/。

第三步:往 raw/ 放第一份资料

选一篇你觉得有价值的文章,手动存入 raw/ 目录。文件名建议用日期前缀:

raw/2026-09-10-karpathy-llm-wiki.md

文件内容至少包含:标题、原文链接、作者/来源、正文要点、你的备注。

经验:第一次别一口气塞十篇文章,先塞一篇,验证链路是否跑得通。


第四步:让 Codex 执行第一次 ingest

打开 Codex,进入这个实验仓目录:

cd ~/path/to/llm-wiki-lab
codex

然后给出明确指令:

请读取 raw/2026-09-10-karpathy-llm-wiki.md。
基于其中内容:
1. 在 wiki/ 下创建一页来源总结页
2. 提炼关键概念
3. 如果需要,新建相关概念页
4. 为新旧页面增加交叉链接
5. 最后告诉我这次新增了哪些文件、更新了哪些文件

第五步:回到 Obsidian 检查结果

Codex 执行完后,去 Obsidian 里检查三件事:

  1. 有没有生成来源页 — wiki/ 下是否有类似 source-karpathy-llm-wiki.md 的页面
  2. 有没有生成概念页 — 是否有 llm-wiki.mdingest-workflow.md 等概念页
  3. 有没有加交叉链接 — 页面之间是否有 [[LLM Wiki]] 这类双向链接

如果只生成了孤立摘要没有链接,那这次 ingest 只完成了一半。


第六步:基于 wiki 层提第一个问题

真正的价值不在自动建页,而在于以后提问时能优先站在已整理过的 wiki 层回答。

继续在 Codex 中问:

请基于 wiki/ 中已经整理好的内容回答:
LLM Wiki 和传统 RAG 的差别到底是什么?
如果还需要补充,再回看 raw/ 里的原始资料。

如果 Codex 的回答明显先引用了已整理好的 wiki 页面,再去补充 raw 层,说明这套结构开始工作了。


第七步:把优质问答回写到 wiki

如果你得到了一个特别清晰的对比答案,让它继续沉淀:

请把刚才关于"LLM Wiki vs RAG"的回答,
整理成 wiki/ 下的一页对比页,补上必要链接,
并关联到已有页面。

一旦你开始这样做,知识库就会出现一个信号:它不再只吸收新资料,也开始吸收新问题。


三种 MCP 接入方案对比

方案 工具数量 是否需要 Obsidian 插件 检索能力 适用场景
obsidian-codex-mcp 12 个 不需要 基础全文搜索 Codex CLI 专用,轻量接入
mcp-obsidian 7 个 需要 Local REST API 基础全文搜索 通用 MCP 客户端
enquire-mcp 44 个 不需要 六层混合检索+RAG 大型 vault,研究场景

推荐从 obsidian-codex-mcp 开始,12 个工具覆盖读写、检索、结构管理基本需求,无需安装任何 Obsidian 插件。

安装步骤:

git clone https://github.com/dot-RealityTest/obsidian-codex-mcp.git
cd obsidian-codex-mcp
python3 -m venv .venv
.venv/bin/python -m pip install -r requirements.txt

然后在 ~/.codex/config.toml 中配置:

[mcp.obsidian]
command = "/path/to/obsidian-codex-mcp/.venv/bin/python"
args = ["-m", "obsidian_codex_mcp"]
env = { OBSIDIAN_VAULT_PATH = "/你的/vault/路径" }

最容易翻车的三个地方

  1. 一上来就设计超级复杂的结构 — 还没导入第一篇资料就先花两小时设计 schema。先跑通最小闭环,再优化。
  2. 把 raw 和 wiki 混在一起 — 原始资料和整理后的知识不是同一层东西,必须分层。
  3. 只让 Agent 做摘要,不让它更新知识网络 — 如果只会"总结一篇文章",那你得到的只是一个自动摘要器,不是知识库。

来源

本文根据 SegmentFault《Obsidian + Codex 完整教程》、CSDN《我用 Obsidian + Codex 搭了一个会持续进化的 AI 知识库》及腾讯云相关实战内容整理改写。

资料最后核对日期:2026-09-10 · 内容整理自 CodexGuide 社区公开教程