基于知识图谱的知识库初探
如果说思维导图是给人看的,那么知识图谱就是给计算机看的。
一、大语言模型与 RAG
大语言模型(LLM)基于 Transformer 架构,通过海量数据训练来识别与生成文本。但它有上下文字数限制——大文档不能一次读入,必须先进行切割(Splitting):把文档切成小片段(chunk),片段大小可自定义,并保留部分重叠以维持上下文连续。
片段会被嵌入(embedding)后存入向量数据库,构成知识库。问答时,问题先被嵌入,再到向量库做相似度检索,找出最相关的片段,连同问题一起交给 LLM 生成答案。这套流程叫 RAG(检索增强生成,Retrieval Augmented Generation)。
相比微调(Fine Tuning),RAG 在知识库场景优势明显:
- 增量学习:靠检索更新知识,无需重训整模型;
- 成本效益:省去昂贵的重训;
- 泛化能力:跨领域检索整合,适用面广。
二、微软的大招:GraphRAG
当知识库持续变大,传统 RAG 会出现检索效率下降、质量变差。微软提出的 GraphRAG 把知识图谱与图机器学习结合,从非结构化文本中抽取结构化数据,增强 LLM 的理解与推理。
比喻:在庞大知识库里找知识点像大海捞针(RAG);知识图谱则如同穿针引线,把片段串联成网。
三、什么是知识图谱
知识图谱(Knowledge Graph)是一种结构化语义库,用"实体—关系—实体"三元组描述概念与关联,例如"中国—首都—北京"。它让计算机能快速响应与推理,广泛用于智能搜索、问答、推荐、情报分析与反欺诈。
四、小试牛刀:GraphRAG 实战
- 索引流程含 Loading Input → create_base_text_units → create_final_entities → create_final_relationships,最终输出
.parquet; - 用 14 篇技术文实测,问"介绍一下作者一刀",GraphRAG 能给出作者背景并附引用来源;
- 图谱由 380 个节点、378 条关系组成,可用 Microsoft notebook、转 CSV 进 Neo4j,或 GraphRAG Visualizer 查看。
五、集大成者:Neo4j LLM Knowledge Graph Builder
Neo4j 是高性能图数据库。其在线版 Aura(已集成 APOC)配合示例项目 LLM Knowledge Graph Builder 可低门槛建库:
- 支持 PDF、Markdown、图片、网页、YouTube 视频、S3/GCS 导入;
- 自动生成词法图、实体图与知识图谱,并提供基于向量 + 图谱的在线问答;
- 可在 Graph Enhancement 中选预设或自定义 Schema(如用 Kimi 生成节点标签)。
六、两种方案对比
以"某批次 NAND Flash 芯片失效,制定失效分析流程"提问:
- LLM KG Builder:回答注重细节、可溯源到文档/片段/实体,并基于实体生成新图谱,但偶有"东拉西扯";
- GraphRAG(Local Search):条理清晰、不胡乱联想,但泛化稍弱(只引用失效分析资料,未关联 NAND Flash 与可靠性文章)。
两者都因测试文章量少而受限;一旦积累大量文献,即可建成领域知识库。
七、与 Obsidian 的关系
知识图谱是"给计算机看"的关系网,而 Obsidian 的双向链接理念与其同构——只是图谱由 LLM 自动织成,双链由你手动建立。未来工具会更智能:自动推荐内容、发现联系。GraphRAG 与 LLM KG Builder 预示着开放互联的知识生态,基于知识图谱的知识库将成为个人与集体的创新基础。