0%

LLM Wiki 新手指南:它不是搜索引擎,是替你编书的 AI

前一篇讲我把上千篇文章搬进了自己的知识库,有读者后台问:LLM Wiki 到底是个什么软件,怎么用?这篇讲清楚它的原理和几个重要功能,包括很容易被忽略的”待审阅”和”深度研究”。

一句话说清

LLM Wiki 是一个开源的跨平台桌面应用(Windows、Mac、Linux 都有,GitHub 搜 nashsu/llm_wiki,12000+ 星)。它的核心思路和现在流行的”问答式知识库”正好相反:

  • 常见做法是 RAG:你每次提问,它现场翻资料、现场拼答案,翻完就忘。
  • LLM Wiki 是 增量式构建:你导入资料时,它当场全部读一遍,编译成一套结构化 Wiki,之后持续维护更新。知识只编译一次,而不是每次重新推导。

一句话:它不替你搜,它替你编书。 你的资料是原料,它交回来的是有目录、有条目、互相引用的知识库。

LLM Wiki 工作原理流程图

它怎么干活:三层架构 + 两步摄入

项目里分三层,各管各的:

目录 干什么
原始资料 raw/sources/ 你丢进去的文件,原样存放,AI 不改
Wiki wiki/ LLM 读完全部资料后生成的整理成果
规则 schema.md + purpose.md 告诉 AI 这库的结构规矩和为什么存在

资料进来后走”两步思维链摄入”,先分析、再生成:

  1. 分析:LLM 通读资料,提炼关键实体、概念、论点,找出和已有 Wiki 的关联与矛盾。
  2. 生成:基于分析写出 Wiki 页面,更新目录 index.md 和日志 log.md;拿不准的标成”待审阅项”,缺知识就生成深度研究的搜索词。

生成的页面按类型分门别类放在 wiki/ 下:

  • 实体(entity):人、机构、产品,比如某公司、某文件。
  • 概念(concept):理论、方法、技术,比如”数据完整性”这种词条。
  • 来源(source):每篇原始资料的摘要页,标注出处可回溯。
  • 查询(query):你问过的问题和研究记录。
  • 对比 / 综合:跨资料的并列比较和全局结论。

页面互相用双链 [[链接]] 引用,连成一张知识图谱:四点信号算关联度(直接链接、同来源、共同邻居、同类页面),还能自动做社区检测,把相关内容聚成簇。图谱里能看出”知识空白”——哪块缺资料,一眼可见。

搜索到底怎么搜:关键词是主体,向量是可选增强

上篇我把向量模型写成”按意思搜”,那说法不严谨,这里纠正。LLM Wiki 的检索是多阶段管线

  1. 分词关键词检索(主体,默认就有):把句子拆成词去匹配,中文按两个字一组切(比如”知识管理”切成”知识””识管””管理”),标题命中加分,同时搜 Wiki 页面和原始文件。
  2. 向量语义检索(可选增强):把文字转成一组数字(向量),意思相近的文字向量靠得近,用余弦距离取相近页面。它能捞到”字面没对上但意思沾边”的内容。
  3. LLM 综合:把上面捞到的相关页面交给 LLM,读一遍再回答,答案带着来源。

所以准确说法是:关键词检索是地基,配了向量模型才多一路”语义”检索。没配向量,搜索照常能用,只是少了按意思兜底的那一路。向量模型跑在本地 Ollama 里(我用的 qwen3-embedding:0.6b,约 600MB),数据不出门。

两个容易忽略的重要功能

待审阅(界面里叫”审核”)。LLM 摄入资料时,遇到拿不准的(比如”这个该算实体还是概念””这个说法和已有页面矛盾”),不会自作主张,而是标记成审核项,等你来处理。每个审核项给预定义操作:创建页面、发起深度研究、跳过。你不处理也不阻塞摄入,但攒多了知识库就少了人工把关这一环。我一般隔几天点开审核,把该批的批了。

深度研究。当图谱发现知识空白(比如某个概念下只有孤零零一页),或者你在审核里选了”研究”,它会:读 purpose.mdoverview.md 搞清你的库在研究什么 → 生成研究主题和多条搜索词 → 弹窗让你确认、可改 → 联网搜索(可配 Tavily 或本地 SearXNG)→ 把结果综合成 Wiki 页面,带交叉引用,再自动走一遍摄入。等于知识库缺什么,它会自己出门查资料补上。 我的库里就有好几份这样的研究记录。

三句关键配置

第一句:LLM 提供商必须配。摄入、图谱、研究全靠它,没它软件不干活。我用的是本地跑的大模型,不花钱、数据不出门。

第二句:向量模型是可选的。想多一路”语义检索”就配一个 embedding 模型(本地 Ollama 就行);不配搜索也照常用。

第三句:自动导入要开。开着以后,往资料文件夹里丢新文件,它自己收编、自己建索引,不用手动导。再配合 SHA256 增量缓存,没改过的文件不会重复烧 token。

手把手:半小时建一个能搜的知识库

原理和配置说完了,说怎么动手。整个过程七步,前几步是鼠标活,后面全靠 AI。

第 0 步 装软件

GitHub 搜 nashsu/llm_wiki,进 Releases 页下载对应系统的安装包(Windows 是 .exe,Mac 是 .dmg,Linux 有 AppImage),双击安装,打开。

第 1 步 建项目

点「新建项目」,它给几个模板:研究、阅读、通用。选哪个都行,后面能改。给它起个名,比如就叫「我的知识库」。它会问你要一个文件夹,这个文件夹以后就是你的资料库(软件里叫 raw/sources/)。

第 2 步 把资料指给它

把想入库的资料拖进去:工作文档、公众号文章、PDF、txt、Word 都行,它都吃。支持文件夹整体导入,懒人最爱:把整个目录指给它,它按目录结构自己归类。

第 3 步 按三句配置填好

回到上面「三句关键配置」:LLM 提供商必填(本地 Ollama 或云端都行,不会填就把报错截图丢给 AI 让它帮你看),向量模型可选,自动导入建议开。填完就再也不用动了。

第 4 步 等它读

资料丢进去,它就开始「摄入」:进度条走完要一阵(几百个文件大概要跑一段时间,别中途关软件)。跑完会看到三类新东西:概念页(把重复出现的说法归纳成词条)、实体页(人名、机构名、产品名各立一页)、来源摘要页(每篇资料一页,带出处链接)。这就是「编译」:它不是替你存文档,是把它读懂了、拆开了、重组成体系。

第 5 步 开搜

搜索框输半句话,比如「这个规定的适用范围」,几秒出结果。结果分两类:关键词命中(字面对上)和语义命中(字面没对上但意思沾边,前提是开了向量检索)。点开任意结果,能看到它引用了哪几篇原始资料,点过去就是原文。

第 6 步 处理待审阅

摄入完,侧边栏「审核」角标通常有数字:那是 AI 读资料时拿不准、标出来等你拍板的项。每个给三个操作:创建页面、发起深度研究、跳过。不用一次清完,隔两天点一遍就行。

第 7 步 让它补空白

用一阵后打开图谱看,哪个概念孤零零没邻居,就点它旁边的「深度研究」。AI 会先看你的库是干嘛的,生成研究主题和搜索词,弹窗让你确认(能改),然后联网把资料找回来、整理成页面、自动收进库。等于你的知识库缺什么,它自己出门补课。

哪条看不懂也没关系,这活 AI 都包了:真正要你亲自干的,只有第 0 步下载、第 3 步填接口,其他全是点鼠标和扔文件。

实测长什么样

我的主库(gmp-wiki)现在:

  • 原始文件 1491 个(1200 多篇 Markdown、200 多个 txt、几十个 Word/PDF)
  • 自动整理出概念页 2037 个、实体页 741 个、来源摘要 1238 个
  • 图谱能看出知识聚簇,点节点跳到原文
  • 深度研究产出过几份专题研究页,带交叉引用入库

踩过的坑

  1. 第一次摄入慢。一千多个文件要跑一阵,别中途关软件,进度会停。挂后台干别的去。
  2. 扫描版 PDF 读不出来。纯图片扫描件没有文字层,提取是空的,得先转成文字再入库。
  3. 向量没配时搜索”少一路”。不是坏了,是只剩关键词检索。想要语义兜底就配 embedding。
  4. 审核项不处理会攒着。不阻塞,但攒多了知识库少了人工把关,抽空点一遍。
  5. 深度研究要确认弹窗。生成的主题和搜索词可以改,别直接点确定就跑,改一下针对性更好。
  6. 大文件或生僻格式会失败。摄入队列会自动重试 3 次,还不行就留在队列里标红,删掉换个格式重来。

验收

一句话:丢一份新资料进去,等它摄入完,在搜索框里输半句话能搜到原文,再点开图谱能看到它被归进了哪个簇,就成了。

到此你就有了一个能检索、能查询、会自己长知识的知识库。剩下的交给时间:资料越多,概念页和实体页越丰满,图谱越密,搜索越准。

结论

LLM Wiki 不替你搜,它替你编书:资料进来,它编译成带概念、实体、出处的结构化 Wiki,连成图谱;拿不准的进”待审阅”等你拍板,缺知识它会深度研究出门补课。你要做的,只是往文件夹里扔资料,偶尔点开审核批两下。