2026-08-15 周六 · 5 min read

08-15 · 一天导入 1398 个概念:知识库改造日

把散落在多个来源的知识笔记统一成一个结构化知识库,一天之内从 216 个概念扩到 1398 个,0 个不合规。最大的一块是 1375 页的 LLM Wiki 全量转换——分 10 批并行处理,正文逐字节保留,只换元数据格式。

当日记录focused

一天导入 1398 个概念:知识库改造日

🏗️ 先把知识库本身建起来

定了一套统一规范(含字段定义、类型体系、溯源要求),领域划分为:学习 / AI Agent / GEO(AI 搜索)/ 项目 / 基础设施 / 人物 / 运维。

然后是导入工程。这一天的主线就是「把散落的东西搬进一个规范里」。

📥 七轮导入,从 216 → 1398 个概念

来源数量去向
AI 知识库整体导入67 文件(62 + 4 + 1 总览)AI Agent / GEO
结构化加工25 个纯文字概念全量结构化各域
一本人写的书14 章节GEO / 书籍
某工具专题25 个新概念AI Agent(现 34)
GEO 学习笔记全集82 个概念(含 57 篇论文解读)GEO(现 104)
剪藏导入14 个概念分散到 5 个域
⭐ LLM Wiki 全量1182 个概念五大域

最终:1398 个概念,0 个不合规。

最大那块:1375 页全量转换

这是当天的重头戏。源是一个 1375 页 / 19 MB / 245 个来源的笔记库,概念本身已经带完整元数据。

做法:分 10 批、30+ 个并行任务做转换,产出 1182 个概念,按主题分到五个域(其中一个域是新建的)。

转换规范有两条要点:

  • 元数据换格式:源格式 → 统一规范,旧字段降级成溯源字段(保留原始时间/来源/置信度等信息)
  • 正文逐字节保留 —— 只动元数据,不动内容

关键经验:源文件的元数据里经常有非法 YAML(嵌套引号、闭合符粘连),得做行级容错解析,不然一批就崩。

源库用 git 验证过零改动。

📐 结构化加工的「保真铁律」

25 个纯文字概念做了全量结构化,规则是:

只重组,不改事实。

具体做法:压缩转写里的口水话、统一成「是什么 → 分节 → 表格 → 至少一张流程图」的结构、原文没讲清的地方直接标注「原文未展开」,不替它补。

覆盖率从 28% 提到 45% 有结构化标记。

🔗 重复副本:指针化而不是双份维护

发现有 5 处内容重复的副本。做法是:先 diff 确认内容一致,再改成一个指向另一个的指针。

理由:双份维护迟早会出现「改了 A 忘了 B」。而消除它之前必须先确认两份真的一样 —— 不确定就 diff,不要凭标题判断。

还有一条相关的:同名字但内容不同的概念照常导入 —— 去重是按内容,不是按标题。

关键决策

决策理由
导入的概念默认 unverified,不加人工确认标记等复核后批量补,不自己给自己签字
元数据格式统一转换,旧字段降级为溯源字段统一规范但保留溯源
重复副本指针化而非双份维护消除双份维护成本
同名但内容不同照常导入内容去重而非标题去重
结构化加工只重组不改事实保真铁律,模糊处如实标注
技能草稿不导入知识库非知识概念,保持库纯度

待办

  • 一批 62 张卡批量迁移
  • 剩余几个域的迁移
  • 用户复核后批量补确认标记
  • 一本书的内容加工成博客
  • 共读继续(第 96 页起)