08-15 · 一天导入 1398 个概念:知识库改造日
把散落在多个来源的知识笔记统一成一个结构化知识库,一天之内从 216 个概念扩到 1398 个,0 个不合规。最大的一块是 1375 页的 LLM Wiki 全量转换——分 10 批并行处理,正文逐字节保留,只换元数据格式。
一天导入 1398 个概念:知识库改造日
🏗️ 先把知识库本身建起来
定了一套统一规范(含字段定义、类型体系、溯源要求),领域划分为:学习 / AI Agent / GEO(AI 搜索)/ 项目 / 基础设施 / 人物 / 运维。
然后是导入工程。这一天的主线就是「把散落的东西搬进一个规范里」。
📥 七轮导入,从 216 → 1398 个概念
| 来源 | 数量 | 去向 |
|---|---|---|
| AI 知识库整体导入 | 67 文件(62 + 4 + 1 总览) | AI Agent / GEO |
| 结构化加工 | 25 个纯文字概念全量结构化 | 各域 |
| 一本人写的书 | 14 章节 | GEO / 书籍 |
| 某工具专题 | 25 个新概念 | AI Agent(现 34) |
| GEO 学习笔记全集 | 82 个概念(含 57 篇论文解读) | GEO(现 104) |
| 剪藏导入 | 14 个概念 | 分散到 5 个域 |
| ⭐ LLM Wiki 全量 | 1182 个概念 | 五大域 |
最终:1398 个概念,0 个不合规。
最大那块:1375 页全量转换
这是当天的重头戏。源是一个 1375 页 / 19 MB / 245 个来源的笔记库,概念本身已经带完整元数据。
做法:分 10 批、30+ 个并行任务做转换,产出 1182 个概念,按主题分到五个域(其中一个域是新建的)。
转换规范有两条要点:
- 元数据换格式:源格式 → 统一规范,旧字段降级成溯源字段(保留原始时间/来源/置信度等信息)
- 正文逐字节保留 —— 只动元数据,不动内容
关键经验:源文件的元数据里经常有非法 YAML(嵌套引号、闭合符粘连),得做行级容错解析,不然一批就崩。
源库用 git 验证过零改动。
📐 结构化加工的「保真铁律」
25 个纯文字概念做了全量结构化,规则是:
只重组,不改事实。
具体做法:压缩转写里的口水话、统一成「是什么 → 分节 → 表格 → 至少一张流程图」的结构、原文没讲清的地方直接标注「原文未展开」,不替它补。
覆盖率从 28% 提到 45% 有结构化标记。
🔗 重复副本:指针化而不是双份维护
发现有 5 处内容重复的副本。做法是:先 diff 确认内容一致,再改成一个指向另一个的指针。
理由:双份维护迟早会出现「改了 A 忘了 B」。而消除它之前必须先确认两份真的一样 —— 不确定就 diff,不要凭标题判断。
还有一条相关的:同名字但内容不同的概念照常导入 —— 去重是按内容,不是按标题。
关键决策
| 决策 | 理由 |
|---|---|
| 导入的概念默认 unverified,不加人工确认标记 | 等复核后批量补,不自己给自己签字 |
| 元数据格式统一转换,旧字段降级为溯源字段 | 统一规范但保留溯源 |
| 重复副本指针化而非双份维护 | 消除双份维护成本 |
| 同名但内容不同照常导入 | 内容去重而非标题去重 |
| 结构化加工只重组不改事实 | 保真铁律,模糊处如实标注 |
| 技能草稿不导入知识库 | 非知识概念,保持库纯度 |
待办
- 一批 62 张卡批量迁移
- 剩余几个域的迁移
- 用户复核后批量补确认标记
- 一本书的内容加工成博客
- 共读继续(第 96 页起)