知识工程进阶之一:从资料堆到知识库:先做信息分层
资料多,不等于知识系统强。
没有分层的资料堆,只会把检索噪声一起放大。
先给结论
很多团队一做 RAG,就急着上传文件、建向量库、跑检索。
但真正决定后面效果的,往往不是“有没有索引”,而是:
- 资料有没有先分层
- 来源有没有先分级
- 更新机制有没有先想清
知识工程的第一步,不是 embedding,而是信息整理。
为什么一上来就建库,后面常常越做越乱
因为不同类型的信息被混在了一起:
- 正式规范
- 草稿方案
- FAQ
- 用户评论
- 过时文档
- 临时会议纪要
这些东西一旦没有区分,后面模型就容易:
- 把草稿当定稿
- 把评论当事实
- 把旧版本当新标准
所以知识系统最先要解决的,不是“能不能搜到”,而是“搜到的东西值不值得信”。
最有用的第一层分法
你可以先按四个维度分层:
1. 按信息性质分
- 规则类
- 事实类
- 经验类
- 过程类
2. 按可信度分
- 官方正式材料
- 团队确认材料
- 个人经验材料
- 未验证材料
3. 按时效性分
- 长期稳定
- 周期更新
- 高频变化
- 临时性内容
4. 按使用场景分
- 查规范
- 查背景
- 查案例
- 查当前状态
这一步一做,后面检索和上下文组装会轻松很多。
为什么这很像嵌入式里的资源分层
因为本质上都是在做:
- 先分类
- 再决定放哪
- 再决定谁来读
- 再决定什么时候更新
知识工程做得好,模型拿到的是“结构化资料入口”。
做得不好,模型拿到的是“看起来都像文档的一堆文本”。
知识系统最少要有哪几类元信息
每份内容最好至少带这些标签:
- 来源
- 更新时间
- 版本
- 适用范围
- 权威级别
如果没有这些元信息,后面你很难做:
- 检索过滤
- 新旧冲突处理
- 结果解释
- 过期清理
一句带走
知识工程的第一步,不是“怎么搜”,而是“先把信息分清”。
资料一旦不分层,后面越工程化,噪声放得越大。