很多 AI 项目的瓶颈不是模型,而是数据。文档过期、命名混乱、表格丢失、权限不清、重复版本并存,都会让模型看起来“不聪明”。数据准备是 AI 应用最朴素也最关键的工作。
先清理,再向量化
不要把所有文件直接丢进知识库。先处理重复文档、废弃版本、扫描质量差的文件和缺少标题层级的资料。干净的数据会让后续检索和评估轻很多。
元数据是检索的方向盘
文档来源、创建时间、适用部门、权限范围、版本号、生效状态,这些信息应该成为索引的一部分。没有元数据,系统很难判断什么资料优先。
结构化样例比海量文本更有价值
对客服、销售、法务、财务这类场景,整理高质量问答样例、错误案例和边界场景,往往比增加更多无组织文档更有效。
数据要有维护责任人
知识库不是技术团队单独维护的资产。业务方需要负责资料有效性,产品和研发负责接入、索引和反馈闭环。
数据准备清单
- 清理重复、过期和低质量文档。
- 为资料补充来源、版本、权限和生效时间。
- 保留表格、标题和层级结构。
- 建立高频问题和失败案例样例集。
- 设置资料更新和审核责任人。