首页/内容专题/知识工程

智能体答不对,先别怪模型——知识库的「脏数据」才是真瓶颈

发布于 2026-08-03© 2026 江苏百信数字认证有限公司阅读约 6 分钟

试点阶段「回答不准」,七成问题出在知识库而不在模型。换更大的模型,等于用更强的发动机拖着漏油的车跑。先做知识治理,再谈模型调优。

评估会上最常听到的一句话

「这答案不对,是不是模型不行?」几乎每场演示评估都会被问到。模型确实是第一嫌疑人,但我们的经验里,绝大多数「答不准」的根因在数据侧。

模型只负责把语言组织好。它不知道你们公司哪份制度是现行版本、哪个指标的口径由哪个部门定、哪份合同已经作废——这些事实全部来自知识库。平台里的知识管理能力管的就是这件事:版本、来源、权限、有效期,每一样都在决定答案的上限。

三类典型的「脏数据」病根

先说最常见的三种
· 文档根本没法读:扫描件、图片型 PDF、加密文件、手写批注。OCR 都认不出的表格,任何模型都答不对。
· 版本混乱:2023 年的报销办法和 2025 年的并存于知识库,模型按权重随机取一份,答案自然时对时错。
· 口径冲突:同一个「产能利用率」,生产部按设备台时算,财务部按产值算。两套算法都在库里,模型只能看运气。

这三种病,没有一种靠换模型能治好。它们需要的是把知识库当成生产系统来治理,而不是当成一个「往里扔文档的文件夹」。

为什么换模型解决不了

模型的能力边界在语言理解和推理,不在业务事实。在把事实喂给它之前,它没有任何办法知道「你们公司规定 5 万元以上采购要双人审批」。

换模型治标不治本:答错的地方换了模型还是错,只是错得更流畅了。我们在 常见问题里被问得最多的也是这个——「换个大模型是不是就准了」,答案是先把知识库做干净。

知识治理的四个动作

版本管理:只让现行版本参与检索
每份文档明确当前有效版本,失效版本标记后移出检索。制度一更新,旧版本必须当天失效。
来源标注:答案必须能回到原文
每条回答带出文档名、章节、生效日期。答错时能立刻定位是引用错还是理解错。
权限分级:过滤发生在检索阶段
按岗位限定可见范围,检索时就排除无权内容,而不是等答案生成后再遮。后者的做法会漏权限。
定期清理:目录不是储藏室
躺着 3 年前的旧制度,等于每天都在污染答案。定一个季度清理节奏,比事后补救便宜得多。

一个简单的定位方法

答错时别急着下结论,先依次问三件事:

1. 这条答案引用的文档,是正确版本吗?——版本问题
2. 文档里真的有这个答案,还是模型在「编」?——检索与引用问题
3. 换更强的模型,同一个问题还错吗?——模型问题

前两个是数据与链路问题,第三个才是模型问题。按我们的观察,大部分项目卡在前两个。制造业知识助手这类场景尤其明显:设备台账里型号写错、工艺文档版本混放,模型再强也只能把错的信息说得更肯定。

想先给知识库做个「体检」?
我们可以用一天时间,对现有文档做可解析性、版本与口径问题的初筛,给出治理优先级清单。
申请知识体检
相关推荐
平台能力
知识、权限、审计管理
AI Agent 对接 ERP
接口梳理与异常处理
数据流向图怎么画
外部连接与数据链路清单
最后更新 2026-08-03© 2026 江苏百信数字认证有限公司返回内容专题
电话咨询预约演示