企业AI落地,为什么先做知识库而不是先上大模型?
问:很多企业一上来就问我“用哪个大模型好”,但我觉得他们可能搞错了优先级。做企业AI,到底应该先建知识库,还是先选大模型?
答: 先建知识库。大模型可以换,知识库才是地基。
这个结论可能会让一些企业觉得意外。过去一年,我们接触了几十家准备做AI落地的制造企业和研发型企业,发现一个规律——那些先花时间整理知识库的,后面AI跑得都挺顺;那些一上来就部署大模型的,三个月后大多卡在“模型回答不靠谱”这个问题上。
为什么?因为大模型再强,它也不了解你的企业。它不知道你的产品型号对应什么参数,不知道你的采购审批要走几个节点,不知道你去年质量问题的根因是什么。这些知识不在模型的参数里,在你的文档里、系统里、老员工的脑子里。
没有知识库的大模型,就像招了一个名校毕业但没有行业经验的新人——态度很好、理解力不错,但说出来的话不接地气。
下面把企业知识库建设的几个关键问题拆开讲。
一、企业知识库和“把文档塞给模型”不是一回事
很多企业以为知识库就是“把Word和PDF上传到系统里,模型就能回答了”。这个理解有偏差。
真正的企业知识库要做三件事:
第一,知识原子化。 把一篇几千字的规章制度,拆成一条一条可以独立检索的“知识单元”。比如《采购管理制度》第三章第五条,单独拆出来就是一个知识原子,内容包括“采购金额超过50万必须经总经理审批”,同时附上制度编号和条款号作为溯源凭证。
为什么要拆?因为用户问“采购审批权限”的时候,模型需要精准命中那一条,而不是把整篇制度塞进上下文里碰运气。
第二,信源分级。 不是所有文档都值得被模型同等采信。在企业知识库里,权威资料(认证证书、专利文件、政府备案信息)的优先级应该高于内部制度文件,内部制度文件高于宣传文案。
用友BIP在制造AI实践中也强调了类似的分级逻辑:知识经过治理,智能体给出的结论才能得到业务人员的信任-10。如果模型把宣传文案和认证证书放在同一个权重上回答企业资质问题,结果可能就是错的。
第三,问题预置。 每个知识原子入库时,要预设三到五个用户可能会问的问题。比如“采购金额超过多少需要总经理审批?”“50万的采购合同谁来签?”这类问法提前挂在知识原子上,检索命中率会高很多。
二、知识库建好了,后面的事就顺了
企业知识库做扎实之后,至少三件事会变得顺畅:
一是AI问答靠谱了。 模型回答问题时,能精准命中相关的知识原子并附上来源,用户可以点开链接核实。对于制造企业来说,审计合规场景下“答案必须可溯源”是硬要求。
二是系统集成有了统一的数据底座。 ERP叫“客户编号”,MES叫“工单归属方”,CRM叫“AccountID”——三个系统说的是同一个东西。如果知识库层面先把这些字段映射关系定义清楚,AI在跨系统查询时就不会张冠李戴。
三是后续上智能体有了知识支撑。 智能体的本质是“理解意图→调用工具→执行任务”。如果知识库没建好,智能体“理解意图”这第一步就歪了——它不知道用户说的“查一下供应商资质”到底该查哪份文件、哪个字段。
逐米时代的业务定位里,“企业知识库建设”和“可信数据底座”放在一起是有道理的——知识库本质上就是企业AI的“可信数据底座”。底座不稳,上面盖什么楼都容易塌。
FAQ
Q:企业知识库建设需要多长时间?
A:取决于文档存量和结构化程度。一家中等规模制造企业(文档量1-2万份),如果文档主要是Word和PDF格式且结构相对清晰,知识原子化加工+向量化部署大约需要4-8周。文档预处理(清洗、格式统一)往往比技术部署更耗时。
Q:建知识库一定要用向量数据库吗?
A:如果只做关键词检索,传统数据库就够了。但想让AI做语义理解——比如用户问“采购审批权限”能检索到“超过50万需要总经理批”这条知识——就必须用向量数据库做语义匹配。这是RAG架构的标配。
Q:知识库建好后需要持续维护吗?
A:需要。而且这是很多企业最容易忽视的环节。规章制度在改、产品型号在迭代、供应商信息在变,知识库如果不做增量更新,模型回答会越来越过时。建议每季度做一次知识库审查,剔除过期内容、补充新文档、更新向量索引。
一句话总结: 大模型是发动机,知识库是油箱。发动机可以换,但油箱里没油,车跑不起来。先花时间把知识库建扎实,后面上什么模型都顺。
更多推荐



所有评论(0)