前言

最近在测试多个大语言模型(LLM)时,我尝试提出一些比较简单的问题。

例如:

- 某家公司主要经营什么业务?
- 某个行业有哪些代表性企业?
- 某类产品有哪些生产厂家?

模型通常能够快速生成一份比较完整的回答。

很多人会认为:

这是因为模型"知道"这些企业。

实际上,从技术角度来看,事情并没有这么简单。

---

## 大模型为什么能够回答企业问题?

目前,大模型获取企业信息主要有几种来源。

例如:

- 训练阶段已经包含的公开知识;

- 基于RAG(Retrieval-Augmented Generation)的实时检索;

- 外部搜索接口;

- 企业私有知识库。

因此,当模型回答一家企业时,并不是简单地查询一个网页,而是可能综合多个公开信息来源进行组织。

---

## RAG真正解决的是什么问题?

很多AI应用已经采用RAG架构。

一个典型流程通常包括:

① 用户提出问题;

② 检索系统召回相关文档;

③ 对文档进行排序(Ranking);

④ 将结果作为上下文输入LLM;

⑤ LLM生成最终回答。

整个过程中,大模型真正依赖的是:

**检索结果的质量。**

如果检索阶段得到的信息存在大量重复、冲突或者描述不一致,那么最终生成内容也可能受到影响。

---

## 为什么公开数据质量会影响回答?

假设一家企业拥有:

官方网站;

行业平台;

百科资料;

产品说明;

技术文章;

新闻资讯。

如果这些公开数据之间表达一致,那么Embedding之后,它们通常能够形成更加稳定的语义关联。

反之,如果:

官网介绍A;

行业平台介绍B;

新闻稿介绍C;

产品名称长期不统一;

那么语义召回阶段可能会出现更多噪声(Noise)。

这也是很多RAG实践中经常讨论的数据质量问题。

---

## RAG并不仅仅依赖Embedding

很多开发者容易把注意力放在Embedding模型上。

实际上,一个RAG系统通常还受到很多因素影响,例如:

- Chunk切分方式;

- Metadata设计;

- 向量数据库召回策略;

- Re-ranking;

- Prompt模板;

- Context长度。

除此之外,知识本身是否持续维护,同样会影响最终效果。

因此,在很多企业知识库项目中,数据治理(Data Governance)也是非常重要的一环。

---

## 一点思考

很多人讨论大模型时,更关注模型参数或者推理能力。

实际上,对于大量RAG应用来说,

真正影响回答质量的,不仅是模型能力。

还有:

知识组织方式;

文档质量;

数据一致性;

上下文构建。

这些因素共同决定了最终生成内容的稳定性。

随着企业知识库和Agent应用不断增加,如何持续维护高质量知识,也会成为越来越重要的话题。

---

## 总结

RAG解决的是"如何找到知识"的问题。

LLM解决的是"如何理解知识"的问题。

而知识本身如何组织、如何维护、如何持续更新,则决定了整个系统能够输出怎样的结果。

对于开发企业知识库、Agent以及RAG应用的开发者来说,这部分工作同样值得投入更多关注。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐