大模型的致命缺陷——幻觉
大模型的幻觉问题是一致致命缺陷,且是由当前大模型的工作原理决定的,要靠近AGI就必须实现”受控幻觉“,让AI有常识推理能力并根据外部事实修正自身幻觉。

大模型产生幻觉的根本原因在于,它们本质上是基于统计的概率性文本生成器,没有真实世界的概念、意图和事实验证机制。目前“预测下一个词”的工作机制,正是制造幻觉的“元凶”之一——它让模型把“说得像真的”当作“是真的”,当数据模式模糊、记忆不牢或需要逻辑推导时,幻觉几乎不可避免。
下面详细展开。
一、大模型幻觉的根本原因
1. 训练目标与“事实真理”是错位的
大模型的训练目标是最大化下一个 token 的似然概率,也就是让输出在统计学上最像训练数据中的文本,而不是“输出符合世界真相的陈述”。
- 如果训练数据里有一段是“爱因斯坦发明了电话”,哪怕全世界都知道这是错的,只要这串文本在数据里出现过,模型就会学到:“爱因斯坦”后面可能出现“发明了电话”。
- 模型优化的不是“真实”,而是“数据分布中下一个词的合理性”。它只判断某句话在人类语料中有多“常见”,不会判断它是否“为真”。
这就从根本上决定了:只要看起来流畅合理、符合语言模式,无论真假,模型都有可能生成出来。
2. 知识是“压缩”而不是“存储查询”的
模型不是把知识当成一个可检索的数据库,而是把海量文本里的规律和事实“压缩”进参数字符串里。这种压缩注定是有损的,而且不同事实纠缠在一起,容易出现:
- 记忆混淆:把 A 的属性安到 B 头上(比如名人生日、公司总部)。
- 细节丢失:只记住大致关联,无法准确还原具体年份、数字、特定名字。
- 过时信息:知识截止日后的新事实完全不存在。
压缩带来的模糊性,在面对长尾、低频或非常相似的知识时,特别容易产生幻觉。
3. 自回归生成的“错误累积”与“暴露偏差”
模型训练时,输入的是标准答案的前缀(Teacher Forcing);但推理时,它必须用自己的上一个输出作为下一个输入。一旦生成中的某个小错误(哪怕只是一个模糊的词),就会:
- 被后续步骤当成“真实前缀”继续生成;
- 沿着这条错误路径越跑越远,用更多看似合理的废话去圆之前的错误。
这就是暴露偏差:模型在训练时从未见过自己生成的“有偏前缀”,所以当自己犯错时,完全不知道如何纠正,反而会变本加厉。
4. 概率性采样放大了不确定性
为了让回答不千篇一律,推理时会采用随机采样(如 Top-p,温度系数)。当模型对某个事实不确定(多种可能 token 的概率相差不大)时,采样很可能选到一个看似合理但实际上是错误的词,然后这又触发了上面第 3 点的错误累积。
5. 缺乏内在的“信念”与“校验”机制
人类说话时,知道自己知不知道;不知道时会犹豫,会去核实。大模型没有:
- 自知之明:它无法评估自己对一个事实的记忆是否牢靠,对所有提问都一视同仁地努力生成答案。
- 工具使用本能:它不会自动去搜索、用计算器验证,除非被训练成调用工具。纯生成模式下,它只能凭参数记忆硬猜。
二、目前的工作机制是元凶吗?
是的,当前“自回归预测下一个词 + 最大化似然”这一整套工作机制,正是幻觉产生的核心元凶。 更精确地说,它制造了幻觉的必然性。
可以这样理解这一机制的本质:
它把“文本的合理性”和“事实的真实性”彻底等价起来了。
在任何一个没有内置事实核查能力的统计生成系统里,“胡编乱造但看起来很像真的”本来就是一种非常合法的输出——对模型而言,那是概率上很合理的选择。
如果把责任分解:
- “下一个词预测”框架 → 定义了游戏规则:“像训练数据就行”。
- 没有显性的真实世界 grounding → 让模型永远活在语言本身的分布里,而不是客观事实中。
- 只能从过去上下文推断未来 → 无法回溯修改,错误会被锁死。
这三点共同造成了:
- 知识记忆错误时 → 幻觉。
- 需要多步逻辑推理时,中间推理链一断 → 幻觉。
- 需要精确数值、冷门实体时 → 幻觉。
- 需要从无到有创造细节时 → 编得极其真实,但纯属幻觉。
所以,现在业界普遍认为,只要模型还是一个纯“闭卷”生成下一个 token 的系统,幻觉就无法根除,只能缓解。 要大幅减少幻觉,就必须“破坏”这个纯工作机制,比如:
- 加入检索增强(RAG),把答案建立在外部真实文档上;
- 让模型使用工具(搜索引擎、计算器、数据库);
- 引入验证、自我反思和多步推理的链条,而不仅仅是生成最终文本。
这些做法,本质上都是在现有生成机制外面,再套一层“事实 grounding 和校验”的外壳。它们恰恰从反面证明:原生的、纯粹的自回归生成机制,就是幻觉的根本制造者。
一句话总结:
大模型幻觉的根源不在于它“不够聪明”,而在于它被设计的根本任务从来就不是“说真话”,而是“说人话”。目前的工作机制,正是这种错位任务的直接体现,是当之无愧的“元凶”。
更多推荐

所有评论(0)