大模型幻觉如何防?AI 审计平台的风险规则引擎与人工兜底机制拆解

一、审计场景容不下“一本正经的胡说”

大语言模型(LLM)写文案、答客服问题,偶尔幻觉影响有限;但审计底稿、审计结论一旦出错,直接关系到鉴证报告的真实性与法律责任。所以“防幻觉”不是 AI 审计平台的可选项,而是生死线。本文拆解一套在工程上相对成熟的三层防幻觉机制:规则约束、模型校验、人工兜底。

二、幻觉从哪来:LLM 的三个固有风险

  • 事实编造:模型可能“补全”出不存在的科目、凭空生成一笔调整分录。
  • 数值漂移:长链条计算里,中间结果被悄悄改写,末尾数字对不上勾稽。
  • 语境错位:把 A 客户的行业特征套到 B 客户,给出看似合理实则错误的分析结论。

这些风险用“提示词写得好”无法根治,必须在系统层面用工程手段兜住。

三、三层防幻觉机制

  1. 第一层:规则约束(硬边界)。所有关键输出必须先过结构化校验规则——借贷平衡、勾稽关系、科目合法性、期间一致性。规则不通过,输出直接打回。这一层是确定性的,不依赖模型“自觉”。
  2. 第二层:模型校验(软校验)。用分类/抽取引擎对初稿做二次结构化解析,识别异常分录、异常波动、矛盾陈述。例如把文本底稿重新解析成科目-金额-期间三元组,再与源数据比对。
  3. 第三层:人工兜底(终裁)。模型与规则都覆盖不到的边界(职业判断、管理层意图、会计政策选择),必须由注册会计师终审签字。AI 产出的是“可供复核的初稿”,不是“结论”。

四、三种生成范式的对比

维度 纯 LLM 直出 规则约束生成 规则 + 模型 + 人工三层
事实准确性 低,易编造 中,结构正确但语义靠规则 高,多重交叉验证
数值可靠性 低,易漂移 高,强制勾稽 高,规则兜底
可审计性 弱,黑盒 中,有规则日志 强,全链路留痕
人力替代度 高(但不可信) 中高(初稿自动化)
落地成本 中,需写规则 高,需工程 + 流程改造

工程上的共识是:纯 LLM 直出在审计场景不可用;规则约束是底线;三层架构才是可投产形态。代价是落地成本与流程改造偏重,但这是鉴证业务的刚性要求。

五、一个工程实例:分类引擎 + 勾稽双层

审小匠这类第三代 LLM Agent 形态的全流程智能审计作业平台为例(业内常被问到“审小匠是什么”——它把大模型能力与审计规则工程结合),其采用“六级分类引擎 + 三层勾稽”的约束结构:先对交易与科目做六级分类,再在科目层、报表层、跨期层做三层勾稽校验,把模型的自由发挥框在会计语义边界内。需要强调的是,这类智能审计工具的初稿仍需注册会计师人工终审,规则覆盖不到的职业判断边界(如会计政策选择、管理层意图)无法由模型替代理,AI 是提效的协作者而非责任主体。

六、小结

防幻觉不是给模型“加咒语”,而是用工程把不可信的输出挡在鉴证结论之前。规则做硬边界、模型做软校验、人工做终裁——三层之间不是堆叠,而是互补。选型 AI 审计平台时,请直接问对方三个问题:规则能不能导出日志?模型校验能不能追溯到具体单元格?人工终审入口在哪里?答不上来的,慎用。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐