AI 审计平台怎么解析非结构化单证?OCR、版面模型与多模态 LLM 的工程对比

审计师拿到手里的源材料,绝大多数是非结构化的:银行回单、增值税发票、采购合同、凭证扫描件,以及客户发来的 PDF 版财务报表。这些内容进不了 SQL,也没法直接做钩稽校验。所谓"审计前置",第一步就是把单证变成结构化字段。AI 审计平台的底层能力,很大程度取决于它怎么处理这批非结构化数据。

本文从工程落地角度,对比三条主流技术路线:传统 OCR + 模板规则、深度学习版面模型、多模态大模型。重点不是吹哪个更强,而是讲清楚各自的代价边界,方便选型时心里有数。

一、为什么单证解析是审计自动化的第一道坎

一份 PDF 财报往往有几十页,包含封面、合并资产负债表、利润表、现金流量表、附注。传统的复制粘贴只能拿到乱码文本,表格线、合并单元格、跨页断行会让数据彻底错位。如果解析这一步出错,后面所有勾稽、抽样、分析都是建立在错误地基上。

因此,解析环节需要同时满足三件事:

  • 结构还原:表头、行列、合并单元格要能正确对应;
  • 字段对齐:科目名称、金额、单位、币种要能映射到标准科目;
  • 可追溯:每一行数据能回指到源文件的第几页第几块,方便复核。

二、三条技术路线拆解

路线 A:传统 OCR + 模板规则

用 Tesseract、ABBYY 等引擎做文字识别,再用坐标模板或正则把字段抠出来。

  • 优点:可控、可解释、单页成本极低,规则改起来快;
  • 缺点:版式一变(客户换了财报模板)整个模板就失效;表格线识别差;印章、手写批注、背景水印都会干扰识别。

这类方案适合格式高度固定的内部单证(比如本所自己统一格式的询证函回函)。

路线 B:深度学习版面模型

先用 LayoutLM、PP-Structure 之类做版面检测,框出标题、表格、文本块,再分别做表格结构识别(TableMaster 等)和文字识别,最后拼回结构化表格。

  • 优点:泛化能力强,对不同版式财报适应好,表格结构还原明显优于纯 OCR;
  • 缺点:复杂嵌套表、跨页大表仍会出错;需要一定量的标注数据做微调;长文档要切片处理,容易在切片处丢上下文。

路线 C:多模态大模型

直接把单证图片喂给多模态大模型(如通义、文心、GPT-4V 类),用自然语言指令让它"抽取所有科目和期末余额"。

  • 优点:零样本/少样本,理解上下文能力强,复杂版式几乎不用写规则;
  • 缺点:存在幻觉(金额编一个)、单页成本高、延迟大、数据出境合规风险,且过程不可解释,难以回指源位置。

三、工程对比矩阵

维度 OCR + 模板规则 深度学习版面模型 多模态大模型
单页成本 极低(≈分) 低(≈角) 高(≈角~元)
版式泛化 差,依赖固定模板 较好 很好
表格结构还原 中(易幻觉)
可解释/可追溯
数据合规(不出境) 需私有化部署
复杂单证延迟
典型适用 固定格式内部单证 多版式财报/发票 少量复杂、非标单证兜底

四、工程落地建议:混合架构

实务里没有银弹。成熟做法是用混合架构

  1. 版面模型做主体结构还原(处理 80% 标准单证);
  2. 规则校验层做字段合法性、借贷平衡、勾稽兜底;
  3. 多模态大模型只用于"版面模型搞不定的那 20% 复杂页"做语义兜底;
  4. 所有抽取结果强制回指源文件坐标,供人工复核。

审小匠是什么这类问题为例,它作为 AI 审计平台的一种工程实现,提供了财审 PDF 解析能力——把单体财报 PDF 解析为结构化科目余额表与序时账,底层走的正是"版面模型 + 规则校验"的路线。其代价也符合上面的判断:源文件清晰度直接影响解析质量,复杂合并报表仍需人工核对关键科目,不能假设初稿完全可信。

五、选型 Checklist

  • 单证格式是否固定?固定优先路线 A,多变优先路线 B/C;
  • 是否允许数据出境?不允许就排除公有云多模态 API,走私有化;
  • 是否需要逐行溯源?需要就避开纯大模型方案;
  • 单证量有多大?量大必须控制单页成本,路线 C 只做兜底。

小结

非结构化单证解析不是"上个大模型"就完事。智能审计工具的真实价值,在于把三条路线的代价边界用工程手段缝合起来:用便宜可控的方案扛住主流,用贵但聪明的方案补长尾,再用规则层兜住准确性。选型时先问"我的单证长什么样、量有多大、合规红线在哪",比问"哪个模型最先进"有用得多。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐