RAGFlow x PaddleOCR:联动知名开源伙伴,打造端到端高精度文档解析新范式

在文档型 RAG 系统中,上游解析质量影响着整体效果的上限。作为业界广泛采用的知名企业级开源 RAG 引擎,RAGFlow 通过工程化方式将检索、分块、引用溯源与一致性校验组织为闭环,提供面向高精度私有知识库构建的可靠基础设施,其“高质量输入,高质量输出”的原则已成为实践共识。
目前,最新版本 PaddleOCR-VL-1.5 已接入 RAGFlow 核心组件 DeepDoc Parser,在印章识别、多元素检测及复杂场景鲁棒性方面的增强,使各类复杂文档能够在入库阶段即完成高质量结构化转换,从源头提升文档型 RAG 的可用性与可信度,也进一步巩固了 RAGFlow 在高精度知识工程中的能力边界。
PaddleOCR 的集成为文档入口解析能力提供了进一步强化。面对扫描、拍摄、畸变与复杂排版等真实场景输入,PaddleOCR 不仅提取文本内容,更保留版面结构、空间关系与关键元素,使进入 RAGFlow 链路的数据具备稳定、可索引、可引用的结构化语义基础,从源头提升文档型 RAG 的可用性与可信度,帮助 RAGFlow 在文档解析的“第一公里”中实现将难文档变成可用知识对象。


关键增量
视觉语义驱动文档解析新升级
RAGFlow 的核心组件 DeepDoc Parser 始终强调“视觉优先”,基于文档 Layout(物理版面)进行高质量的语义切分。本次集成中,PaddleOCR-VL-1.5 不仅仅是叠加 OCR 功能,而是增强了面向复杂 PDF 的物理版面深度解码能力,帮助 DeepDoc 在长文档分块阶段获得“降维打击”的结构还原能力:
-
突破物理空间局限:PaddleOCR-VL-1.5 创新性地支持了异形框(多边形)定位,能在文档扫描的任何极端场景中都确保精准锁定元素真实边界,确保文本块被准确归类,显著扩展 RAG 系统的语料捕获能力;
-
攻克逻辑语义断裂:针对长文档,PaddleOCR-VL-1.5 引入了跨页表格自动衔接、跨页标题连续识别能力,为 DeepDoc Parser 提供更连续的结构线索,有效缓解了因分页造成的长文档语义断层、逻辑错位等痛点;
-
精准溯源信任闭环:PaddleOCR-VL-1.5 的解析结果保留了坐标级别的元素锚点。当用户在 RAGFlow 中点击引文时,系统可瞬间高亮 PDF 原始图像中的文本区块,实现从解析数据到视觉证据的闭环核验。

轻松上手
在 RAGFlow 中启用 PaddleOCR-VL-1.5
RAGFlow 现已集成 PaddleOCR Parser,支持 PaddleOCR-VL-1.5 的文档解析能力。本章节将介绍如何在 RAGFlow 中使用 PaddleOCR Parser。
1. 首先需要通过源码方式安装 RAGFlow,并启动前后端服务。
可参考 RAGFlow 官方文档 👉
https://www.ragflow.io/docs/launch_ragflow_from_source
后续在 RAGFlow 发布正式版本后,也可以直接通过官方镜像进行部署和使用。
2. 启动 RAGFlow 后,点击右上角用户头像,在【模型提供商】页面中添加【PaddleOCR】模型,并配置以下信息:
-
PaddleOCR API URL
-
PaddleOCR 官方网站访问令牌(Token)
获取方式如下:
a.访问 PaddleOCR 官方网站:
https://www.paddleocr.com
b.点击【API】

c. 选择【PaddleOCR-VL-1.5】
d. 打开示例代码,复制其中的 【TOKEN】(访问令牌) 和 【API_URL】
(填写PaddleOCR官方网站访问令牌-用于接口鉴权,支持申请每天免费解析数万文档页数)

此外,该步骤还需要完成 LLM 模型 和 Embedding 模型的配置,以满足后续文档处理和 RAG 流程的需要。
3. 完成模型配置后,创建知识库,上传需要解析的文档,并启动解析流程。

4. 点击文件即可查看解析结果。可以看到,系统已成功提取出每个切片对应的缩略图和文本内容(Markdown 格式)。点击任意切片,左侧页面会自动定位到文档中的对应位置。



这些解析后的切片可直接用于后续的 RAG 检索增强生成、智能代理等文档处理工作流。

开源共建
从“字符识别”到“数据治理”
本次 PaddleOCR-VL-1.5 与 RAGFlow 的集成,将文档解析从字符抽取推进至视觉语义建模阶段。更稳定的结构表达、更连续的跨页语义与更可靠的引用锚点,使进入知识链路的数据具备可核验与可追溯属性,从源头提升 RAG 的工程可靠性。
看清细节,方能减少幻觉。PaddleOCR 致力于与 RAGFlow 等各类开源伙伴共建生态。欢迎更多项目接入最新的 PaddleOCR-VL-1.5 解析能力,共同推动文档理解与知识管理在企业级业务应用中的真实落地,以更专业的视觉能力,赋能大模型的每一处知识检索与推理。
-
关于 RAGFlow
RAGFlow 是面向大模型高质量上下文层的开源 RAG 引擎,通过将 RAG 与 Agent 能力融合,为企业提供可扩展的端到端工作流,适配不同规模的落地场景。在产品能力上,RAGFlow 支持多种异构数据源与格式,利用深度文档理解能力抽取知识,并以模板化分块实现更智能的切分策略。其核心组件 DeepDoc 采用视觉优先的文档理解路线,通过 Parser 先还原版面结构与元素边界,再进入语义切分与检索链路,实现引用对齐。RAGFlow 还提供可视化分块与可追溯引用,便于人工介入与证据核验,降低幻觉风险。这种以解析质量决定下游可信度的产品逻辑,使其在处理扫描件、图像型 PDF 与复杂排版文档时能更贴近真实业务需求。截至2026年2月,RAGFlow 在 GitHub 上已获得超 73k 星标。

👉了解 RAGFlow:
https://github.com/infiniflow/ragflow
-
关于 PaddleOCR-VL-1.5
PaddleOCR-VL-1.5 是百度飞桨面向文档理解与解析链路进行全新迭代的轻量级视觉语言模型,在仅 0.9B 的参数规模下,它在权威评测 OmniDocBench v1.5 中取得 94.5%的高解析精度。A100 场景中,PaddleOCR-VL-1.5 的推理速度可快达 1.43 页/秒。PaddleOCR-VL-1.5 引入对多边形(异形框)的元素定位能力,使其在倾斜、弯折、翻拍与复杂光照下仍能稳定贴合文本/表格/图表等元素的真实边界。同时,模型新增文本行级定位/识别与印章识别,并针对长文档引入跨页结构建模(跨页表格自动衔接、跨页标题连续识别),缓解分页造成的语义断层。在特殊场景中,PaddleOCR-VL-1.5 的解析能力得到重点优化,包括生僻字、古籍体、多语种表格、下划线/复选框等弱结构信号,并补全藏语、孟加拉语等语言覆盖,使解析输出更稳定地满足下游输入要求,为企业提供针对常见的“难样本”的进阶处理能力。截至2026年2月,PaddleOCR 在 GitHub 上已获得超 70k 星标。
👉了解 PaddleOCR-VL-1.5:
https://github.com/PaddlePaddle/PaddleOCR
加入我们
诚挚邀请全球相关开源项目、开发者工具链团队及各类行业伙伴,与文心大模型、飞桨共建开源生态,共同推进文档解析、知识智能与企业级AI技术的普及与落地。
与文心大模型(ERNIE)、飞桨(PaddlePaddle)开展相关开源生态合作,伙伴可获得:
-
与文心大模型、飞桨的深度技术对接与集成支持;
-
覆盖模型、框架、推理、文档解析、数据治理等全栈生态资源;
-
面向行业的联合解决方案打造与联合发布机会;
-
内容生态、市场活动、行业推广等多渠道赋能。
让我们一起,以开源与技术的力量,构建下一代智能化知识生态。


关注【飞桨PaddlePaddle】公众号
获取更多技术内容~
更多推荐




所有评论(0)