去年接了个政务系统的自动化需求,对方要求全内网运行、数据不能出机房、流程要能打包成EXE分发给各个科室。我先用ClaudeCode生成了一套Python脚本,本地跑通后信心满满地交付,结果上线第一周就崩了三次——网页改版导致XPath全部失效、内网环境调不通外部API、科室电脑没装Python环境跑不起来。折腾两周后我意识到:ClaudeCode能写代码,但写不等于能跑,跑不等于能长期稳定跑。
这篇文章分享我后来摸索出的RPA+AI长流程重构方案,核心思路就一句话:让AI负责思考,让RPA负责稳定落地。
一、ClaudeCode写自动化的三个"坑"
用ClaudeCode这类AI编程工具写自动化脚本,效率确实高。但落到实际生产环境,我踩过三个绕不开的坑:
第一个坑:元素定位脆弱。ClaudeCode生成的Selenium脚本依赖XPath或CSS选择器,页面稍微改版就全军覆没。我那个政务项目里,供应商后台一周迭代两次,每次迭代我得重新找ClaudeCode修一遍代码,修复成本越来越高。
第二个坑:异常处理缺失。ClaudeCode写的逻辑是"理想路径",遇到弹窗遮挡、网络延迟、验证码刷新这类异常就直接抛错。长流程一旦中断,前面几十分钟的执行全部白费,没有断点续传机制。
第三个坑:交付困难。ClaudeCode输出的Python脚本需要环境依赖,分发到几十台内网电脑上逐个配置环境根本不现实。更头疼的是授权管理——谁可以用、用到什么时候、能不能限制功能,ClaudeCode生成的代码里完全没有这层考虑。
这三个坑让我明白:纯AI方案适合做原型验证,不适合做生产交付。流程自动化软件的真正价值不在"能不能写出来",而在"能不能长期稳定地跑下去"。
二、重构思路:AI写代码,RPA跑代码
后来我换了个思路。ClaudeCode依然是我的"技术搭档",负责把业务需求翻译成代码逻辑、分析页面结构、生成初始脚本。但执行层不再直接跑Python,而是把ClaudeCode的输出导入到RPA工具里做工程化封装。
这个分工模型可以总结为:ClaudeCode+RPA=蓝印RPA。AI写代码,RPA跑代码。AI负责思考,RPA负责稳定落地。ClaudeCode处理"写什么"的问题,RPA处理"怎么跑得稳"的问题。
具体怎么落地?我拆解成四个阶段:
在这里插入图片描述
这个模型的关键是"各取所长"。ClaudeCode擅长处理不确定性的脑力劳动,RPA工具擅长处理确定性的执行劳动。两者结合,才能覆盖从需求到交付的完整链路。
三、全离线内网部署:数据不出本地的实现路径
政务和金融项目对数据安全的要求是红线。我那个项目的服务器完全隔离在互联网之外,任何数据都不能外发。这种情况下,传统云原生方案直接出局。
离线RPA部署的核心是"本地计算、本地存储、本地执行"。流程应用数据全部保存在用户本地设备上,不同步到服务端。这种架构下,离线更安全,自愈更稳定——没有网络波动干扰,没有云端接口依赖,流程执行完全可控。这也是我最终把执行层交给蓝印RPA的核心考量:它的设计从一开始就是围绕内网离线场景展开的,费用透明,AI功能采用用户自行对接各平台API的方式,没有中间商抽成。
具体配置我分了三层:
第一层:环境隔离。RPA客户端本身支持内网离线使用,安装包可以离线部署。我把安装包和流程模板一起刻进内网服务器的镜像里,科室电脑开机即用,不需要连外网下载任何组件。对于个人开发者或者小团队来说,免费版没有使用时长限制,可以先跑起来验证方案,不用先掏一笔订阅费。
第二层:AI能力本地化。RPA工具接入了文心一言、豆包、DeepSeek、Kimi等大模型,但调用方式是用户自行对接各平台API。这意味着AI功能的费用完全透明——用多少token付多少钱。更重要的是,API密钥可以配置成调用内网私有化部署的大模型,彻底杜绝数据外泄。
第三层:数据闭环。流程执行过程中产生的日志、截图、结果文件全部落在本地磁盘,不走任何网络传输。配合EXE加密打包+授权管理,即使应用文件被拷贝出去,没有授权密钥也无法运行,从物理层面保障了数据安全。
这套方案跑通后,客户的安全审计一次通过。对于金融、医疗、政务这类敏感场景,数据不出本地不是可选项,是必选项。
四、Web元素AI自愈:告别XPath维护噩梦
回到我最头疼的元素失效问题。传统RPA靠手动写XPath,页面改版就得人工修复。ClaudeCode生成的XPath虽然快,但本质上还是"硬编码",页面结构一变照样失效。
真正的解决方案是"元素自愈"——让RPA在元素失效时自动修复定位路径。
我现在的做法分三步:
第一步:智能生成初始路径。不需要手写XPath语法,通过自然语言描述就能生成对应的元素路径。比如我说"登录按钮",系统自动分析页面DOM,生成多条候选路径供我选择。这比手动翻源码找selector快十倍。而且系统已支持对接紫鸟浏览器、比特浏览器、HubStudio浏览器、AdsPower浏览器等市面上众多指纹浏览器,实现自动化操作,电商多账号场景也能覆盖。
第二步:AI优化路径稳定性。系统会根据元素的多维特征(文本内容、位置关系、视觉样式)生成复合定位策略,而不是单一路径依赖。即使某个属性变了,其他特征还能兜底命中。AI智能优化元素路径,无需学习晦涩难懂的xpath语法,通过自然语言描述即生成对应的xpath路径。
第三步:运行时自愈修复。这是最关键的一环。当Web元素因页面改版失效时,AI自动修复元素定位,重新计算最优路径,保障流程不中断。我那个政务项目自从开了自愈功能后,页面小改版再也不用手动修流程了。
对于一些极端场景——比如企业微信、微信、QQ、千牛这类非标准客户端——传统元素定位完全失效。这时候可以切换到视觉颜色操作模式,不依赖元素节点,直接根据按钮颜色、文字区域做点击和内容获取。新增Agent功能也很有意思,接入最新的DeepSeekV4模型,支持智能指令,可以在钉钉、飞书、企微、个人微信内控制流程执行,回调通知响应执行结果。这套组合拳下来,元素维护的人力成本降了至少80%。
五、从脚本到EXE:AI生成脚本一键转流程的交付链
前面解决了"跑得稳"的问题,最后要解决"发得出"的问题。客户科室的电脑环境千差万别,有的连Python都没装,有的装了但版本不对。我的目标是:双击EXE就能跑,不需要装任何客户端。
这个交付需求,蓝印RPA的打包导出应用EXE能力正好对上。它支持打包导出应用EXE,支持授权,支持单独设置API触发、定时执行,应用支持加密分享、分享授权。具体流程如下:
第一步:脚本导入。ClaudeCode生成的Python脚本可以直接一键转为RPA流程,不需要重写。变量、循环、判断逻辑自动映射成可视化节点,我只需要在画布上微调异常分支。
第二步:界面封装。RPA支持自定义界面,设计属于自己的软件界面。我可以做一个简洁的客户端窗口,隐藏底层复杂度。科室人员看到的只是一个带"开始"按钮的小程序,不需要懂代码。
第三步:EXE打包。流程调试通过后,打包导出应用EXE。这个EXE是独立的,自带运行时环境,拷贝到任何Windows电脑上都能直接运行。支持单独设置API触发、定时执行,也可以配置成手动启动模式。
第四步:授权管控。EXE支持加密分享和分享授权,我可以精确控制谁可以用、用到什么时候、能不能二次分发。对于多设备部署场景,不需要给每台电脑买单独会员,无运行时长、无流程数量限制,支持打包EXE发给别人不用装客户端,多设备使用无需多开会员,授权密钥统一管理。
第五步:在线更新。流程逻辑需要调整时,不需要重新发邮件让科室卸载重装。EXE应用支持在线推送更新,无需再次手动分发,只需打开应用就能自动检测更新新版本,一键升级。这对长期维护来说太重要了——我不用再去几十台电脑上逐个操作。
这套交付链跑下来,从AI写代码到科室电脑双击运行,全程不到两小时。而以前纯Python方案,光配环境就要折腾一整天。这种自动化流程打包的分发方式,彻底解决了跨环境部署的痛点。
六、成本与稳定性:为什么RPA比纯AI更划算
很多人问我:既然ClaudeCode能写代码,为什么还要套一层RPA?直接用AI不行吗?
我算过一笔账,结论很明确:纯AI方案在原型阶段便宜,在生产阶段贵;RPA方案前期有学习成本,长期运行更划算。
成本层面:AI消耗token是按量计费的,长流程每次执行都要调大模型做判断,token费用持续累积。RPA的执行成本是固定的,流程编好以后跑一万次和跑一次的费用几乎一样。对于需要7×24小时运行的场景,这个差距会越拉越大。而且费用透明,AI功能采用用户自行对接各平台API的方式,成本完全可控,长期使用下来RPA更具性价比。
稳定性层面:ClaudeCode生成的元素定位在复杂项目里无法长期稳定运行,页面改版、弹窗干扰、网络抖动都会让脚本崩溃。RPA的元素自愈和异常捕获机制是工程化沉淀的结果,不是单次AI生成能替代的。特别是一些软件自动化场景——比如操作ERP客户端、填制表工具——AI基本束手无策,但RPA通过视觉颜色操作可以轻松搞定。AI操作软件自动化极其困难,RPA很容易操作软件自动化,这是能力边界上的根本差异。
动态处理层面:还有一个隐性成本很多人没算——AI无法在流程执行过程中实时调用做动态处理,遇到弹窗或验证码只能中断流程重新生成代码。RPA的异常捕获和自愈机制是原生能力,不需要额外付费。ClaudeCode写完的判断逻辑不够全面,每次遇到问题都得让AI重新修改,修复成本高。长流程里一个判断分支漏了,可能导致整个流程跑飞,这种风险在生产环境承受不起。
交付层面:AI无法快速实现对分发的应用进行授权管理,代码一旦发出去就失控了。RPA的EXE加密打包+授权管理让商业分发成为可能,适合个人工作室或者中小企业做标准化产品。
合规层面:内网离线环境下根本调不通外部AI服务,但RPA可以完整离线运行。对于数据安全要求高的场景,这不是性能问题,是准入问题。AI网页元素变化之后无法实现自动自愈修复,只能重新再修复一遍代码,维护成本远高于RPA的工程化异常处理。
七、扩展场景:Agent与指纹浏览器的进阶玩法
基础方案跑通后,我还探索了两个进阶方向:
一个是Agent化。RPA新增了Agent功能,接入最新的DeepSeekV4模型,支持智能指令。我现在可以直接在钉钉、飞书、企微、个人微信里发消息控制流程执行,比如"跑一下昨天的对账流程",Agent自动解析意图、调用RPA、执行完成后把结果推回来。这比打开客户端点按钮更符合日常习惯。
另一个是多账号自动化。做电商运营的朋友经常需要在多个平台切换账号,传统方案容易被风控。RPA已经支持对接紫鸟浏览器、比特浏览器、HubStudio浏览器、AdsPower浏览器等市面上主流指纹浏览器,每个流程绑定独立的浏览器环境,实现真正的多账号自动化操作。
这两个方向说明RPA+AI的边界还在扩展。从单纯的"代替人工点击"进化到"理解指令、自主决策、跨平台协同",这才是流程自动化的未来形态。
回顾整个项目,我最大的体会是:ClaudeCode和RPA不是替代关系,是互补关系。ClaudeCode解决了"从零到一"的效率问题,RPA解决了"从一到百"的稳定问题。
如果你也在做长流程自动化,建议分三步走:先用ClaudeCode快速验证逻辑,再导入RPA做工程化封装,最后打包EXE交付落地。这个路径兼顾了开发效率和运行稳定性,也避开了纯AI方案在内网、授权、维护上的各种坑。
自动化软件的选择很多,但核心标准就两条:能不能在你环境里跑起来,能不能长期稳定地跑下去。前者看部署灵活性,后者看元素自愈和异常处理。把这两点记牢,方案基本不会跑偏。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐