掌握LLM微调新趋势:GRPO+RULER+ART,让你的AI代理超越百倍大模型!
文章指出,使用LLMs进行团队建设时,代理出错且无法学习是常见瓶颈。微调是解决方案,但传统微调设置复杂。现代微调技术如GRPO和RULER使微调更简单,无需手工奖励函数或标记数据。ART是一个将GRPO应用于现实代理的框架,支持工具调用和多轮对话,通过RULER自动评估代理表现,实现高效训练。通过微调,小型模型可超越大型模型,提供成本和延迟优势。
每个使用 LLMs 进行团队建设的团队最终都会遇到同样的瓶颈。
你编写了一个详细的系统提示,添加了少量示例,调整了温度,但你的代理仍然有30-40%的时间会出错。
最糟糕的是?
它从不从这些错误中学习。

微调是突破瓶颈的方法。
如果你使用 GPT 或 Claude,你使用的是和其他人一样的模型,具有相同的功能、相同的价格,并且没有竞争优势。
但是,如果你拿一个小的开源模型,并在你的特定任务上进行微调呢?它可以超越一个大小是其100倍的模型,成本和延迟只是其一小部分。

大多数开发者将微调与痛苦的设置联系在一起:精选的数据集、标记的输出、手工制作的奖励函数。
2026年,情况就不再是这样了。
使用 GRPO 和 RULER 的现代微调已经改变了可能实现的事情。现在,您可以训练那些通过经验真正改进的智能体,而无需编写一个奖励函数或收集一个标记的示例。
本文将详细介绍具体方法。
SFT 与强化微调
大多数开发者都了解监督微调(SFT)。你收集输入输出对,模型学习模仿它们。
问题在于? 监督微调教会模型说什么 ,而不是如何成功 。
对于需要搜索、调用 API 并在多步骤中进行推理的代理来说,模仿是不够的。你希望通过试错来改进。
这样想:
- SFT = 学习教科书(记忆已知问题的答案)
- RL = 在岗培训(通过试错和反馈学习)
这是强化微调(RFT)。你给模型一个奖励信号,让它自行发现最佳策略。

GRPO 如何工作
这一切背后的算法是什么?
GRPO(Group Relative Policy Optimization,群体相对策略优化)是目前最流行的 RFT 算法。它是 DeepSeek-R1 推理能力的核心算法。
其核心思想很简单。GRPO 不是训练一个单独的模型来评分回复,而是生成多个补全结果,并将它们相互比较进行评分。
每个提示符的工作原理如下:
- 采样一个组: 从当前模型生成 N 个补全结果
- 为每个结果打分: 奖励函数评估每次尝试
- 组内归一化: 计算相对于组平均值的相对优势
- 更新模型: 强化高于平均的行为,抑制低于平均的行为
GRPO 仅需要 相对排名 ,而不需要绝对分数。无论完成情况得分是 0.3、0.5 和 0.7 还是 30、50 和 70 都不重要。只有排序会驱动学习。

ART: Agent 强化训练器
GRPO 很强大,但如何将其实际应用于现实世界的代理?
ART (Agent 强化训练器) 是一个 https://github.com/OpenPipe/ART ,它将 GRPO 带到任何 Python 应用程序中。
大多数 RL 框架是为简单的聊天机器人交互而构建的:一个输入,一个输出,任务就完成了。真实代理则根本不同。它们搜索文档,调用 API,并在产生答案之前进行多步骤推理。

ART 正是为此而构建的。
它提供:
- 对工具调用和多轮对话的原生支持
- 与 LangGraph、CrewAI 和 ADK 的集成
- 训练期间高效的 GPU 利用
架构
ART 分为两部分:客户端和后端。
客户端是Agent代码所在的地方。
它向后端发送推理请求,并将每个操作记录到轨迹中,即一个代理运行的完整历史记录。
后端是执行重负载操作的地方。
它运行 vLLM 以实现快速推理,并使用 Unsloth 驱动的 GRPO 进行训练。
每次训练步骤后,新的 LoRA 检查点会自动加载到推理服务器中。

完整的训练循环如下:
- 客户端发送推理请求
- 后端生成模型输出
- 代理在环境中采取行动(调用工具、搜索等)
- 环境返回奖励
- 训练器通过 GRPO 更新模型
- 一个新的 LoRA 检查点加载到推理服务器中
- 重复进行,每个周期模型都比之前略有提升
无需手动奖励函数
这是大多数人最害怕的部分。
定义一个好的奖励函数一直是强化学习中最困难的部分。训练电子邮件代理需要标记的正确答案。训练代码代理需要测试套件。每一个都是自己独特的工程项目。
RULER(相对通用 LLM 引出的奖励)完全消除了这个瓶颈。它使用 LLM 作为裁判来比较多个代理轨迹并对其进行排序,无需标记数据。
它之所以有效,是因为有两个关键洞察:
- 让 LLM 评估"0-10 分"会产生不一致的结果
- 询问"这四个尝试中哪个最接近目标?"要可靠得多
而且,因为 GRPO 只需要相对分数,所以绝对值 anyway 都无关紧要。
这个过程分为三个步骤:
- 为场景生成 N 条轨迹
- 将它们交给一个 LLM 评委,评委对每条轨迹从 0 到 1 进行评分
- 直接使用这些分数作为 GRPO 中的奖励
没有需要编写的奖励函数。没有需要收集的标记数据。

整合起来:一个实用示例
我整合了一个完全可运行的笔记本,通过强化学习和 ART 训练一个 3B 模型,使其掌握如何使用任何 MCP 服务器。
只需提供 MCP 服务器 URL–》 https://github.com/patchy631/ai-engineering-hub/tree/main/art_mcp_rl:
- 查询服务器的工具
- 生成一组使用这些工具的输入任务
- 使用自动 RULER 评估在这些任务上训练模型
您可以在 ART GitHub 存储库中找到更多示例以进行适配和入门
仓库链接 →https://github.com/OpenPipe/ART

假如你从2026年开始学大模型,按这个步骤走准能稳步进阶。
接下来告诉你一条最快的邪修路线,
3个月即可成为模型大师,薪资直接起飞。
阶段1:大模型基础

阶段2:RAG应用开发工程

阶段3:大模型Agent应用架构

阶段4:大模型微调与私有化部署

配套文档资源+全套AI 大模型 学习资料,朋友们如果需要可以微信扫描下方二维码免费领取【保证100%免费】👇👇





配套文档资源+全套AI 大模型 学习资料,朋友们如果需要可以微信扫描下方二维码免费领取【保证100%免费】👇👇

更多推荐




所有评论(0)