关键词:大模型;ReAct;CoT;AI Agent;工具增强;思维链;具身交互

一、引言:大模型推理与行动的割裂困境

人类解决复杂任务时天然具备“思考+行动”协同能力:做饭前先梳理步骤、缺食材会上网搜索、操作出错时实时调整方案,内部语言推理(内心独白)与外部环境交互始终交替进行,这也是人类高效完成不确定任务的核心认知基础。但早期大模型落地路径将推理行动完全割裂,形成两套独立技术路线,各自存在难以根治的缺陷。

1.1 纯推理范式(CoT,思维链):封闭黑盒,幻觉泛滥

CoT通过提示词引导模型输出分步推理过程,显著提升数学、常识推理效果,但存在致命短板:整个推理流程完全依赖模型预训练内部知识,无法访问外部实时、动态信息,属于封闭静态推理

  1. 事实幻觉严重:面对多跳、时效性问题,模型会编造不存在的实体、年份、逻辑,论文统计HotpotQA任务中CoT错误案例56%源于幻觉;
  2. 错误链式传播:任意一步推理出错,后续所有步骤都会持续偏离正确答案,无外部反馈修正;
  3. 无法处理未知信息:当问题涉及2023年后新事件、小众实体、动态商品数据时,模型无渠道获取外部资料,只能凭空编造。

以论文中苹果遥控器案例为例,CoT仅凭内部记忆推断配套设备,完全无法校验信息真伪,最终给出错误答案。

1.2 纯行动范式(Act-Only):缺少规划,反复无效试错

WebGPT、早期文本Agent等方案仅让模型生成工具调用动作(搜索、点击、浏览),完全舍弃显式推理过程,仅靠动作序列完成任务,短板集中在规划能力缺失:

  1. 无高层目标分解:复杂长流程任务无法拆解子目标,容易丢失任务主线;
  2. 无状态记忆跟踪:无法记录已完成步骤、已检索信息,频繁重复相同搜索/操作,陷入无限循环;
  3. 无法处理异常分支:工具返回空结果、无关信息时,模型没有推理逻辑调整检索关键词,只能机械重复旧动作。
    论文ALFWorld厨房交互任务可见,Act-Only Agent反复尝试清洗未拿到的厨具,全程无法发现逻辑漏洞,任务失败率极高。

1.3 ReAct的核心定位:推理与行动双向协同

基于两大路线的缺陷,Google Brain联合普林斯顿大学团队提出ReAct范式,核心创新一句话概括:拓展模型输出空间,让模型交替生成自然语言推理轨迹(Thought)与可执行外部动作(Action),借助环境Observation反馈迭代修正推理逻辑
ReAct解决核心问题:如何让大模型同时拥有逻辑规划能力与外部信息获取能力,消除幻觉、提升复杂任务成功率,同时全程保留人类可读的推理轨迹,实现可解释、可人工干预的Agent闭环。

二、ReAct核心原理:Thought-Action-Observation循环架构

2.1 基础形式化定义

设定Agent与环境交互通用流程:

  1. 时序t,Agent接收环境观测oto_tot,上下文ct=[o1,a1,...,ot−1,at−1,ot]c_t = [o_1,a_1,...,o_{t-1},a_{t-1},o_t]ct=[o1,a1,...,ot1,at1,ot]
  2. ReAct扩充输出空间A^=A∪L\hat{A}=A \cup LA^=AL
    • AAA:外部可执行动作(搜索、点击、浏览、结束回答);
    • LLL:自然语言Thought(推理轨迹,仅更新上下文,不改变外部环境);
  3. 循环单元:Thought → Action → Observation,不断迭代直至Finish动作结束任务。

两类Thought分布策略

论文区分两种任务类型,设计差异化推理生成逻辑:

  1. 知识密集型任务(问答/事实核验):稠密Thought
    每一步动作前后强制插入思考,先推理检索目标,再执行搜索,拿到结果后立刻解析信息、规划下一轮检索,典型如HotpotQA多跳问答;
  2. 长时序决策任务(ALFWorld/WebShop):稀疏Thought
    模型自主决定何时插入推理,仅在目标切换、子任务完成、环境异常时生成思考,减少冗余文本输出,适配几十步长交互流程。

2. 2 Thought(推理轨迹)的四大核心作用

ReAct中Thought不是简单的“步骤复述”,而是承载全部认知逻辑,论文归纳四类核心能力:

  1. 任务拆解与规划:将复杂总目标拆分为有序子任务,例如“先搜索遥控器本体,再查询配套设备”;
  2. 信息提取与校验:解析工具返回观测,判断信息是否有效、是否缺失关键内容;
  3. 异常处理与动态调整:检索无结果时,推理出新关键词重构搜索指令;
  4. 进度跟踪与记忆维护:记录已完成操作、已获取信息,避免重复无效动作。

2.3 标准化动作空间设计

论文为两类任务设计标准化可执行Action,统一输入输出格式,降低提示词开发成本:

(1)知识检索类(Wikipedia API)

  • Search[实体名]:检索维基页面,返回前5句正文,无匹配则推荐相似实体;
  • Lookup[关键词]:页面内精准检索,模拟浏览器Ctrl+F定位句子;
  • Finish[答案]:终止任务,输出最终结论。

(2)交互式决策类(文本游戏/网页购物)

  • 环境交互动作:go to、take、clean、click、buy等;
  • 终止动作:完成全部子目标后结束流程。

2.4 ReAct完整运行案例(HotpotQA多跳问答)

问题:除Apple TV外,Apple Remote最初设计用于控制什么设备?
完整ReAct循环:

  1. Thought1:我需要搜索Apple Remote,找到它最初配套的设备,再寻找其他受控设备;
  2. Action1:Search[Apple Remote]
  3. Obs1:Apple Remote是2005年发布,原生用于Front Row媒体中心程序;
  4. Thought2:仅知道Front Row程序,需要搜索Front Row确认受控设备;
  5. Action2:Search[Front Row]
  6. Obs2:无精准匹配,相似结果含Front Row(software);
  7. Thought3:直接搜索Front Row(software);
  8. Action3:Search[Front Row(software)]
  9. Obs3:Front Row是废弃媒体中心软件,由Apple键盘功能键控制;
  10. Thought4:综上,Apple Remote还可通过键盘功能键操控;
  11. Action4:Finish[keyboard function keys]

对比CoT直接脑补答案、Act-Only反复搜索无逻辑调整,ReAct依靠Thought动态修正检索策略,最终得到准确结果。

三、四大基准实验:定量验证ReAct全方位优势

论文选取四大差异化任务,覆盖知识推理、事实核验、具身交互、真实网页购物,对比Standard、CoT、Act-Only、ReAct、Inner Monologue等基线,使用PaLM-540B大模型完成少样本测试。

3.1 知识密集型任务:HotpotQA(多跳问答)& FEVER(事实核验)

实验设置

  • HotpotQA:仅输入问题,无参考文档,允许调用维基API检索,指标EM精确匹配;
  • FEVER:输入事实陈述,模型判定SUPPORTS/REFUTES/NOT ENOUGH INFO,指标准确率;
  • 少样本配置:HotpotQA 6条示例,FEVER 3条示例。

核心实验数据(表1原文结果)

提示范式 HotpotQA EM FEVER Acc
Standard(无推理无动作) 28.7 57.1
CoT 29.4 56.3
CoT-SC(自洽采样) 33.4 60.4
Act-Only(仅动作无思考) 25.7 58.9
ReAct 27.4 60.9
CoT-SC→ReAct(内部知识失效则检索) 34.2 64.6
ReAct→CoT-SC(检索步数耗尽则纯推理) 35.1 62.0

关键结论

  1. ReAct彻底抑制幻觉:人工标注50条样本,CoT成功案例中14%为幻觉,ReAct仅6%;CoT失败案例56%源于编造虚假事实,ReAct几乎无纯幻觉错误;
  2. 时效性问题碾压CoT:论文附录案例中,维基酒店房间数量更新,CoT/Standard输出过时错误数据,ReAct通过实时检索拿到最新数值;
  3. 混合范式性能天花板:结合CoT内部推理与ReAct外部检索的混合方案,在两项任务上超越所有单一范式,HotpotQA最高35.1、FEVER最高64.6;
  4. ReAct短板:稠密Thought增加推理约束,推理错误率高于CoT,典型故障为重复循环检索同一关键词。

3.2 交互式具身决策:ALFWorld文本家居游戏

任务目标:文本指令操控虚拟家居,完成拿取、清洗、摆放物品等长流程任务,基线包含强化学习、模仿学习模型BUTLER。

核心结果

  1. 最优ReAct提示集整体成功率71%,大幅超越Act-Only(45%)、BUTLER强化学习(37%),绝对提升34%;
  2. 消融实验对比ReAct-IM(仅简单环境反馈独白):ReAct全局71%,ReAct-IM仅53%,证明灵活高层推理远优于固定环境反馈;
  3. Act-Only致命缺陷:丢失子目标、无物品位置常识推理,反复执行无效动作卡死循环。

3.3 真实网页交互:WebShop电商购物

模拟亚马逊购物场景,根据用户多属性需求筛选商品、选择规格、下单,指标为匹配分数、任务成功率SR:

方法 匹配分数 成功率SR
Act-Only 62.3 30.1
ReAct 66.6 40.0
IL模仿学习 59.9 29.1
IL+RL强化学习 62.4 28.7

结论:仅依靠1-2条少样本示例,ReAct相对传统RL/IL方法提升10%绝对成功率,推理帮助模型筛选符合全部属性的商品,过滤无关商品选项。

3.4 微调实验:ReAct微调增益远超CoT/Act

论文使用3000条ReAct正确轨迹微调PaLM-8B/62B模型,得出颠覆性结论:

  1. 零样本提示场景下,小模型(8B)ReAct效果弱于CoT;
  2. 微调后,ReAct全面碾压所有基线:PaLM-8B微调ReAct超过PaLM-62B全部提示方案,PaLM-62B微调ReAct超越PaLM-540B纯提示;
  3. 底层逻辑:CoT微调本质是记忆内部知识,易固化幻觉;ReAct微调学习通用工具交互逻辑,泛化能力更强,适配全新未见过的实体与任务。

四、ReAct四大独特优势:工程落地核心价值

4.1 可解释、可人工干预,解决Agent黑盒难题

全部思考、动作、观测完整留存,人类可逐条校验推理逻辑与事实来源,区分模型内部记忆与外部检索信息,满足金融、医疗、政务等合规可审计需求。
论文附录提供人工编辑案例:ALFWorld任务中,人类仅修改两处错误Thought,即可修正Agent全部后续行为,无需重新训练模型,实现运行时动态校正,这是纯Act、RL模型无法实现的能力。

4.2 少样本泛化能力极强,标注成本极低

仅需1-6条人工编写的Thought-Action-Observation轨迹作为提示示例,无需海量标注数据、无需强化学习训练,即可超越上千条数据训练的模仿/强化学习Agent,大幅降低Agent开发成本。

4.3 内外知识融合,兼顾实时性与推理深度

CoT仅依赖过时预训练知识,纯Act仅能检索无逻辑整合;ReAct打通两者边界:

  1. 外部Action获取最新、客观事实,消除幻觉;
  2. 内部Thought完成多跳逻辑拆解、数值对比、常识推理;
    混合范式(CoT+ReAct)进一步实现“内部知识优先,信息不足再检索”的智能切换,平衡效率与准确率。

4.4 通用灵活,一套范式适配全品类任务

ReAct无任务专属定制逻辑,仅需调整Action空间即可适配:多跳问答、事实核验、文本游戏、网页导航、机器人规划、智能客服、数据分析等场景,是当前工业界LangChain、AutoGPT等Agent框架的底层核心骨架。

五、ReAct现存局限与优化方向

论文完整梳理范式短板,同时给出初步优化思路,也是当前Agent领域主流改进方向:

5.1 核心缺陷

  1. 循环推理死锁:模型重复生成相同Thought与Action,陷入无效检索循环,占ReAct错误案例47%;根源为贪心解码缺少全局记忆约束;
  2. 检索效率低下:23%错误源于无价值搜索,模型推理不足,检索关键词偏差,返回无效观测;
  3. 上下文窗口限制:长时序任务(上百步交互)的Thought-Action序列极易超出LLM上下文长度;
  4. 推理灵活性弱于纯CoT:稠密Thought的固定循环结构约束自由推理,复杂逻辑推导能力略低于CoT;
  5. 依赖高质量提示示例:少样本效果高度依赖人工编写的轨迹,示例质量差会大幅衰减性能。

5.2 论文提出的优化方案

  1. 微调自举:用模型生成的正确ReAct轨迹微调小模型,降低提示词依赖,提升稳定性;
  2. 混合CoT-SC策略:内部推理与外部检索双向兜底,互补短板;
  3. 稀疏Thought调度:长交互任务仅在关键节点插入推理,压缩上下文长度;
  4. 改进解码策略:替换贪心解码为束搜索、采样,减少循环死锁。

5.3 后续学界延伸方向(补充)

  1. Reflexion:在ReAct基础上增加事后反思环节,对完整轨迹纠错复盘;
  2. Plan-and-ReAct:前置全局规划,再用ReAct分步执行,兼顾长期目标与动态调整;
  3. Multi-ReAct:多分支并行推理,对比多条检索路径择优输出;
  4. 检索增强ReAct:接入向量数据库、搜索引擎优化检索召回质量,减少无效Action。

六、ReAct工程落地场景与实践思路

基于论文实验,梳理四类可直接落地的业务场景,附工程实现要点:

6.1 实时知识库问答、企业智能检索助手

场景:企业文档问答、金融资讯查询、百科类实时问答;
实现:Action空间封装向量库检索、网页搜索,稠密Thought模式,混合CoT-SC兜底;
收益:解决传统问答幻觉、无法读取最新文档的痛点,推理过程可追溯,满足合规要求。

6.2 自动化网页操作、电商/数据采集Agent

场景:商品比价、批量数据爬取、表单自动填写;
实现:稀疏Thought,仅在筛选条件变更、商品不匹配时生成推理,限制最大交互轮数避免循环;
参考WebShop实验,仅需2条示例即可完成复杂多属性筛选。

6.3 文本具身机器人、数字孪生家居/工业仿真

场景:家庭服务机器人文本指令、工业设备操控仿真;
实现:参考ALFWorld提示格式,利用LLM常识推理物品摆放位置,Thought负责拆解子目标、记录物品状态;
对比传统RL方案,无需上万条轨迹训练,少量提示即可部署。

6.4 智能客服、多轮业务办理Agent

场景:银行理财咨询、售后工单处理、政务自助办理;
实现:增加用户交互Action(询问补充信息),Thought负责梳理用户需求、检索业务规则,动态调整对话流程;
优势:每一步推理可留存,便于人工复核客服应答逻辑。

七、相关工作对比:厘清ReAct与主流推理范式边界

7.1 ReAct vs CoT

CoT:仅内部推理,无外部交互,推理灵活但幻觉严重;适合简单静态数学、常识题;
ReAct:推理+工具交互闭环,事实准确性高,可处理动态信息;适合需要外部资料的复杂任务。

7.2 ReAct vs WebGPT / Act-Only

Act-Only:仅动作无显式推理,缺少规划,长流程易崩溃;
ReAct:显式Thought提供高层规划、状态记忆,纠错能力更强,无需大量RL训练数据。

7.3 ReAct vs Inner Monologue(IM)

IM独白仅能复述当前环境状态,无目标拆解、常识推理;
ReAct Thought覆盖规划、信息解析、异常调整、常识判断,推理维度更丰富,任务成功率提升近20个百分点。

7.4 ReAct vs Plan-and-Execute

Plan-and-Execute:先全局完整规划,再分步执行,适合固定长流程;
ReAct:边执行边推理,实时根据环境反馈修改步骤,适合环境不确定、需求动态变化的任务;工程中常组合使用:全局Plan+局部ReAct执行。

八、总结

ReAct作为ICLR 2023里程碑式范式,首次打通大模型内部推理外部工具交互的壁垒,通过Thought-Action-Observation循环解决了CoT幻觉、纯Act无规划两大核心痛点。在多跳问答、事实核验、文本具身游戏、真实网页购物四大基准上,ReAct仅依靠少量少样本示例,大幅超越传统纯推理、纯行动、强化学习基线,同时具备可解释、低成本、通用适配、人工可干预四大工程优势,成为当下AI Agent开发的底层标准框架。

同时论文客观指出ReAct存在循环死锁、检索低效、上下文受限等短板,给出微调、混合CoT、稀疏推理等优化方案,也为后续Reflexion、Plan+ReAct等进阶范式奠定基础。对于开发者而言,ReAct提供了一套低成本、易落地的Agent构建思路:无需复杂训练,仅通过设计Thought+Action提示轨迹,即可快速搭建具备自主检索、规划、纠错能力的智能代理,广泛应用于知识库问答、自动化网页操作、数字机器人、智能客服等业务场景。未来结合检索增强、反思机制、全局规划的复合ReAct架构,将进一步释放大模型自主解决复杂现实任务的能力。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐