零样本抓取成功率 88%!ORACLE-Grasp 凭 LMM 语义赋能机器人智能抓取!
点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
「3D视觉从入门到精通」知识星球(点开有惊喜) !星球内有20多门3D视觉系统课程、3DGS独家系列视频教程、顶会论文最新解读、海量3D视觉行业源码、项目承接、求职招聘等。想要入门3D视觉、做项目、搞科研,欢迎加入!
0.这篇文章干了啥?
这篇文章提出了ORACLE-Grasp,一种全新的零样本可供性对齐机器人抓取框架,旨在解决非结构化环境中未知物体抓取的难题。传统方法要么依赖大规模标注数据集进行训练,要么需要精细的几何建模,难以泛化到从未见过的新物体。
ORACLE-Grasp的核心创新在于将大型多模态模型(LMMs)作为语义Oracle来引导抓取选择,完全无需任务特定训练、抓取标签或自定义编码器。框架提出了突破性的dual-prompt tool-calling strategy:第一个prompt(Scene Context Prompt, SCP)提取物体高层语义信息,第二个prompt(Grasp Region Prompt, GRP)识别与物体功能对齐的可抓取区域。通过将图像离散化为网格候选区域,巧妙解决了LMM在空间定位上的固有缺陷。
此外,框架还集成了depth-based refinement(基于深度的抓取精修)和early stopping mechanism(提前停止机制),分别提升抓取可靠性和计算效率。
实验在包含日常物体和AI生成物体的RGB及RGB-D图像上进行了全面评估。结果表明,ORACLE-Grasp生成的抓取姿态与人类标注高度一致,在真实世界的机器人抓取任务中达到了88%的整体成功率,20个物体中有10个实现了100%成功抓取!
下面一起来阅读一下这项工作~
1. 论文信息
-
论文题目:ORACLE-Grasp: Zero-Shot Affordance-Aligned Robotic Grasping using Large Multimodal Models
-
作者:Avihai Giuili, Rotem Atari, Avishai Sintov
-
作者机构:Tel-Aviv University, School of Mechanical Engineering
-
论文链接:https://arxiv.org/pdf/2505.08417
2. 摘要
在非结构化环境中抓取未知物体是服务机器人的核心挑战,这些机器人需要在家庭、医院和仓库等动态真实场景中运行。成功的关键在于同时具备语义理解和空间推理能力。传统方法通常依赖密集训练数据集或精细几何建模,不仅需要大量数据收集,而且难以泛化到新物体或新可供性。
本文提出了ORACLE-Grasp,一种零样本框架,利用大型多模态模型(LMMs)作为语义Oracle来引导可供性对齐的抓取选择,无需任务特定训练或人工输入。系统将抓取预测重构为结构化的迭代决策过程,采用dual-prompt tool-calling策略:第一个prompt提取高层物体语义,第二个识别与物体功能对齐的可抓取区域。为解决LMM的空间局限性,ORACLE-Grasp将图像离散化为候选区域并进行推理,生成类人且上下文敏感的抓取建议。基于深度的精修步骤在有深度数据时提升抓取可靠性,提前停止机制增强计算效率。在包含日常物体和AI生成物体的多样化RGB和RGB-D图像上的评估结果表明,该方法生成的抓取在物理上可行且语义上恰当,与人类标注高度一致,在真实世界的抓取任务中取得了高成功率。
3. 效果展示
图1 ORACLE-Grasp框架概述。RGB-D相机捕获场景。大语言模型(LMM)通过网格上的双重提示识别可抓取区域,然后利用深度数据对其进行优化以实现精确的抓取预测,并由机器人执行。 @「3D视觉工坊」编译
图7 测试集II中的真实世界物体正由机械臂利用ORACLE-Grasp的预测结果进行抓取。对于每个物体,该图展示了机械臂执行抓取动作的快照以及车载摄像头捕获的相应RGB图像。所展示的物体包括:(a)纸箱、(b)咖啡袋、(c)六臂焊接支架、(d)牙膏管、(e)簸箕和(f)塑料圆柱体。在某些情况下,初始预测抓取(绿色所示)会利用深度数据进行优化(最终抓取以红色显示),如3.3节所述。绿色圆圈标记了半径为r(zp¯)的间隙区域。@「3D视觉工坊」编译
4. 主要贡献
-
提出了ORACLE-Grasp,一种新颖的零样本可供性对齐抓取框架,利用LMM作为语义Oracle推断类人抓取,无需任何训练、抓取标签或自定义编码器。
-
提出了dual-prompting策略,支持从单张RGB图像直接进行关于物体功能和抓取区域适应性的结构化chain-of-thought推理,无需外部任务或物体标注。
-
探索了LMM执行context-free抓取的能力,分离其在无需用户提供任务标注或结构化先验的情况下对不熟悉单物体场景进行推理的能力。
-
展示了ORACLE-Grasp仅使用预训练模型即可支持语义和空间推理,并演示了如何可选地集成深度数据来精修和改善物理抓取执行。
-
在多种新颖的、未经训练的物体上进行了真实机器人实验验证,在完全零样本设置下实现了稳健的任务相关抓取。
5. 基本原理是啥?
问题背景与挑战
现有抓取方法面临的核心挑战:
-
数据依赖性强:传统方法依赖大规模标注数据集或精细几何建模,数据收集成本高昂
-
语义推理缺失:深度学习方法主要关注几何属性,忽略了物体功能和使用场景的语义推理
-
泛化能力弱:在固定物体类别上训练的模型难以适应开放世界的新物体
-
LMM空间定位不足:虽然LMM具备强大的语义理解能力,但在精细部位定位方面存在固有缺陷——生成的bounding box和mask往往缺乏空间精度,无法可靠地隔离特定可抓取部件
ORACLE-Grasp框架概览
ORACLE-Grasp将抓取预测重构为一个结构化的迭代决策过程,而非传统的自由形式生成任务。框架的核心思想是:将LMM视为"语义Oracle",通过精心设计的prompt交互引导其进行抓取推理。
系统输入为RGB图像 和对应的深度图 (可选),输出为一个可供性对齐的抓取姿态 ,其中 为抓取位置, 为夹爪朝向角度。
核心模块一:图像离散化(Image Tiling)
为克服LMM的空间定位缺陷,ORACLE-Grasp提出了一种巧妙的图像网格化策略。定义图像tiling操作 为将图像 离散化为 的等大小网格。这样一来,抓取区域选择从"自由形式生成"转变为"多选题回答",大幅降低了LMM的推理难度。
这一策略对于没有明显把手的物体(如纸板、钱包或鞋子)尤为有效,能够产生更加类人的抓取选择。
核心模块二:Dual-Prompt Tool-Calling Strategy
这是ORACLE-Grasp最核心的创新,包含两个协同工作的prompt:
Scene Context Prompt (SCP)
第一个prompt与原始图像 配对,指示模型生成场景中主要物体的简洁描述,重点关注与抓取相关的特征。SCP作为一个工具调用,提取高层语义上下文,帮助模型更有效地推理抓取位置和方式。
关键设计:SCP鼓励模型进行Chain-of-Thought (CoT)推理,生成语义上下文来引导后续的空间选择。例如,对于一张锤子的图片,SCP可能输出"这是一个锤子,手柄是适合抓取的部分"。
Grasp Region Prompt (GRP)
第二个prompt旨在近似抓取位置。GRP与网格化后的图像 配对,其中 。GRP整合了SCP的上下文输出,指示LMM从离散化图像中选择最优的网格单元。
关键设计:
-
多轮迭代:GRP以不同网格配置推出多轮,从粗网格逐步细化到细网格
-
CoT推理机制:GRP输出包含必需的解释字段,迫使LMM在选择网格单元前阐述其语义和功能推理依据
-
结构化输出:严格限制输出格式为
GRID_CELL: <cell_number>+EXPLANATION: <brief explanation>
核心模块三:抓取位置聚合与方向估计
经过多轮GRP迭代后,框架通过以下步骤确定最终抓取姿态:
-
IoU加权聚合:基于各轮选择的网格单元之间的IoU进行加权,聚合所有候选区域
-
PCA方向估计:使用主成分分析(PCA)在聚合区域上估计抓取方向角
-
图像裁剪细化:当early stopping条件满足后,对裁剪后的图像区域进行额外的 轮迭代以精修位置
核心模块四:Depth-Based Refinement(基于深度的抓取精修)
当深度数据可用时,ORACLE-Grasp执行额外的精修步骤:
-
间隙检查:在预测抓取位置 处,利用深度数据计算半径为 的间隙区域,确保夹爪有足够的操作空间
-
位置调整:根据深度信息对抓取位置进行微调,提升物理可行性
-
朝向精修(Orientation Refinement):利用深度信息进一步优化夹爪朝向
核心模块五:Early Stopping Mechanism(提前停止机制)
为提升计算效率,框架引入了提前停止机制:
-
设定early stopping窗口 和停止因子
-
当连续 轮迭代中选择的网格区域IoU超过阈值 且变化率低于 时,提前终止迭代
-
总迭代次数上限为
完整抓取生成流程
-
视觉输入:获取RGB图像(及可选的深度图)
-
SCP语义推理:通过Scene Context Prompt提取物体高层语义
-
网格化迭代:以不同网格配置多轮执行GRP,逐步细化抓取区域
-
Early Stopping检查:判断是否满足提前停止条件
-
位置聚合:IoU加权聚合候选区域,PCA估计抓取方向
-
裁剪精修:在裁剪区域上进一步细化
-
深度精修(可选):利用深度数据进行间隙检查和位置/朝向调整
-
抓取输出:生成最终的抓取姿态
6. 实验结果
实验设置
LMM选择:采用LLaMa 3.2-Vision(MLLaMA, 11B参数)作为主要LMM,部署在配备NVIDIA H200 SXM GPU的云实例上。选择开源模型确保框架的可访问性和可复现性。
关键超参数:GRP迭代次数 ,IoU阈值 ,early stopping窗口 ,停止因子 。
测试集设计
为评估零样本泛化能力,设计了两个完全由新颖物体组成的测试集:
-
Test-set I:100张RGB图像,其中90张来自网络(涵盖多样化物体类型和环境),10张由DALL-E生成的AI图像(刻意包含陌生和抽象物体形式以挑战泛化能力)
-
Test-set II:20张RGB-D图像,使用ZED-Mini相机捕获,包含刷子、牙膏管、纸箱等真实世界物体,用于评估深度精修效果
评估指标
-
位置误差:Test-set I使用NRMSE(归一化均方根误差),Test-set II使用RMSE(毫米)
-
朝向误差:使用MAE(平均绝对误差,度)
-
抓取成功率:真实机器人执行的成功率
6.1 主实验结果
Prompt消融对比(Test-set I)
结果表明,完整的dual-prompt策略(SCP + GRP)显著优于baseline和去除SCP的版本,位置NRMSE从61大幅降低至5.1,朝向MAE达到19.0度。
真实机器人抓取实验(Test-set II)
在20个真实物体上的完整消融实验结果如下(关键数据):
完整方法(Full)在20个物体上达到了88%的整体抓取成功率,其中10个物体实现了100%成功率,包括手机充电器、USB线缆、刷子、揉面刀、牙膏、橡胶鸭、订书机和遥控器等。
深度精修(GR)将位置RMSE从20.9mm降低至13.6mm,朝向MAE从13.6度降低至10.3度,显著提升了抓取精度。
定性结果展示
在Test-set I的多样化物体上,ORACLE-Grasp展现了出色的泛化能力:
-
吸尘器、AI生成的电钻、铅笔等物体均获得了合理的抓取预测
-
与人类标注对比,NRMSE在多数物体上保持在0.02-0.05的低水平
-
即使面对AI生成的陌生物体,框架仍能推理出合理的抓取位置
6.2 消融实验
GRP迭代次数分析
实验分析了GRP查询次数 对位置NRMSE和计算运行时间的影响。随着 的增加,位置精度逐步提升,但计算开销也相应增加。early stopping机制在保证精度的同时有效控制了计算成本。
各模块有效性验证(Test-set II消融)
通过逐步去除关键模块验证其贡献:
-
Grasp Refinement (GR) :去除深度精修后,位置RMSE从10.3mm升至20.9mm,验证了深度精修的关键作用
-
Orientation Refinement (OR) :去除朝向精修后,朝向MAE从7.2度升至10.3度
-
Brief Explanation (BE) :去除GRP中的CoT解释字段后,性能有所下降,验证了CoT推理的重要性
7. 总结 & 未来工作
总结
ORACLE-Grasp提出了一种将LMM语义推理与经典计算机视觉技术相结合的混合抓取框架,在未知物体上实现了稳健的、任务相关的抓取预测。通过引入结构化的dual-prompt交互(SCP负责高层推理,GRP负责空间选择),将开放式的抓取任务转化为LMM可以可靠求解的多选题问题。通过图像预切割候选区域、IoU加权聚合与PCA、以及基于深度的间隙检查,ORACLE-Grasp有效克服了LMM典型的空间分辨率限制。orientation refinement和early stopping等额外机制进一步增强了鲁棒性和计算效率,在合成和真实世界抓取实验中均实现了高成功率。
与传统SOTA方法相比,ORACLE-Grasp的核心优势在于:
-
推理泛化 vs 数据专家:有监督模型是特定数据集的"专家学生",而ORACLE-Grasp是无需特定物体类别训练的"推理通才"
-
可供性对齐 vs 几何优先:纯几何方法可能抓住电钻的钻头或螺丝刀的杆身,而ORACLE-Grasp优先选择把手和人体工学接口
-
轻量RGB推理 vs 重度3D建模:核心定位和朝向推理在RGB域完成,深度信息仅用于度量执行和局部间隙检查
局限性与展望
当前方法仍存在以下局限性:
-
推理成本较高:LMM的推理开销仍然较大,对实时高频控制循环构成挑战。未来可通过模型压缩、蒸馏或更高效的架构来改善
-
单视角限制:目前仅从单一相机视角进行推理,当关键特征被遮挡时无法主动寻求替代视角。未来可引入多视角融合或主动探索策略
-
单物体场景:当前验证局限于单物体场景,未来需扩展到多物体和杂乱环境
-
LMM选择:虽然使用了11B参数的开源模型已取得良好效果,但更大的闭源模型(如GPT-4o)可能进一步提升性能
未来研究方向包括:结合触觉反馈提升抓取鲁棒性、探索更复杂的操作任务(如工具使用、装配)、以及研究如何进一步优化推理速度以支持实时应用。
本文仅做学术分享,如有侵权,请联系删文。
3D视觉方向论文辅导来啦!可辅导SCI期刊、CCF会议、本硕博毕设、核心期刊等。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。
更多推荐




所有评论(0)