视频分享

一起读《大模型驱动的具身智能:架构、设计与实现》- 混合控制架构 「链接」

动作级规划

  1. 直接动作规划不仅要确定执行的动作类型,还要规划时机、持续时间和顺序(时空action),对于复杂变化的环境,也需要以来感知输入,最终输出连续运动轨迹(包含每个时刻的位置、速度、加速度信息),但如何将连续关节参数离散化,转换成大模型能够处理的离散token(例如关节角0-180°分成18个离散区间),而离散化可能会导致控制精度下降,面对不同执行机构(运动关系不同),又需要进行调整和优化来满足不同的硬件和控制约束。
  2. 间接动作规划生成辅助信息,例如可以是抓取对象的最佳抓取位置(GraspNet 等位姿估计网络)或者考虑碰撞,路径长度的路径规划(替代像RRT、MPC这种规控算法)。下图为GraspNet

  1. 采用基础模型实现端到端的动作级规划,采用分层架构,使用感知模型加上基础模型的推理生成辅助信息,相对重新训练更具性价比,但分层架构的信息传递又会出现数据丢失和错误累计,所以通过收集特定的动作数据,采用预训练的方式开发端到端的具身大模型(针对具身动作级规划进行微调或训练的模型),但数据溃泛影响模型性能(很一般通过模仿学习或仿真生成高质量数据)。下图为GROOT N1

基元级与伺服级

传统的基元级或伺服级的动作规划并不依赖大模型技术。基元级通过正逆运动学的计算进行分解计算成关节的运动,伺服级则转换成更底层、硬件级的控制指令(PD控制器、三环控制、MIT控制器等)。前面分享过 mujoco 中进行机械臂的IK/FK实验。

数值方法

例如 KDL 中提供了很多数值方法,如牛顿‑拉夫逊迭代法(ChainIkSolverPos_NR)

【Mujoco 使用 KDL 对机械臂进行 IK 和 FK 运动学控制末端移动】「链接」

优化方法

通过建立QP问题,进行求解,在一定程度上简化或提高了求解成功的概率,但对于约束需要考虑方方面面

【Pinocchio 结合 CasADi 进行 IK 逆运动学及 Mujoco 仿真】「链接」

强化学习

在具身智能的控制系统中,使用深度学习网络实现基元级和伺服级的控制已经成为一种主要趋势,像目前常见的大部分机器狗的locomotion基本已经是强化学习等方式。之前也分相关使用PPO强化学习 IK,可以感受到另一种形式的控制(但从本质上来说,这些学习的参数最终可能就是在表达运动学的公式,类似雅可比等等),可以参考如下

【MuJoCo 机械臂 PPO 强化学习逆向运动学(IK)】「链接」

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐