|
引用本文
李连鹏, 郭航, 李明洋, 张海博, 徐拴锋, 张冬浩. 基于PIRL的空间机械臂仿生智能抓取方法. 自动化学报, 2026, 52(5): 1101−1115 doi: 10.16383/j.aas.c250686
Li Lian-Peng, Guo Hang, Li Ming-Yang, Zhang Hai-Bo, Xu Shuan-Feng, Zhang Dong-Hao. Bionic intelligent grasping method of space manipulators based on progressive imitation-reinforcement learning. Acta Automatica Sinica, 2026, 52(5): 1101−1115 doi: 10.16383/j.aas.c250686
http://www.aas.net.cn/cn/article/doi/10.16383/j.aas.c250686
关键词
空间机械臂,漂浮目标自主抓取,仿生智能,强化学习
摘要
针对空间机械臂在微重力环境下执行漂浮目标自主抓取任务时存在的样本获取难、泛化能力弱、动态扰动适应差的问题, 提出一种融合仿生智能的渐进式模仿强化学习方法. 首先, 基于遥操作采集的人类臂手协同操作专家示范数据, 构建多层感知机(MLP)初始抓取策略模型, 并通过行为克隆完成仿生抓取训练; 然后, 将该初始模型嵌入Genesis高保真空间操作仿真环境, 采用近端策略优化空间抓取算法开展抓取策略在线微调, 依托叠加式动作空间与分阶段奖励机制实现专家先验知识与环境自主探索的协同优化, 有效解决模仿学习的分布偏移缺陷与强化学习样本效率瓶颈. 实验结果表明, 所提方法在目标随机位姿扰动下抓取成功率达89.5%, 较MLP模仿学习提升14.5%, 显著增强了策略在目标位姿偏差下复杂空间场景中的鲁棒性与环境适应能力, 为微重力环境下空间机械臂漂浮目标自主抓取提供新的技术方案.
文章导读
随着民用航天、深空探测和空间作业等领域的快速发展, 对在轨服务中空间目标进行高效、精确的自主操作需求日益迫切[1]. 空间环境具有微重力、强扰动等特性, 使得目标动力学行为与地面环境差异显著, 为空间机械臂自主抓取带来巨大挑战[2]. 特别是在卫星修复、轨道垃圾清理等典型任务场景中, 需要对漂浮或缓慢旋转的目标进行动态抓取, 这对空间机械臂系统的定位精度、关节灵活性与环境适应性提出极高要求[3].
当前, 目标自主抓取作为空间操作任务的核心基础, 已成为航空领域的重要研究方向. 受生物感知与运动协调机制启发, 空间仿生智能方法[4]试图从人类或其他生物的高效操作行为中提取鲁棒的策略先验, 以应对非结构化太空环境中的动态不确定性. 经典主流方法通常基于物体几何或动力学模型[5], 对抓取位姿进行显式建模与优化, 部分研究也开始尝试融入仿生智能的核心思想, 以提升控制策略的适配性. 例如, 原劲鹏等[6]围绕双臂六自由度空间机器人目标协同搬运任务, 借鉴生物协同运动的协调机制, 采用机器人与目标间的虚切断铰接结构及主臂刚性运动、从臂柔性运动的作业模式, 建立闭链系统动力学模型并设计关节跟踪控制律与柔顺阻尼控制律. Jiang等[7]针对存在建模不确定性的双臂机器人双边作业任务, 借鉴仿生智能动态适配复杂环境的核心思想, 提出基于显式动力学模型的自适应控制方法, 通过系统分解与命令滤波实现轨迹跟踪与接触力协同控制, 并采用径向基函数(radial basis function, RBF)神经网络结合复合学习律补偿系统动态不确定性, 构建适配复杂场景的自适应补偿机制. 张孟旭等[8]设计机器视觉的机械臂抓取系统, 结合颜色识别与逆运动学(inverse kinematics, IK), 构建具有旋转不变性的视觉抓取系统, 模拟生物视觉感知与动作联动的特性, 提升了抓取系统的环境适配能力. 然而, 现有研究多集中于静态目标或地面模拟环境, 针对空间微重力条件下漂浮目标的动态抓取方法仍不成熟. 传统基于模型的控制策略高度依赖精确的动力学参数, 在面对未知质量分布、姿态不确定或接触力学复杂的非合作目标时, 存在适应性差、鲁棒性弱等问题, 难以满足空间目标抓取任务需求.
人类在执行抓取任务时, 可自然融合视觉引导、多阶段轨迹规划与接触柔顺性, 展现出对位姿偏差和动力学扰动的高度适应能力. 该能力源于长期演化的感知、动作耦合机制, 可为空间机械臂系统提供高质量的行为原型[17]. 为此, 本文采用人类遥操作获取专家示范数据, 将生物启发式操作特性融入策略学习过程, 并结合模仿学习的高样本效率与强化学习的环境探索优化能力, 成为提升空间机械臂抓取鲁棒性与环境适应能力的有效途径.
为兼顾样本效率与策略鲁棒性, 近年来, 结合IL与RL优势的混合学习框架成为研究热点. 通过模仿学习提供策略初值, 再以强化学习进行环境驱动优化. 例如, Li等[18]提出仅需单次示范的多指抓取学习方法, 结合模仿学习与强化学习并引入课程学习, 提升了模型泛化能力; 申珅[19]构建一种融合编程示教、模仿学习与强化学习的机械臂抓取控制方法, 通过构建基于概率模型的算法优化示教数据, 并设计奖励与策略双优化的算法提升训练效率; Pereira等[20]提出融合强化学习与模仿学习的残差手势校正模型, 将含噪声三维手势估计映射为合理的虚拟手姿态, 在无真实交互数据条件下生成高质量手−物交互样本. 然而, 上述研究主要面向地面静态或低动态目标, 未充分考虑空间微重力环境下漂浮目标的独特挑战, 如无重力约束下的自由运动、接触力难以建模以及任务对姿态−位置协同控制要求高等难题.
因此, 本文提出一种面向空间漂浮目标的智能抓取方法, 构建渐进式模仿强化学习(progressive imitation-reinforcement learning, PIRL)智能抓取策略. 利用模仿学习初始化的样本高效性优势搭建优质策略初值, 结合强化学习微调的环境探索能力实现策略动态优化, 二者协同融合提升从接近到稳定抓握全过程的仿生智能抓取能力. 本文主要贡献如下:
1)搭建面向空间机械臂的real-to-sim遥操作系统, 实现人手姿态到灵巧手动作的实时映射, 高效构建高质量专家示范数据集;
2)提出基于相对位姿建模与移动−抓取−后抓取移动的仿生序贯轨迹解耦的样本生成方法, 通过单次演示生成多样化训练序列, 显著提升小样本下的泛化能力;
3)构建融合模仿学习与强化学习的渐进式智能抓取策略, 针对Genesis仿真平台中漂浮目标的自主抓取任务, 验证了所提方法在微重力动态场景下的有效性.
图1 PIRL方法框架图
图2 机械臂映射器
图3 手部关键点定义
本文针对空间微重力环境下漂浮目标自主抓取任务中样本获取难、泛化能力弱、动态适应差的核心问题, 提出PIRL方法, 通过理论构建、系统设计与仿真验证, 形成一套完整的空间机械臂仿生智能抓取方法, 实现了微重力环境下工具抓取任务的鲁棒执行. 具体工作包括: 1)设计了融合键盘控制与单目视觉的遥操作系统, 实现真实人手姿态到仿真灵巧手动作的实时映射; 2)基于相对位姿建模与三阶段轨迹解耦方法, 从单次遥操作演示生成80组多样化专家数据集, 构建含560个有效状态−动作对的训练样本库; 3)构建了基于3层MLP网络的仿生模仿网络, 得到抓取成功率75.0% 的基础策略; 4)在Genesis高保真仿真环境中, 通过PPO-GS算法对策略进行强化学习微调, 在随机扰动下, 优化成功率提升至89.5%. 最终实现了任务成功率的有效提升, 验证了方法在动态微重力场景下的有效性.
未来工作将聚焦以下三个方面: 一是拓展多结构、多约束、多目标的通用抓取策略, 结合空间非合作目标的几何与动力学特性构建工具特征库, 搭建统一的抓取决策理论框架, 从策略泛化的理论机制层面提升方法对不同类型空间目标的适配能力. 通过构建工具特征库与统一抓取框架, 提升方法的任务泛化能力. 二是融合计算机视觉与机器人感知理论, 采用基于深度学习的视觉位姿估计算法实现目标位姿的端到端感知与求解, 替代本文采用的真值获取方法. 三是结合实际灵巧手的机械驱动特性与运动学约束, 开展关节自由度的理论建模与优化分析, 建立适配实际机构的动作空间约束模型, 同时搭建地面微重力模拟实验平台, 开展物理实验验证与算法迭代, 实现从仿真理论验证到物理实验落地的方法迁移.
作者简介
李连鹏
北京信息科技大学自动化学院副教授. 主要研究方向为多智能体协同控制, 机器人智能控制. E-mail: llp@bistu.edu.cn
郭航
北京信息科技大学自动化学院硕士研究生. 主要研究方向为机器人安全控制. E-mail: 2024020508@bistu.edu.cn
李明洋
北京控制工程研究所高级工程师. 主要研究方向为机器人智能操作控制. 本文通信作者. E-mail: lmy_hit@163.com
张海博
北京控制工程研究所研究员. 主要研究方向为空间智能操作控制. E-mail: zhanghb502@163.com
徐拴锋
北京控制工程研究所高级工程师. 主要研究方向为空间机器人智能控制. E-mail: xushuanfeng2003@163.com
张冬浩
北京信息科技大学自动化学院副教授. 主要研究方向为机器人智能控制, 具身智能. E-mail: Donghaozhang@bistu.edu.cn
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-24 16:47
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社