|
引用本文
牛鹏军, 程屹涛, 朱彦臣, 厉侃, 刘珂. 冗余人工肌肉驱动的仿生机器人强化学习控制. 自动化学报, 2026, 52(5): 953−965 doi: 10.16383/j.aas.c250508
Niu Peng-Jun, Cheng Yi-Tao, Zhu Yan-Chen, Li Kan, Liu Ke. Reinforcement learning control for bioinspired robots driven by redundant artificial muscles. Acta Automatica Sinica, 2026, 52(5): 953−965 doi: 10.16383/j.aas.c250508
http://www.aas.net.cn/cn/article/doi/10.16383/j.aas.c250508
关键词
仿生机器人,人工肌肉,强化学习,软体机器人,运动控制
摘要
人工肌肉是仿生机器人的核心驱动部件, 然而当前人工肌肉的应用与真实生物相差甚远, 缺乏像生物一样的冗余多肌肉协同. 针对上述问题, 围绕仿生机器人的复杂人工肌肉驱动与协同, 本文提出一种由多股人工肌肉并联驱动的软体机器人设计, 并围绕这种设计建立基于强化学习的运动控制策略. 研制了以柔性十字形电路板为主体, 集成六路液晶弹性体人工肌肉与驱动电路的原型样机, 并测试获得其应变特性与响应性能; 针对原型样机形变−运动特点, 在仿真环境中构建基于绳腱驱动的简化模型. 通过合理设计状态空间、动作空间及奖励函数等, 以 soft Actor-Critic算法进行强化学习并行训练, 得到平移与旋转运动肌肉协同策略. 将运动策略中稳定周期段以离线方式驱动实物样机, 实现有效的多向平移与旋转运动, 验证了采用强化学习控制复杂人工肌肉系统的可行性.
文章导读
自然界的运动体系, 是“形态−行为−智能”三位一体的优化成果[1−5]: 从尺蠖的波形蠕动[6], 到猛禽的扑翼−滑翔切换[7−8], 再到鱼类依靠鳍条与尾柄协同交替产生推力[9−10], 不同环境中的生物体, 往往能够在能耗、噪声与鲁棒性之间达成近乎最优的平衡. 受此启发, 研究者针对仿生机器人运动控制首先需要解决“如何驱动”这一底层核心问题. 目前, 工程领域已形成几条主流技术路线:
1)流体驱动. 这种方式依托气动或液压腔体通过泵−阀网络构建压差, 在单位质量下可输出较大的力/位移, 性能比肩部分节肢动物的爆发式弹跳[11−12].
2)磁场驱动. 在结构内部预埋硬磁或软磁颗粒, 借助亥姆霍兹线圈或稀土磁体即可实现远程致动, 能够完成旋转、翻滚乃至多达十二种运动模态的多场景运动切换[13−17].
3)智能材料驱动. 直接利用材料内部的能量转换实现驱动, 例如形状记忆合金(热−相变转换)[18−21]、介电弹性体(电−静电转换)[22−24]或离子聚合物(化−电转换)[25]等, 其结构可与仿生形态实现高度耦合.
若要构造一台能够自主运动并长期在非结构化环境中执行任务的仿生机器人, 驱动系统除高功率密度外, 更须满足轻量化、外场独立与可编程形变等综合指标[26−28]. 与依赖外部泵阀(气动/液压)或场源(磁、光、电)的方案相比, 智能材料驱动将能量转换单元嵌入结构内部, 可在无附属设备的情况下输出可控形变, 因此通常认为是实现仿生机器人自主运动控制的最具潜力驱动路径.
进一步聚焦到能够直接模拟生物体肌肉收缩−舒张机理的“人工肌肉”, 液晶弹性体(liquid crystal elastomer, LCE)凭借可编程取向、高比功率和大可逆应变等优势, 可在无泵、无阀、无线圈的极简架构下, 复现生物肌肉“静默输出、高功率密度”的核心特性, 成为当前人工肌肉候选材料中的优先选择[29−31].
然而, LCE致动过程伴随显著的热−力耦合、迟滞与速率依赖; 多束人工肌肉的串并联进一步产生高维耦合与参数漂移, 使传统PID、增益调度或模型预测控制难以在安全边界内保持精确、快速响应. 深度强化学习(deep reinforcement learning, DRL)近年来已在刚体臂[32−34]、腿式机器人[35−38]上展示了对复杂动力学的自适应优势[39−41], 但在复杂人工肌肉系统中仍面临样本效率低和仿真−现实落差两大瓶颈: 1)在线试错易导致过流或过温烧毁; 2)材料本构与迟滞模型的不确定性削弱了策略迁移性能.
针对上述人工肌肉驱动系统控制难题, 本文以自研的复杂人工肌肉驱动软体机器人为研究载体, 提出一种基于软演员−评论家(soft Actor-Critic, SAC)的强化学习控制框架, 并通过“仿真−实物”离线策略执行实验验证其有效性, 具体研究工作与成果如下:
1)提出并完成一种采用LCE人工肌肉驱动的仿生软体机器人的研发, 同步设计配套柔性驱动电路, 完成对该机器人控制性能与驱动性能的系统性测试;
2)针对该系统的高度非线性特性, 在MuJoCo环境中建立简化桁架模型, 明确机器人的状态空间与动作空间, 结合软体驱动特性设计Episode流程, 构建与空间自由度相匹配的奖励函数, 基于SAC算法训练得到x、y、yaw运动模式;
3)通过实物驱动实验, 验证了深度强化学习方法在复杂人工肌肉软体机器人运动控制中的可行性, 为该类仿生机器人的技术落地与实用化推进提供支撑.
图1 原型样机
图2 人工肌肉制备与封装
图3 形变特征
本文根据自然界生物体运动中“形态−行为−智能”思想, 聚焦于冗余人工肌肉驱动的仿生机器人, 提出并制作一款由基于LCE的人工肌肉驱动的仿生软体机器人及其配置电路. 针对该机器人运动控制这一难点, 本文选用MuJoCo仿真环境, 建立简化模型, 并采用SAC算法进行强化学习, 获得了x、y、yaw三个方向的可控运动策略. 结合上述两个部分, 本文将运动策略中的周期部分作为离线策略部署于机器人实物样机, 驱动中实现了1.5 mm/周期的平移与1.2 (°)/周期的旋转. 在未来研究中, 我们将进行在线策略部署工作, 形成更加智能的仿生运动方案.
作者简介
牛鹏军
北京大学先进制造与机器人学院博士研究生. 2025年获得北京航空航天大学机械工程及自动化学院学士学位. 主要研究方向为机器人仿真与控制. E-mail: pjniu25@stu.pku.edu.cn
程屹涛
北京大学先进制造与机器人学院博士研究生. 2023年获得北京大学工学院学士学位. 主要研究方向为软体机器人, 机器人感知与控制, 人机交互. E-mail: chengyitao@pku.edu.cn
朱彦臣
华中科技大学智能制造装备与技术全国重点实验室博士研究生. 2023年获得四川大学机械工程学院学士学位. 主要研究方向为柔性电子, 软体机器人. E-mail: yanchenshizhu@hust.edu.cn
厉侃
华中科技大学智能制造装备与技术全国重点实验室研究员. 2019年获得美国西北大学理论与应用力学专业博士学位. 主要研究方向为三维柔性微飞行器, 三维柔性可拉伸电子器件. E-mail: kanli@hust.edu.cn
刘珂
北京大学先进制造与机器人学院研究员. 2019年获得美国佐治亚理工学院博士学位. 主要研究方向为柔性结构与软体机器的设计、分析与应用. 本文通信作者. E-mail: liuke@pku.edu.cn
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-25 06:44
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社