|
引用本文
张承玺, 卢瑞秋, 李权, 吴荩, 许德智. 变学习强度扑翼飞行器自学习控制. 自动化学报, 2026, 52(5): 1092−1100 doi: 10.16383/j.aas.c250664
Zhang Cheng-Xi, Lu Rui-Qiu, Li Quan, Wu Jin, Xu De-Zhi. Self-learning control for flapping-wing air vehicles with variable learning intensity. Acta Automatica Sinica, 2026, 52(5): 1092−1100 doi: 10.16383/j.aas.c250664
http://www.aas.net.cn/cn/article/doi/10.16383/j.aas.c250664
关键词
扑翼飞行器,自学习控制,变学习强度,一致最终有界
摘要
针对扑翼飞行器存在非线性动态、模型不确定性及嵌入式平台算力受限等问题, 提出一种可自定义变学习强度自学习控制方法. 该方法通过学习历史控制信息, 仅基于一个代数方程, 避免复杂控制器设计并有效提升轨迹跟踪精度与系统鲁棒性. 针对扑翼系统, 使用自定义函数对学习强度进行调节, 提高系统动态响应速度与稳态性能. 仿真结果表明, 所提方法在保持低计算复杂度同时, 具有优越控制性能.
文章导读
近年来, 扑翼飞行器(flapping-wing air vehicle, FWAV)因其仿生翼振动机制, 在轻量化、能效、机动性与隐蔽性等方面比传统固定翼与旋翼平台更具优势[1−2]. 随着微型驱动器、轻质材料和嵌入式飞控平台的发展, FWAV在低空侦察、环境监测及室内任务等领域的应用潜力不断提升[3−4]. 因此, 开发一种高效、稳定、结构简洁且适用于嵌入式平台的控制方法成为推动其工程化落地的关键.
然而, 由于FWAV依赖非定常气动力获得升力, 其动力学表现出显著的非线性、强耦合与周期性扰动特性[5]. 因此, 准确的气动力模型难以建立, 传统依赖模型结构的控制器无法准确补偿系统动态. 模型不确定性转化为控制系统的外部扰动, 使控制设计更加困难[6−7]. 在扑翼运动过程中, 翼面柔性形变、涡结构演化与气流分离等复杂现象均会导致受力不确定性增大[8−9]. 同时, 扑翼频率通常处于5 ~ 15 Hz, 使系统状态呈周期性快速振荡, 显著增加姿态与位置控制难度[10]. 已有研究表明, 许多针对固定翼或旋翼无人机设计的控制方法难以直接应用于FWAV[11].
针对扑翼飞行的复杂动力学特性, 国内外学者提出多种控制策略, 包括增广状态观测器[12]、自适应控制[13]、自抗扰控制[14]、模糊控制[15]、神经网络补偿控制[16]等. 此外, 有研究尝试结合动力学线性化与分层控制结构以提升跟踪性能[17]. 尽管这些方法在理论上增强了系统鲁棒性, 但仍存在难以忽视的不足: 1)控制结构复杂、参数众多, 难以在微型嵌入式平台上实现[18]; 2)计算需求高, 对实时性要求严格[19]; 3)普遍依赖相对准确的动力学模型, 而FWAV的非定常气动特性使模型偏差难以避免[20]. 因此, 研究者也开始尝试引入学习型方法以增强系统适应性.
在学习型方法中, 强化学习作为典型的数据驱动策略, 也得以用于提升FWAV的自主控制能力. 胡海天[21]基于强化学习构建微型扑翼飞行器的机动控制框架, 通过策略网络实现急转弯、快速上升与快速稳定等高机动动作的学习与执行. 文献[22]进一步利用深度强化学习训练仿蜂鸟扑翼平台完成360° 翻滚、俯仰翻转和高速逃逸等高动态特技动作, 并通过神经网络策略直接输出翼运动控制量. 然而, 此类框架通常需要大量训练数据、长时间仿真交互和较多计算资源, 且训练得到的策略网络规模较大, 使其难以直接部署到计算能力受限的微型FWAV嵌入式飞控系统上.
在确保控制性能与鲁棒性前提下, 算法结构应兼顾工程实现的简易性与系统资源的经济性. 为降低对精确模型与高算力的依赖, 自学习控制(self-learning control, SLC)应运而生[20, 23−24]. Zhang等[24]提出一种低计算复杂度的在线学习控制, 其核心控制律仅依赖于一个代数方程: u(t)=k1u(t−τ)+k2e(t). 该结构充分利用历史控制信息作为系统记忆, 在保持低复杂度同时, 有效提升系统动态性能与适应能力. 可类比于鸟类在飞行中调节翼面姿态的方式: 鸟类并不会在每一瞬间完全重新规划动作, 而是基于上一拍的翼运动继续维持当前姿态, 仅当偏离目标轨迹时, 才对下一个拍打周期的振幅、频率或攻角进行微调, 以逐步逼近目标状态. 同样, SLC将上一时刻的控制输入作为经验信息延续使用, 仅在误差信号表明需要修正时进行补偿, 从而将历史控制量转化为先验知识, 在保持低复杂度的同时加快收敛速度.
然而, 传统SLC采用固定学习强度k1, 在面对大误差或剧烈扰动时, 过强的历史记忆往往导致控制量饱和, 而过弱的学习强度则会降低稳态精度. 针对这一矛盾, Zhang等[23]引入指数型衰减函数, 根据实时误差动态调节学习权重, 在误差较大时主动削弱历史记忆以抑制饱和. 在此基础上, Zhang等[20]进一步提出Tanh型函数, 利用其更陡峭的非线性特性, 在保证收敛速度的同时更有效地避免执行器饱和. 本文采用曲线拟合方法设计变学习强度(variable learning intensity, VLI), 通过选取动态响应过程关键控制点构建连续平滑学习强度曲线, 使学习行为能够随系统状态自适应变化. 该方法能够抑制扑翼飞行器在大扰动阶段姿态偏移和高频振荡, 并在稳态阶段提供更高精度, 使整体飞行状态更加平稳可靠. 本文的主要贡献如下:
1)提出适用于FWAV的SLC方法, 该方法仅基于一个代数方程, 充分学习历史控制信息提升系统性能. 该控制律不依赖于复杂观测器或精确系统模型, 显著降低计算复杂度, 适用于嵌入式平台部署, 为资源受限环境下FWAV智能控制提供一个新方法.
2)提出可自定义VLI策略, 相比文献[20, 23], 能灵活构造学习强度变化曲线, 实现学习强度可定制化设计. 该方法在系统误差较大时, 能够有效抑制饱和响应, 且未采用复杂算法或引入过多参数, 在提升控制性能的同时维持系统简洁性与工程实用性.
3)在FWAV盘旋场景中进行对比实验. 仿真结果表明, 引入VLI-SLC后系统在保持控制器简洁性的同时, 系统跟踪精度显著提升, 控制输入更平滑, 有效提升FWAV在复杂环境中的性能.
图1 扑翼飞行器在三维空间中飞行轨迹对比
图2 扑翼飞行器水平控制力
图3 扑翼飞行器飞行轨迹跟踪误差
本文提出一种用于扑翼飞行器跟踪控制的可定制变学习强度自学习控制算法. 该方法继承自学习控制优异的控制性能, 具有高控制精度和低复杂度结构的特点. 与固定形式变学习强度不同, 本文设计一种可定制变学习强度方法, 使学习权重调整具有更大灵活性, 从而为扑翼飞行器控制性能调节提供更大自由度. 仿真结果表明了本文所提方法在扑翼飞行器实时控制中的有效性.
作者简介
张承玺
江南大学自动化与智能科学学院(物联网学院)副教授. 2019年获得上海交通大学博士学位. 主要研究方向为航天器集群协同控制与管理, 机器人智能感知与自主决策. E-mail: cxzhang@jiangnan.edu.cn
卢瑞秋
江南大学自动化与智能科学学院(物联网学院)硕士研究生. 主要研究方向为航天器姿态控制系统故障诊断与容错控制. E-mail: 6231905043@stu.jiangnan.edu.cn
李权
江苏第二师范学院人工智能研究中心讲师. 2025年获得江南大学博士学位. 主要研究方向为工业过程建模, 智能优化控制及机器人感知与控制. 本文通信作者. E-mail: liquan95@jssnu.edu.cn
吴荩
北京科技大学智能科学与技术学院教授. 2024年获得香港科技大学博士学位. 主要研究方向为机器人学, 位姿估计及组合导航系统. E-mail: wujin@ustb.edu.cn
许德智
东南大学电气工程学院教授. 2013年获得南京航空航天大学博士学位. 主要研究方向为数据驱动控制, 故障诊断与容错控制, 多智能体系统, 信息物理系统, 可再生能源技术, 电机控制以及智能电网. E-mail: xudezhi@seu.edu.cn
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-24 16:47
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社