|
引用本文
王珂, 许振钰, 张俊楠, 穆朝絮. 基于积分强化学习的学习感知型动态事件触发最优控制. 自动化学报, 2026, 52(6): 1221−1233 doi: 10.16383/j.aas.c250620
Wang Ke, Xu Zhen-Yu, Zhang Jun-Nan, Mu Chao-Xu. Scalable dynamic event-triggered optimal control for nonlinear systems via integral reinforcement learning. Acta Automatica Sinica, 2026, 52(6): 1221−1233 doi: 10.16383/j.aas.c250620
http://www.aas.net.cn/cn/article/doi/10.16383/j.aas.c250620
关键词
动态事件触发机制,自适应动态规划,积分强化学习,最优控制,学习感知设计
摘要
事件触发机制, 尤其是动态事件触发机制, 近年来在控制领域引起广泛关注, 其核心挑战在于平衡控制性能与通信资源利用率. 当该机制与学习系统结合时, 这种平衡变得尤为关键, 因为还需兼顾学习效率. 针对具有未知动态的非线性连续时间系统, 提出一种集成积分强化学习、最优控制与学习感知设计的新型动态事件触发最优控制方法, 该方法采用仅含评价网络的自适应结构在线学习最优控制策略, 并通过灵活配置的动态触发规则调控数据传输. 其核心创新在于设计了一种学习感知型动态事件触发机制, 该机制通过分析评价网络权值的历史变化趋势, 构建学习感知参数, 进而自适应地调整事件触发规则中的动态阈值参数. 这使得系统能适宜地在学习关键期采用“繁忙采样”以保障控制与学习精度, 在学习平稳期切换至“空闲采样”以节约通信与计算资源, 从而实现控制性能、学习效率与资源消耗的有效平衡. 理论分析严格证明了闭环系统的渐近稳定性和权值误差的一致最终有界性. 最后, 在一个基准非线性系统和一个单连杆机械臂系统进行了仿真验证与对比实验, 结果表明与传统静态及动态事件触发方法相比, 提出方法能以更少的通信代价获得相当甚至更优的学习与控制效果.
文章导读
非线性系统的最优控制一直是控制领域的核心问题, 其在无人机竞速、机器人行为优化、智能车辆巡航等领域的应用日益广泛[1−3]. 解决此类问题的思路大致可分为两类: 基于模型的最优控制和基于学习的最优控制. 前者虽然在理论上完备, 但对于复杂的非线性系统, 往往因难以获得精确的数学模型而使其在实际应用中受限; 面对这一挑战, 以强化学习为代表的学习控制方法展现出显著优势, 它通过数据驱动的方式逼近最优控制策略, 为复杂系统的最优控制提供新的范式[4].
典型地, 根植于强化学习理念的自适应动态规划(adaptive dynamic programming, ADP)被认为是解决最优控制问题的有效手段[5−7]. 强化学习有助于在奖励/惩罚过程与代价函数之间建立联系, 使得ADP能够逼近与最优控制策略相关的哈密顿–雅可比–贝尔曼(Hamilton-Jacobi-Bellman, HJB)方程. ADP根据其学习迭代算法实现方式可大致分为两类: 适用于连续时间非线性系统的策略迭代, 以及不需要初始稳定控制策略的值迭代[8]. 近年来, 结合行为–评价、辨识–行为–评价、单评价等多种神经网络架构的自适应动态规划算法取得丰硕的研究成果[9−13], 相关综述亦对ADP领域发展进行了系统梳理[14−15]. 研究者们还进一步将关注点扩展到安全性、控制约束与性能保障. 例如, 文献[16]提出分层安全强化学习控制方法并保证预设性能; 文献[17]研究数据驱动非线性最优控制中的非对称状态约束问题. 然而, 非线性系统的最优控制仍面临一些严峻挑战, 例如当系统动力学完全未知或部分未知时, 常用的模型辨识方法依然存在无法消弭辨识误差引起的控制性能退化现象. 为此, 积分强化学习(integral reinforcement learning, IRL)技术被引入自适应动态规划框架, IRL 通过对Bellman方程进行积分运算能够自然规避对系统动力学知识的依赖, 从而有效保证控制性能[15]. 代表性地, 文献[18]利用不同积分区间的采样数据实现不确定非线性系统的同策略IRL最优控制; 文献[19]设计一种基于IRL的反馈再学习方法, 并通过经验回放和异策略迭代提高了数据效率; 文献[20]进一步将IRL扩展至多智能体协同控制领域, 实现多四旋翼系统的自适应鲁棒姿态控制. 这些工作凸显了IRL在解决复杂未知非线性系统最优控制问题方面的潜力.
除了控制性能, 在现代控制系统中, 通信与计算资源的经济性亦是关键考量. 为提高效率, 需要解决“控制系统应该在什么时候作出响应”这一关键问题, 此时事件触发机制(event-triggered mechanism, ETM)应运而生, 其具备非周期采样和间歇控制等特点[21−22]. ETM仅当预先设计的阈值函数被违反时, 才激活系统组件间的信号采样与传输, 阈值函数通常用于描述某一关注变量的变化趋势, 数学逻辑上体现为一个触发条件. 事件触发的一个核心挑战是在不过多牺牲期望性能的前提下最小化触发次数, 这激发了学者们对动态事件触发机制(dynamic event-triggered mechanisms, DETM)的探索[23−24]. 动态触发机制是在静态事件触发机制(static event-triggered mechanisms, SETM)基础之上改进得到的, 大致可分为两类: 基于内部动态变量(internal dynamic variable, IDV)的动态触发和基于动态阈值参数(dynamic threshold parameter, DTP)的动态触发, 前者在阈值函数中引入额外的动态而后者直接调整阈值参数. 文献[25]对这些动态触发方法进行全面回顾, 但未涉及其在学习系统中的应用. 本质上, 基于IDV或DTP的动态触发通过引入额外动态和设计灵活性增强事件触发控制器, 实现更优的性能均衡.
为改善学习回路的通信与计算效率, 近些年ETM也开始应用于学习系统这种特殊的网络系统, 形成事件触发学习方法, 此时事件触发需要实现策略最优性、学习收敛性和通信高效性之间的良好均衡[14]. 例如, 文献[26]提出一种基于事件触发ADP的最优跟踪控制算法, 并成功将其扩展至污水处理问题. 特别地, 诸多学者实现了基于学习的动态事件触发控制[27−30], 通过延长事件触发间隔进一步提升通信效率. 尽管有效降低了资源占用率, 但由于控制器在相同时间内可获得的数据减少, 整体性能下降的情况并不少见, 动态事件触发的这一潜在缺点尚未得到解决. 更为重要的是, 这些现有的事件触发方法的触发决策主要依赖于系统状态轨迹信息(如状态误差). 这种设计可视为“状态感知”的事件触发机制, 但未能充分考虑学习过程本身的状态, 特别是忽略了神经网络权值收敛的动态特性对触发决策的影响. 这也导致一个固有缺陷: 在学习关键阶段(如权值剧烈变化时), 可能因数据采样不足而影响学习收敛速度与控制性能; 反之, 在学习趋于平稳后, 又可能因过度采样而造成资源浪费. 换言之, 现有的事件触发机制普遍缺乏对“学习状态”的感知能力, 限制其在学习与控制之间实现更优协同的能力.
为克服上述局限, 本文针对具有未知动力学的非线性系统提出一种兼具可扩展性与学习感知能力的动态事件触发最优控制方法. 本文的主要创新点包括: 1) 设计学习感知型动态事件触发机制(learning-aware dynamic event-triggered mechanism, LDETM), 该机制通过评估一段窗口期内的神经网络权值变化, 构造一个能够反映学习进程的感知参数; 基于此参数, LDETM能够在两种不同特性的动态阈值参数之间切换, 从而实现触发频率的自适应调节——在学习剧烈时倾向于“繁忙采样”以保证性能, 在学习平稳时转向“空闲采样”以节省资源. 2) LDETM方案基于单评价网络的积分强化学习结构实现, 仅需部分系统动力学知识便可在线学习近似最优控制策略, 且能扩展到两类事件触发情形. 理论分析证明了闭环学习系统的渐近稳定性和权值误差的一致最终有界性, 两个算例的对比仿真结果验证了所提方法的综合优势.
本文后续内容安排如下: 1) 阐述非线性系统最优控制问题; 2) 设计基于事件的自适应学习方案; 3) 详述LDETM及其事件触发规则; 4) 提供两个仿真示例验证方法有效性; 5) 总结全文工作并进行展望.
图1 LDETM的简要示意图
图2 SETM中的触发率与权值近似误差
图3 LDETMS的学习和触发结果
本文针对连续时间非线性系统的最优控制问题, 提出一种新颖的学习感知型动态事件触发机制. 该机制突破传统事件触发方法在灵活性、可扩展性与学习感知能力方面的局限, 通过将IRL与单评价网络的学习结构相结合, 构建能够在线逼近最优值函数的事件驱动自适应学习方案. 理论分析严格证明了闭环系统的稳定性与权值误差的收敛性, 不同仿真案例的结果充分验证了所提方法的综合优势. 未来研究工作将侧重评估其在实际工程系统中的性能, 并增强学习过程在不确定环境下的鲁棒性.
作者简介
天津大学电气自动化与信息工程学院助理研究员. 主要研究方向为强化学习与自适应动态规划, 博弈智能及应用. E-mail: walker_wang@tju.edu.cn
许振钰
天津大学电气自动化与信息工程学院博士研究生. 主要研究方向为强化学习, 无人集群系统优化决策. E-mail: zhenyuxu@tju.edu.cn
张俊楠
天津大学电气自动化与信息工程学院博士研究生. 主要研究方向为多智能体系统与强化学习, 机器人运动规划. E-mail: zjn8018@tju.edu.cn
穆朝絮
天津大学电气自动化与信息工程学院教授. 主要研究方向为自适应学习系统, 智能无人系统优化与控制, 智能电网, 多机器人协同制造. 本文通信作者. E-mail: cxmu@tju.edu.cn
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-11 04:09
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社