期刊文献+
共找到66篇文章
< 1 2 4 >
每页显示 20 50 100
A*-PPO融合的建材搬运机器人路径规划 认领 引用 被引量:2
1
作者 尹航 郭岱羲 +3 位作者 路沙沙 关欣怡 马润博 金佳旭 《控制与决策》 EI CSCD 北大核心 2026年第4期965-976,共12页
路径规划是智能建造中建材搬运机器人高效、安全作业的核心挑战,尤其是在动态复杂工况下,传统方法常面临路径震荡、避障失败以及全局-局部决策失配等问题.鉴于此,提出A*-PPO协同优化框架.具体做法如下:1)改进A*算法采用八邻域扩展和切... 路径规划是智能建造中建材搬运机器人高效、安全作业的核心挑战,尤其是在动态复杂工况下,传统方法常面临路径震荡、避障失败以及全局-局部决策失配等问题.鉴于此,提出A*-PPO协同优化框架.具体做法如下:1)改进A*算法采用八邻域扩展和切比雪夫距离构建栅格化全局拓扑;2)设计六维观测向量驱动的动态奖励函数,集成路径跟踪奖励、碰撞惩罚以及步长约束;3)建立特征级参数共享机制,通过动态窗口法(DWA)将A*路径特征嵌入近端策略优化(PPO)网络,以实现全局代价估计与局部避障决策同步优化.仿真验证:在4类典型环境中的仿真表明,所提出方法相较于RRT*-APF与传统A*算法,在动态障碍场景下路径成功率提升了42.7%(传统方法均失败),规划时间减少了55.8%,U型凹面障碍耦合动态干扰时成功避障了98次.技术突破:通过渐近式航点验证和双层优化架构,能够解决拓扑保持与实时避障的兼容性难题以及建筑机器人路径震荡和避障延迟问题. 展开更多
关键词 建筑运输机器人 A*算法 强化学习 PPO 路径规划
暂未订购 下载PDF
基于规则操作性PPO的无人船避碰方法研究 认领 引用
2
作者 邓明星 李爽 +1 位作者 曾晨 许小伟 《华中科技大学学报(自然科学版)》 EI CAS CSCD 北大核心 2026年第4期94-101,共8页
针对港口复杂环境下无人船避碰路径规划存在的维度灾难与动态适应性挑战,提出了一种融合国际海上避碰规则(COLREGs)与无人船操纵性的深度强化学习避碰策略(RM-PPO).通过构建包含规则约束的奖励函数体系,建立对遇、交叉和追越场景的动态... 针对港口复杂环境下无人船避碰路径规划存在的维度灾难与动态适应性挑战,提出了一种融合国际海上避碰规则(COLREGs)与无人船操纵性的深度强化学习避碰策略(RM-PPO).通过构建包含规则约束的奖励函数体系,建立对遇、交叉和追越场景的动态优化目标体系;确保避碰决策符合COLREGs不同会遇态势的避让要求;基于船舶三自由度动力学模型设计连续动作空间,实现主机功率与舵角指令的协同优化,提升动作的物理可实现性;改进PPO(近端策略优化强化学习算法)算法网络结构,引入门控循环单元(GRU)增强时序决策能力,提出基于规则标志的优化策略生成机制,平衡策略的探索性与稳定性.仿真及实验结果表明:RM-PPO算法在基础会遇场景和复杂环境中均能实现高效、安全的避碰,其路径长度、避碰距离和航行稳定性显著优于传统强化学习算法. 展开更多
关键词 无人船避碰 深度强化学习 避碰规则 动态探索 PPO算法
暂未订购 下载PDF
线上PPO车载边缘计算多跳任务卸载策略 认领 引用
3
作者 张文柱 边跃伟 +1 位作者 熊福力 蔡思琪 《系统仿真学报》 EI CAS CSCD 北大核心 2026年第7期1901-1921,共21页
针对车载边缘计算(vehicular edge computing,VEC)环境中,由动态网络拓扑导致的通信链路频繁中断,以及高维决策空间引发的计算复杂度剧增问题,提出了一种基于线上PPO算法的车载边缘计算多跳任务卸载策略。构建了同时考虑链路有效时间、... 针对车载边缘计算(vehicular edge computing,VEC)环境中,由动态网络拓扑导致的通信链路频繁中断,以及高维决策空间引发的计算复杂度剧增问题,提出了一种基于线上PPO算法的车载边缘计算多跳任务卸载策略。构建了同时考虑链路有效时间、传输速率与计算资源约束的多跳任务卸载优化模型;设计了融合链路稳定性与端到端时延的多跳A*路径搜索算法;提出了基于PPO的在线卸载决策框架,将0-1混合整数非线性规划问题转化为马尔可夫过程并给出复杂度与收敛性分析。仿真结果表明:该策略在时延-能耗平衡和任务完成率方面均显著优于GreedyMinDelay、DQN和A3C基准算法,有效提升了系统在高动态车载场景下的实时性与鲁棒性。 展开更多
关键词 车载边缘计算 多跳任务卸载 PPO算法 马尔可夫决策 整数非线性规划
暂未订购 下载PDF
基于改进PPO算法的机器人机械臂抓取策略研究 认领 引用
4
作者 杨思祺 熊鸣 +2 位作者 张巧杰 聂世纪 刘雨鑫 《组合机床与自动化加工技术》 北大核心 2026年第7期62-66,共5页
传统近端策略优化算法因固定熵损失系数难以平衡探索与收敛,致训练效率受限。为此提出了一种基于贝叶斯优化的改进PPO算法,动态自适应调整熵损失系数以优化探索与利用权衡。实验在MuJoCo搭建机械臂抓取仿真环境,设计含关节角度、速度及... 传统近端策略优化算法因固定熵损失系数难以平衡探索与收敛,致训练效率受限。为此提出了一种基于贝叶斯优化的改进PPO算法,动态自适应调整熵损失系数以优化探索与利用权衡。实验在MuJoCo搭建机械臂抓取仿真环境,设计含关节角度、速度及目标偏差的21维状态空间,结合位置误差与控制代价的奖励函数,对比固定熵系数PPO、自适应熵策略PPO与改进算法训练效果。结果显示,改进算法借助贝叶斯优化全局搜索机制,使平均奖励获得提升,有效解决了传统算法局部最优问题,为机械臂智能控制提供更优方案。 展开更多
关键词 抓取策略 深度强化学习 PPO算法 贝叶斯优化 熵损失系数
暂未订购 下载PDF
基于改进PPO算法的多无人艇协同任务决策方法 认领 引用
5
作者 刘江山 彭鹏菲 《兵器装备工程学报》 CAS CSCD 北大核心 2026年第4期9-15,48,共7页
针对多无人艇任务决策问题,提出一种基于改进近端策略优化(proximal policy optimization,PPO)算法的任务决策方法。以多无人艇协同任务为背景,将多无人艇任务决策过程描述为序贯决策问题,并设计出合理有效的马尔科夫决策过程,在传统PP... 针对多无人艇任务决策问题,提出一种基于改进近端策略优化(proximal policy optimization,PPO)算法的任务决策方法。以多无人艇协同任务为背景,将多无人艇任务决策过程描述为序贯决策问题,并设计出合理有效的马尔科夫决策过程,在传统PPO算法策略网络中引入长短期记忆层(LSTM),建立基于LSTM-PPO算法的多无人艇智能决策框架。仿真实验结果表明,与传统PPO算法和DDPG算法相比,LSTM-PPO算法精度更高,学习速度更快,基于LSTM-PPO算法的智能决策框架在未知环境中具备更强的任务决策能力,能使我方多无人艇有效协同,在实际场景中有一定应用潜力。 展开更多
关键词 深度强化学习 PPO算法 马尔可夫决策过程 无人艇 任务决策 协同作战
暂未订购 下载PDF
基于PPO算法的多无人机编队避障控制方法 认领 引用
6
作者 王何鹏飞 黄杰 +3 位作者 王伟 曾刊 王楠 洪华杰 《兵工自动化》 北大核心 2026年第2期108-112,共5页
为解决多无人机编队在复杂障碍物中执行任务时训练难度大、多机难以建模等问题,提出一种基于链式训练并含有启发式信息的近端策略优化(proximal policy optimization,PPO)算法的多无人机穿梭树林端到端运动规划方法。综合考虑无人机的... 为解决多无人机编队在复杂障碍物中执行任务时训练难度大、多机难以建模等问题,提出一种基于链式训练并含有启发式信息的近端策略优化(proximal policy optimization,PPO)算法的多无人机穿梭树林端到端运动规划方法。综合考虑无人机的动态特性和3维连续环境的复杂性,设计一种有效的运动规划策略的强化学习训练方法。通过模拟实验,验证了该方法在多无人机编队穿梭树林任务中的有效性和优越性。研究结果表明:该方法能够在避障的前提下保持一定的编队稳定性,到达目标点,且在保持编队稳定性和通过率方面均优于传统的人工势场法。该研究为无人机编队在复杂环境中的自主导航和路径规划提供了新的视角和解决方案。 展开更多
关键词 无人机编队 编队任务 运动规划 改进PPO算法 自主导航 路径规划
暂未订购 下载PDF
基于改进PPO算法的套袋机器人针对桃树树枝的避障研究 认领 引用
7
作者 张天驰 刘树林 《工业控制计算机》 2026年第7期88-90,共3页
针对套袋机器人在桃树枝等不规则障碍物环境下的避障难题,提出了一种基于改进PPO算法的智能避障方法。实验结果表明,在5个目标点ptarget抵达任务中,经该算法训练的UR10e机械臂针对桃树枝的避障成功率Srate可达84%~90%,平均回合长... 针对套袋机器人在桃树枝等不规则障碍物环境下的避障难题,提出了一种基于改进PPO算法的智能避障方法。实验结果表明,在5个目标点ptarget抵达任务中,经该算法训练的UR10e机械臂针对桃树枝的避障成功率Srate可达84%~90%,平均回合长度Lep缩短至64步。所提算法使套袋机器人显著提高了套袋成功率,并实现了全局最优的轨迹规划。 展开更多
关键词 不规则障碍物 改进PPO算法 避障 平均回合长度 全局最优
暂未订购 下载PDF
一种基于强化学习PPO算法的舰载机舰面调运路径规划方法 认领 引用
8
作者 于浩 张莘普 +2 位作者 王奇涛 赵志刚 卢长谦 《南京航空航天大学学报(自然科学版)》 CSCD 北大核心 2026年第4期915-923,共9页
航母舰面空间狭小、环境复杂,舰载机在舰面调运时需按照规划的调运路径,因此调运路径对于调运安全和调运效率有着重要的影响。根据强化学习算法在求解效率上的优势,采用强化学习近端策略优化(Proximal policy optimization,PPO)算法建... 航母舰面空间狭小、环境复杂,舰载机在舰面调运时需按照规划的调运路径,因此调运路径对于调运安全和调运效率有着重要的影响。根据强化学习算法在求解效率上的优势,采用强化学习近端策略优化(Proximal policy optimization,PPO)算法建立舰载机调运路径规划方法;设计了终止区域并改进了情节结束奖励,使智能体可以规划出同时满足起、终点方向约束的调运路径;设计了障碍物探测器并采用了随机环境训练的训练方式,提高智能体在不同规划环境中的适应性。最后通过仿真计算,验证了模型的合理性和算法的有效性。 展开更多
关键词 强化学习 近端策略优化算法 舰载机 舰面调运 路径规划
暂未订购 下载PDF
基于DNN模型与PPO算法的火电厂热工过程智能控制与优化研究 认领 引用
9
作者 刘洪伟 《自动化应用》 2026年第5期56-58,62,共3页
针对传统的火电厂热工过程控制方法难以适应火电厂的复杂工况,易陷入局部最优和优化不稳定,导致机组经济性与环保性较低的问题,开展了基于深度神经网络(DNN)模型与近端策略优化(PPO)算法的热工过程智能控制与优化方法研究。通过数据预处... 针对传统的火电厂热工过程控制方法难以适应火电厂的复杂工况,易陷入局部最优和优化不稳定,导致机组经济性与环保性较低的问题,开展了基于深度神经网络(DNN)模型与近端策略优化(PPO)算法的热工过程智能控制与优化方法研究。通过数据预处理,构建高质量数据集,为模型训练奠定基础;设定涵盖经济、环保与设备安全的多目标约束体系,明确优化边界;利用DNN模型建立虚拟电厂模型,并基于PPO算法训练强化学习智能体,实现全局优化设定值与底层跟踪控制的协同。某660 MW超超临界机组的实验表明,所提方法在长期运行中显著降低了NOx排放浓度,与较传统方法相比,年运行总成本降低了14.3%~21.3%,有效提升了机组经济性与环保性,为火电智能化转型提供了可靠技术途径。 展开更多
关键词 深度神经网络模型 近端策略优化算法 火电厂 热工过程 智能控制
暂未订购 下载PDF
基于改进PPO算法的钻锚机器人机械臂路径规划 认领 引用 被引量:2
10
作者 张旭辉 田琛辉 +4 位作者 雷孟宇 杨文娟 田江伟 董征 田思昊 《煤炭学报》 EI CAS CSCD 北大核心 2025年第12期5420-5433,共14页
煤矿巷道支护装备的自动化与智能化水平较低,制约了煤矿巷道的成形效率,是造成“采掘失衡”的关键原因。为解决煤矿巷道支护装备自动化程度低、支护效率差的问题,针对一种集成悬臂式掘进机和多自由度机械臂的钻锚机器人,提出了一种基于... 煤矿巷道支护装备的自动化与智能化水平较低,制约了煤矿巷道的成形效率,是造成“采掘失衡”的关键原因。为解决煤矿巷道支护装备自动化程度低、支护效率差的问题,针对一种集成悬臂式掘进机和多自由度机械臂的钻锚机器人,提出了一种基于深度强化学习的钻锚机器人机械臂路径规划方法。在虚拟环境中构建煤矿巷道环境,并建立机械臂与机身、煤壁以及支护钢带的碰撞检测模型,使用层次包围盒法在虚拟环境进行碰撞检测,形成煤矿巷道边界受限情况下的避障策略。在近端策略优化(Proximal Policy Optimization,PPO)算法的基础上结合多方面因素提出改进。考虑到多自由度机械臂状态空间输入长度不固定的情况,引入长短记忆神经网络(Long Short Term Memory,LSTM)的环境状态输入处理方法,可以提升算法对环境的适应能力。并且在奖惩稀疏的情况下引入了好奇心机制(Intrinsic Curiosity Module,ICM),通过给予内在奖励鼓励智能体更大程度地探索环境。基于奖惩机制建立智能体,根据钻锚机器人的运动特性定义其状态空间与动作空间,在同一场景下分别使用2种算法对智能体进行训练,综合奖励值、回合步数、Actor网络损失值、Critic网络损失值等指标进行对比分析,最后经过仿真消融实验测试对比。实验结果表明,在原始PPO算法不能完成任务的情况下,改进后的算法路径长度比同样能完成任务的PPO-ICM算法缩短了3.98%,所用时间缩短了25.6%。为进一步验证改进后算法的鲁棒性,设计多组实验,改进后的PPO算法均完成路径规划任务,路径终点与目标位置的距离误差在3.88 cm之内,锚杆与竖直方向夹角误差在3°以内,能够有效完成路径规划任务,提升煤矿巷道支护系统的自动化程度。结果验证了所提方法在煤矿井下巷道支护时锚孔位置多变的情况下钻锚机器人多自由度机械臂在路径规划的可行性与有效性。 展开更多
关键词 巷道支护 钻锚机器人 碰撞检测 路径规划 改进PPO算法
暂未订购 下载PDF
Improved PPO-Based Task Offloading Strategies for Smart Grids 认领 引用
11
作者 Qian Wang Ya Zhou 《Computers, Materials & Continua》 SCIE EI 2025年第8期3835-3856,共22页
Edge computing has transformed smart grids by lowering latency,reducing network congestion,and enabling real-time decision-making.Nevertheless,devising an optimal task-offloading strategy remains challenging,as it mus... Edge computing has transformed smart grids by lowering latency,reducing network congestion,and enabling real-time decision-making.Nevertheless,devising an optimal task-offloading strategy remains challenging,as it must jointly minimise energy consumption and response time under fluctuating workloads and volatile network conditions.We cast the offloading problem as aMarkov Decision Process(MDP)and solve it with Deep Reinforcement Learning(DRL).Specifically,we present a three-tier architecture—end devices,edge nodes,and a cloud server—and enhance Proximal Policy Optimization(PPO)to learn adaptive,energy-aware policies.A Convolutional Neural Network(CNN)extracts high-level features from system states,enabling the agent to respond continually to changing conditions.Extensive simulations show that the proposed method reduces task latency and energy consumption far more than several baseline algorithms,thereby improving overall system performance.These results demonstrate the effectiveness and robustness of the framework for real-time task offloading in dynamic smart-grid environments. 展开更多
关键词 Smart grid task offloading deep reinforcement learning improved PPO algorithm edge computing
暂未订购 下载PDF
一种面向博弈场景的PPO-Dueling DQN策略优化方法 认领 引用
12
作者 刘鹏程 汪永伟 +2 位作者 余欣鋆 刘小虎 胡浩 《小型微型计算机系统》 CSCD 北大核心 2025年第11期2594-2599,共6页
传统的深度Q学习训练算法改进通常侧重于奖励函数的优化,相对缺少策略的自优化和收敛梯度的动态调整.本文针对该问题,在Dueling-DQN算法的基础上提出了一种混合算法PPO-Dueling DQN,该算法一方面能够使用策略梯度下降和自适应KL散度惩... 传统的深度Q学习训练算法改进通常侧重于奖励函数的优化,相对缺少策略的自优化和收敛梯度的动态调整.本文针对该问题,在Dueling-DQN算法的基础上提出了一种混合算法PPO-Dueling DQN,该算法一方面能够使用策略梯度下降和自适应KL散度惩罚机制,实现目标函数损失和值函数损失的同步更新,进而优化模型的损失函数和策略选择,另一方面能更加实时地提取博弈过程中的状态价值和动作优势,从而避免依靠单一指标进行策略更新和效能评估.通过对比实验,验证了面向网络博弈模型的PPO-Dueling DQN算法在学习能力、收敛速度和自适应效能等指标上的优化效果,并进行了关于折扣因子的参数分析以更好地评估模型效能,实验结果证明本文提出的算法相对于基准模型具有一定的性能优势. 展开更多
关键词 强化学习 深度Q网络 PPO算法 网络攻防博弈 效能评估
暂未订购 下载PDF
基于改进PPO算法的无人船全覆盖路径规划 认领 引用 被引量:1
13
作者 黄柏文 张平均 +2 位作者 张茂林 郑则烨 林洪汇 《机电技术》 2025年第6期32-40,66,共9页
文章针对城市内湖水面垃圾清理问题中无人船全覆盖路径规划存在的路径冗余高、覆盖效率不足等问题,提出了一种基于LSTM-DS-PPO的全覆盖路径规划方法。首先,对作业水域进行栅格化建模,构建高效可训练的状态表示空间;接着,选用PPO作为基... 文章针对城市内湖水面垃圾清理问题中无人船全覆盖路径规划存在的路径冗余高、覆盖效率不足等问题,提出了一种基于LSTM-DS-PPO的全覆盖路径规划方法。首先,对作业水域进行栅格化建模,构建高效可训练的状态表示空间;接着,选用PPO作为基准模型,改进设计了LSTM-DS-PPO模型,改进主要包括在基准PPO中采用了基于优势函数的动态采样机制替换原有的采样机制,在训练过程中筛选高质量样本参与更新,同时引入了解耦剪裁机制,缓解训练中的奖励退化;其次,通过引入长短期记忆网络(LSTM),增强智能体对历史覆盖状态的记忆能力,从而有效识别已访问区域并减少路径重复;最后,通过仿真试验验证,结果表明,所提方法在大障碍物和小障碍物场景下能够更快达到更高的奖励峰值,加速模型收敛,同时也显著减少冗余路径并提升全覆盖效率,验证了该算法的有效性。 展开更多
关键词 无人船 全覆盖路径规划 改进PPO算法 近端策略优化 长短期记忆神经网络 动态采样机制
暂未订购 下载PDF
带最大熵修正和GAIL的PPO算法 认领 引用
14
作者 王泽宁 刘蕾 《计算机测量与控制》 2025年第1期235-241,共7页
为提高智能体在策略优化过程中的探索性和稳定性,改善强化学习中智能体陷入局部最优和奖励函数设置问题,提出了一种基于最大熵修正和GAIL的PPO算法;在PPO框架内引入最大熵修正项,通过优化策略熵,鼓励智能体在多个可能的次优策略间进行探... 为提高智能体在策略优化过程中的探索性和稳定性,改善强化学习中智能体陷入局部最优和奖励函数设置问题,提出了一种基于最大熵修正和GAIL的PPO算法;在PPO框架内引入最大熵修正项,通过优化策略熵,鼓励智能体在多个可能的次优策略间进行探索,从而更全面地评估环境并发现更优策略;同时,为解决强化学习过程中因奖励函数设置不合理引起的训练效果不佳问题,引入GAIL思想,通过专家数据指导智能体进行学习;实验表明,引入最大熵修正项和GAIL的PPO算法在强化学习任务上取得了良好的性能,有效提升了学习速度和稳定性,且能有效规避因环境奖励函数设置不合理引起的性能损失;该算法为强化学习领域提供了一种新的解决策略,对于处理具有挑战性的连续控制问题具有重要意义。 展开更多
关键词 强化学习 PPO算法 生成式对抗模仿学习 深度学习 最大熵学习
暂未订购 下载PDF
融合流体扰动与近端策略优化算法的路径规划研究 认领 引用 被引量:2
15
作者 谷志新 贾珂怡 徐凯宏 《火力与指挥控制》 CSCD 北大核心 2026年第3期66-73,共8页
路径规划算法是机器人技术以及自动化系统等领域的核心问题之一。针对三维动态空间中易出现移动目标、动态威胁等,构建智能体路径规划的仿真环境及相关模型,确定仿真流程。运用近端策略优化对改进的流体扰动算法的初始路径进行修正,实... 路径规划算法是机器人技术以及自动化系统等领域的核心问题之一。针对三维动态空间中易出现移动目标、动态威胁等,构建智能体路径规划的仿真环境及相关模型,确定仿真流程。运用近端策略优化对改进的流体扰动算法的初始路径进行修正,实现最优决策。并进行仿真验证,结果表明在三维动态空间中,该算法在路径规划的收敛效率、路径平滑度和避障成功率等方面均优于对比算法。对于三维动态空间中易发生出现可移动障碍物等情况,此算法优化改进的流体扰动算法,具有较好的鲁棒性和良好的适应性。 展开更多
关键词 流体扰动算法 近端策略优化算法 路径规划 三维动态空间
暂未订购 下载PDF
基于深度强化学习的大型高铁站到发线运用方案快速编制方法 认领 引用
16
作者 王岩 周黎 +3 位作者 范家铭 徐辉章 张新 李博 《铁道科学与工程学报》 EI CAS CSCD 北大核心 2026年第7期3099-3109,共11页
大型高铁站是高铁网络中的关键枢纽节点,其到发线运用方案的合理安排是车站运输组织工作的核心。为实现大型高铁站到发线运用方案的快速编制,将人工智能领域的深度强化学习方法应用于到发线运用问题中。首先,基于列车过站径路的概念来... 大型高铁站是高铁网络中的关键枢纽节点,其到发线运用方案的合理安排是车站运输组织工作的核心。为实现大型高铁站到发线运用方案的快速编制,将人工智能领域的深度强化学习方法应用于到发线运用问题中。首先,基于列车过站径路的概念来实现到发线分配与进路排列的协同优化,将到发线运用问题描述为最大独立集问题,以尽可能安排所有列车为目标,形成整数规划模型。然后,构建基于冲突图的强化学习环境模型,将到发线运用方案数学模型转化为马尔可夫决策过程,定义状态表征、动作空间、状态转移和奖励函数,为智能体提供训练数据的交互采集场所。最后,设计基于GCN(graph convolutional network)的到发线运用智能体神经网络架构,基于PPO(proximal policy optimization)算法实现智能体高效预训练,在决策阶段,设计基于2Imp的决策提升算法进一步优化方案编制质量。以北京南高速场和广州南站为案例场景,对比3种不同方法的求解时间与最终目标函数取值。结果表明,经过4.2 h预训练后智能体完成收敛,决策阶段智能算法可以快速求得最优解,相比于运筹学经典算法,求解质量相同的情况下智能算法求解速度可提升5~16倍,1.2 s即可完成广州南站1133列列车的到发线运用方案编制。此外,该方法具有良好的扩展性和泛化能力,智能体经过一次训练后即可泛化至不同车站、不同规模的场景中进行决策与求解。研究结果可为进一步提升列车运行图整体编制效率提供技术支撑,为铁路运输组织的智能化发展提供方法参考。 展开更多
关键词 大型高铁站 到发线运用 深度强化学习 智能体 PPO算法 神经网络
暂未订购 下载PDF
基于实时占用感知的电梯群控调度仿真研究 认领 引用
17
作者 韩义勇 王诗雨 +3 位作者 叶杨 张震 裴凤雀 苑明海 《系统仿真学报》 EI CAS CSCD 北大核心 2026年第7期1993-2006,共14页
面向群控电梯调度中轿厢空间资源配置与高峰客流响应效率之间的矛盾,提出一种基于实时占用感知的PPO多目标调度方法。构建考虑轿厢容量约束的仿真环境,设计以乘客平均候梯时间、系统能耗与轿厢拥挤度为优化目标的奖惩机制,据此定义状态... 面向群控电梯调度中轿厢空间资源配置与高峰客流响应效率之间的矛盾,提出一种基于实时占用感知的PPO多目标调度方法。构建考虑轿厢容量约束的仿真环境,设计以乘客平均候梯时间、系统能耗与轿厢拥挤度为优化目标的奖惩机制,据此定义状态空间与动作空间,形成基于PPO的调度框架;开发集交通流可视化、策略调度与性能评估于一体的仿真平台。仿真结果表明:该方法在多种交通模式下均能显著降低长候梯率、能耗与拥挤度,表现出良好的适应性与收敛性。 展开更多
关键词 电梯群控调度 强化学习 PPO算法 实时占用感知 多目标优化
暂未订购 下载PDF
计及碳排放的电动汽车充电站优化定价策略 认领 引用
18
作者 尹力 盛俊杰 +1 位作者 袁杰 冯燕钧 《电气传动》 2026年第2期50-57,共8页
在碳中和背景下,提出了一种计及碳排放的电动汽车充电站优化定价策略。首先,构建电动汽车用户价格响应特性模型;其次,建立以碳排放最低、负荷峰谷差最小以及充电站收益最高为目标的定价优化模型并将其转化为马尔科夫决策过程;然后,提出... 在碳中和背景下,提出了一种计及碳排放的电动汽车充电站优化定价策略。首先,构建电动汽车用户价格响应特性模型;其次,建立以碳排放最低、负荷峰谷差最小以及充电站收益最高为目标的定价优化模型并将其转化为马尔科夫决策过程;然后,提出一种基于时间差分误差的改进近端策略优化算法,以提高算法的效率与稳定性;最后,通过算例分析表明,所提定价策略能够降低配电网负荷峰谷差,提高充电站经济效益与低碳水平。 展开更多
关键词 充电站 碳排放 定价策略 深度强化学习 改进近端策略优化算法
暂未订购 下载PDF
考虑车载质量变化的混合动力公交车能量管理策略 认领 引用
19
作者 唐进君 张帅杰 《系统仿真学报》 EI CAS CSCD 北大核心 2026年第6期1583-1597,共15页
针对公交运行中车载质量的变化会影响整车功率需求从而导致能量管理策略效果不佳,提出了一种基于近端策略优化结合自适应模拟退火(PPO-ASA)的混合动力公交能量管理策略方法。在PPO中引入了ASA,在策略更新前依据策略熵对策略参数进行扰动... 针对公交运行中车载质量的变化会影响整车功率需求从而导致能量管理策略效果不佳,提出了一种基于近端策略优化结合自适应模拟退火(PPO-ASA)的混合动力公交能量管理策略方法。在PPO中引入了ASA,在策略更新前依据策略熵对策略参数进行扰动,通过Metropolis准则自适应接受或拒绝扰动策略,提升策略的探索能力并增强收敛的稳定性。实验结果表明:在考虑车载质量变化时该方法优于CD-CS(charge depleting charge sustaining)控制策略,百公里燃油消耗节约了5.8%,且工况适应性也优于其他算法;考虑车载质量变化的能量管理策略的累计油耗处于最低水平,比空载下的能量管理策略节约了4.5%的油耗。 展开更多
关键词 能量管理策略 PPO算法 ASA LSTM模型 CD-CS控制策略 车载质量变化
暂未订购 下载PDF
基于规则的多智能体强化学习的匝道合流策略 认领 引用
20
作者 张建华 高云飞 《重庆交通大学学报(自然科学版)》 CAS CSCD 北大核心 2026年第4期69-80,共12页
将混合交通下的匝道合流问题转化为基于规则的多智能体强化学习问题,通过设计融合规则约束与学习能力的框架,实现匝道与主路自动驾驶车辆协同适应人类驾驶行为以最大程度提高交通效率。主要做出了以下研究内容:一是单智能体多维度奖励机... 将混合交通下的匝道合流问题转化为基于规则的多智能体强化学习问题,通过设计融合规则约束与学习能力的框架,实现匝道与主路自动驾驶车辆协同适应人类驾驶行为以最大程度提高交通效率。主要做出了以下研究内容:一是单智能体多维度奖励机制,构建包含速度奖励、车道汇入惩罚、车头安全距离惩罚及碰撞惩罚的综合奖励体系,通过动态速度映射、车道占用成本计算及动态安全距离评估,形成安全与效率约束体系;二是多智能体协同的区域奖励机制,设计基于车辆交互关系的区域奖励模型,通过动态拓扑适应的参数共享策略及通信连接状态调整奖励权重,提升多智能体协同效率;三是近端策略优化(PPO)算法的多智能体适应性改进,优化强化学习核心流程,引入交互因子的裁剪目标函数,提升训练稳定性与收敛效率。实验表明:该框架在合流成功率、碰撞率等指标上优于多种先进方法,为混合交通下的匝道合流提供了安全高效的解决方案。 展开更多
关键词 交通工程 匝道合流 多智能体强化学习 规则约束 奖励机制 PPO算法
暂未订购 下载PDF
上一页 1 2 4 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈