首页 /研究 /专家行为先验强化学习
LEARNING

专家行为先验强化学习

Gong Gao, Weidong Zhao, Xianhui Liu, Ning Jia

发表年份
2026
访问权限
开放获取

摘要

该论文提出了一种专家行为先验(EBP)算法,通过Q引导的条件变分自编码器(Q-CVAE)从在线回放缓冲区生成专家策略先验,无需依赖离线演示。该方法结合专家策略引导机制,提升了在线强化学习的样本效率和策略稳定性。

关键词

reinforcement learningbehavior priorexpert policysample efficiencyQ-CVAE

相关论文

查看 LEARNING 分类全部论文