现在工业界和学术界对能泛化、可解释、高效的RL需求迫切,顶会也对此倾斜,再加上纯大模型已经卷上天...如此情况下,尚在蓝海的因果强化学习CRL无疑是对论文er更友好的选择。

目前,CRL的五个主流分支都很活跃,从顶会热度上来看,离线因果RL这个工业刚需最火,对小白来说也是个非常不错的切入点。TMLR上有篇以此为核心研究案例的理论分析论文可以作为核心思路参考,它是CRL领域的通用奠基框架。

本文整理了12篇因果强化学习CRL前沿论文,主要为了帮大家高效搭建研究逻辑,规避一些常踩的方向误区。合集包含部分顶会顶刊成果,方便大家找准前沿空白,确定自己的创新点。

全部论文+开源代码需要的同学看文末

【neurips】RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning

研究方法:本文提出RAD端到端自动驾驶训练框架,基于3D高斯溅射搭建实景数字仿真环境,采用因果强化学习为主、模仿学习作为正则的联合训练方式,通过定制安全奖励与稠密辅助目标,让模型学习真实驾驶因果逻辑,同时贴合人类驾驶行为。

创新点:

  • 首次基于3DGS搭建面向端到端自动驾驶的强化学习闭环训练环境,借助实景数字孪生让策略充分探索工况、学习应对分布外场景。

  • 将强化学习与模仿学习结合,利用强化学习建模真实驾驶因果关系、弥补开环缺陷,同时用模仿学习约束策略行为贴合人类驾驶习惯。

  • 设计多维度安全奖励函数与稠密辅助监督目标,解决强化学习奖励稀疏问题,大幅降低模型碰撞风险。

研究价值:研究结合3D高斯溅射技术、因果强化学习与模仿学习,破解了传统自动驾驶模仿学习存在的因果混淆、开环误差大、应对异常场景能力弱等痛点,搭建出高真实度闭环训练体系,显著降低碰撞率,为端到端自动驾驶策略训练提供了高效、安全的新方案。

【Sci China Inf Sci】Causal action empowerment for efficient reinforcement learning in embodied agents

研究方法:论文提出因果动作赋能(CAE)框架,面向具身智能体,把因果推理与强化学习相结合,先筛选可控状态、依据因果关系对动作加权排序,再引入因果感知的赋能项优化策略,有效解决传统强化学习盲目探索、采样效率低的问题。

创新点:

  • 结合因果推理与强化学习,挖掘状态、动作、奖励之间的因果关联,区分并剔除不可控状态,规避虚假相关带来的干扰。

  • 构建奖励引导的因果结构模型,依据动作对奖励的因果影响完成动作权重重分配,优先探索高价值关键动作。

  • 设计因果感知的动作赋能目标,衔接局部因果发现与全局环境控制能力,进一步提升智能体在复杂环境中的探索效率与可控性。

研究价值:研究提出融合因果推理与动作赋能的强化学习框架,有效破除传统算法盲目探索、采样效率低下的弊端,大幅提升具身智能体在高维控制、稀疏奖励等复杂场景下的学习能力与环境可控性,为高效强化学习研究提供了新思路。

关注下方《学姐带你玩AI》🚀🚀🚀

回复“222”获取全部方案+开源代码

码字不易,欢迎大家点赞评论收藏

Logo

脑启社区是一个专注类脑智能领域的开发者社区。欢迎加入社区,共建类脑智能生态。社区为开发者提供了丰富的开源类脑工具软件、类脑算法模型及数据集、类脑知识库、类脑技术培训课程以及类脑应用案例等资源。

更多推荐