返回研究

RESEARCH AREA 02 / DECIDE

从历史数据到更优决策

在不能进行高风险在线试错的工业系统中,从历史数据学习更优的安全决策。

01 / CHALLENGE

Challenge

在线不可冒险,离线不能只求保守

在线强化学习的随机试错可能触碰工业安全红线,而常规离线强化学习又容易因数据分布狭窄而过度保守。研究需要同时解决分布外泛化、安全边界和长期动力学漂移,让策略在明确的物理与执行边界内逼近更优解。

02 / GENERALIZATION

Generalization

表征空间状态拼接

算法从历史数据中提取高价值状态片段,在工业表征空间内重组为新的优化路径,使有限的已知经验可以支持历史数据中未直接出现的决策组合。

高阶策略约束

监督信号从动作本身扩展到动作变化率,使策略同时学习“做什么”和“如何平稳地做”。动作的一阶时间导数作为正则项约束控制信号的连续性,降低高频震荡并改善未知工况下的执行稳定性。

高阶策略约束下的动作轨迹和平滑性对比
高阶策略约束下的动作轨迹与平滑性对比。

03 / SAFETY

Safety

把安全边界与回报优化解耦

方法在表征空间中识别安全区域与非安全区域,构建可行域并在决策生成阶段把动作引导到安全区域。安全边界独立于回报目标,使策略可以在明确红线内释放优化空间;现场 PLC、BMS 或 DCS 的确定性保护仍负责最终执行边界。

安全可行域与策略轨迹示意
安全区域、非安全区域与决策轨迹。

04 / RELATED RESEARCH

相关公开研究

  • Data Center Cooling System Optimization Using Offline Reinforcement Learning — ICLR 2025
  • A Policy-Guided Imitation Approach for Offline Reinforcement Learning — NeurIPS 2022
  • Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model — ICLR 2024
查看论文列表