RESEARCH AREA 02 / DECIDE
从历史数据到更优决策
在不能进行高风险在线试错的工业系统中,从历史数据学习更优的安全决策。
01 / CHALLENGE
Challenge
在线不可冒险,离线不能只求保守
在线强化学习的随机试错可能触碰工业安全红线,而常规离线强化学习又容易因数据分布狭窄而过度保守。研究需要同时解决分布外泛化、安全边界和长期动力学漂移,让策略在明确的物理与执行边界内逼近更优解。
02 / GENERALIZATION
Generalization
表征空间状态拼接
算法从历史数据中提取高价值状态片段,在工业表征空间内重组为新的优化路径,使有限的已知经验可以支持历史数据中未直接出现的决策组合。
高阶策略约束
监督信号从动作本身扩展到动作变化率,使策略同时学习“做什么”和“如何平稳地做”。动作的一阶时间导数作为正则项约束控制信号的连续性,降低高频震荡并改善未知工况下的执行稳定性。

03 / SAFETY
Safety
把安全边界与回报优化解耦
方法在表征空间中识别安全区域与非安全区域,构建可行域并在决策生成阶段把动作引导到安全区域。安全边界独立于回报目标,使策略可以在明确红线内释放优化空间;现场 PLC、BMS 或 DCS 的确定性保护仍负责最终执行边界。

04 / RELATED RESEARCH
相关公开研究
- Data Center Cooling System Optimization Using Offline Reinforcement Learning — ICLR 2025
- A Policy-Guided Imitation Approach for Offline Reinforcement Learning — NeurIPS 2022
- Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model — ICLR 2024