返回研究

RESEARCH AREA 01 / UNDERSTAND

决策导向型工业表征模型

从有限、含噪、持续变化的工业数据中,学习面向决策的系统动力学与物理表征。

01 / REPRESENTATION

Representation

为决策服务的系统认知中枢

如果决策算法是执行的大脑,工业表征模型就是认知中枢。它在数据匮乏、工况复杂的条件下解构系统动力学,为后续寻优控制提供面向决策的物理表征基础。

连续动力学与空间拓扑

前向神经常微分方程推演施加控制动作后的未来运行过程,逆向神经常微分方程回溯形成当前状态的历史过程。针对管网与热交换系统,图卷积网络进一步表达设备之间的空间热力学拓扑,并与连续动力学损失共同形成结构化约束。

02 / T-SYMMETRY

T-Symmetry

用时间反演对称性约束隐空间

训练阶段要求前向连续运行过程与逆向回溯保持镜像一致,让动力学系统既能顺着时间推演,也能逆着时间重构。物理对称性帮助模型过滤耗散、传感器误差和狭窄数据分布带来的伪相关性,并为离线决策中的动作外推提供物理锚点。

03 / SAMPLE & TRAINING EFFICIENCY

Sample & Training Efficiency

在极少样本下学习稳定表征

D4RL 多组基准实验覆盖 Hopper 与 Walker2d 等任务,在约 0.5%–1% 的原始数据规模下比较不同方法的标准化分数,用于检验物理先验对小样本表征与策略学习的帮助。

D4RL Hopper 与 Walker2d 数据集上不同算法和数据规模的标准化分数对比
D4RL 基准实验:不同算法在不同数据规模下的标准化分数。

分钟级模型构建与策略寻优

在相关实验中,动力学模型训练约 5 分钟,策略训练优化约 15 分钟,端到端流程约 20 分钟。轻量训练使模型在环境漂移或设备更替时能够更敏捷地完成适配。

04 / RELATED RESEARCH

相关公开研究

  • Sample Efficient Offline RL via T-Symmetry Enforced Latent State-Stitching — ICLR 2026
  • Look Beneath the Surface: Exploiting Fundamental Symmetry for Sample-Efficient Offline RL — NeurIPS 2023
查看论文列表