EfficientTDMPC预印本自报样本效率新最优,未经独立复现
样本效率新最优目前只是作者一家之言,值得盯的是独立复现与是否进入同行评议。
原始事件 2026-09-17
资料核对时间:2026/09/18 12:07
这是一篇历史文章。正文中的预测、价格和后续节点均属于当时的时间范围。
Thomas Evers等五名作者在arXiv预印本(2026年5月15日首提,9月17日更新至v4)提出EfficientTDMPC,对TD-MPC系列模型基强化学习做三处改进:聚合不同回滚深度的多视野规划目标、为MuZero式方法引入状态-动作价值集成、在生成策略目标时以悲观reanalyze惩罚不确定的回报估计。作者自报(未经独立复现)在HumanoidBench与DeepMind Control Suite上达到样本效率新最优。