EfficientTDMPC预印本自报样本效率新最优,未经独立复现
样本效率新最优目前只是作者一家之言,值得盯的是独立复现与是否进入同行评议。
原始事件 2026-09-17
Sources checked:09/18/2026, 12:07 · Original article in Chinese
This is an archived article. Forecasts, prices and upcoming events refer to its original time period.
Thomas Evers等五名作者在arXiv预印本(2026年5月15日首提,9月17日更新至v4)提出EfficientTDMPC,对TD-MPC系列模型基强化学习做三处改进:聚合不同回滚深度的多视野规划目标、为MuZero式方法引入状态-动作价值集成、在生成策略目标时以悲观reanalyze惩罚不确定的回报估计。作者自报(未经独立复现)在HumanoidBench与DeepMind Control Suite上达到样本效率新最优。