EfficientTDMPC自报在HumanoidBench与DMControl刷新样本效率
EfficientTDMPC对TD-MPC系列模型基强化学习做三处改进:聚合不同回滚深度的多视野规划目标、为MuZero式方法引入状态-动作价值集成、在生成策略目标时以悲观reanalyze惩罚不确定的回报估计。作者自报,在HumanoidBench与DeepMind Control Suite上达到样本效率新最优。
此前TD-MPC系列未做这三处改进,读者无法据其判断这些改动能否带来样本效率收益。
该最优为作者自报的第一方结果,尚无第三方复现;结果出自Thomas Evers等五名作者的arXiv预印本(2026年5月15日首提,2026年9月17日更新至v4,arXiv:2605.16692)。
信息源:arxiv.org