资讯1 分钟阅读·
千层网络让自监督RL性能倍增
NeurIPS最佳论文证实,将RL网络深度增至1024层可使无奖励探索性能提升2至50倍。
重要性实质性证据E2 未复现写法快讯
自监督强化学习的网络深度从常规的2-5层扩展至1024层后,智能体在无奖励、无演示的目标达成任务中性能提升了2至50倍。
过去几年,强化学习研究普遍依赖浅层架构,导致其难以像语言或视觉模型那样通过规模扩展获得突破。这项由Kevin Wang等人完成的研究表明,深度本身是解锁自监督RL可扩展性的关键因素。
实验在模拟的运动和操作任务中进行,采用对比式自监督RL算法。结果显示,增加深度不仅提高了成功率,还改变了智能体学到的行为模式。该论文已被NeurIPS 2025接收并获最佳论文奖,但结论尚未在真实物理环境中复现。