新优化器让13B模型单卡可训
Clean优化器通过Nyström近似将二阶方法内存降至线性,比AdamW快26%,支持单卡预训练13B模型。
重要性实质性证据E2 未复现写法快讯
Clean优化器将二阶方法的内存复杂度从平方级降至线性级,并允许在单张80GB GPU上预训练13B参数模型。
传统二阶优化器(如SOAP)虽能加速收敛,但内存成本过高难以扩展。Clean利用随机Nyström方法近似预条件矩阵,保留了曲率信息的同时大幅压缩了状态占用。
作者自测显示,Clean达到AdamW最终性能的速度快26%;其低精度变体Q-Clean相比Muon优化器减少超过50%的内存消耗。该结果目前为预印本,尚未经过独立复现验证。