Clean优化器
2 Schritte1 Beiträge2 Quellen
Clean优化器通过引入随机Nyström近似,解决了大语言模型训练中二阶方法内存开销过高的瓶颈。该算法将SOAP类全曲率优化器的内存复杂度从二次方降至线性,使得在单张80GB GPU上预训练13B参数模型成为可能。
【背景】传统一阶优化器(如Adam)虽省内存但丢弃了跨参数曲率信息,而全曲率方法(如SOAP)收敛快但内存成本高昂。Clean利用Nyström方法近似Shampoo预处理矩阵,并重新整合子空间外的组件以保留曲率信息。
实验数据显示,Clean的优化器状态占用比标准AdamW更小,但在达到相同最终性能时,墙钟时间快了26%。其低精度变体Q-Clean在预训练LLaMA-1.3B架构时,相比Muon优化器减少了超过50%的内存消耗,同时保持具有竞争力的预测性能。这一进展意味着开发者可以在更有限的硬件资源下,获得接近全二阶方法的训练效率。
Wie es dazu kam
论文《Clean: Second-order LLM Training at Linear Memory Cost via Nyström Sketching》提交至arXiv,提出Clean和Q-Clean优化器。
arxiv.org ↗媒体报道指出Clean优化器支持单卡预训练13B模型,且比AdamW快26%。
arxiv.org ↗
Was noch ungeklärt ist
- Clean优化器在更大规模模型(如70B+)上的扩展性表现如何?
- Q-Clean的低精度压缩是否会在特定任务微调中导致显著的性能损失?
- 该方法与现有的其他高效优化器(如Adafactor或LAMB)在实际生产环境中的对比数据尚缺。