长期信息1 分钟阅读·
训练模型不知步长该设多大时,Adam替每个参数自动定
训练AI模型时,要反复按梯度微调成千上万个参数,每步走多远由学习率决定,设大了震荡、设小了太慢。
重要性实质性证据E3 可检验写法快讯
训练AI模型时,要反复按梯度微调成千上万个参数,每步走多远由学习率决定,设大了震荡、设小了太慢。Adam(2015年提出)是一种自动定步长的方法:它记录每个参数梯度的大小和波动,给平稳的参数大步、给抖动的参数小步,且对梯度整体缩放不敏感。
今天打开任何深度学习框架或教程,默认的优化器多半就是它;新方法发论文仍拿它当对比基准。它立的"超参数几乎不用调"这条规矩,至今没被换掉。
如果想要凸问题之外的理论收敛保证,或用它判断论文没测过的模型和数据,就别用它下结论;非凸深度场景的长期表现证据有限。
《Adam: A Method for Stochastic Optimization》(2015)|下次复查 2027-09-20