长期信息1 分钟阅读·
参数更少训练更快,但换任务别当万能
ALBERT是一种给文本模型省参数的做法:把每个词对应的表示拆小、让多层共用参数,用更少参数更快学习句子含义。
重要性实质性证据E3 可检验写法快讯
ALBERT是一种给文本模型省参数的做法:把每个词对应的表示拆小、让多层共用参数,用更少参数更快学习句子含义。当你看到它用更少参数在文本任务上刷高分,先问省下的参数来自哪里。
它给出的机制是:参数省在词的表示拆小和层间共用,同时用判断句子顺序来保留多句话任务能力。所以读少参数文本模型时,要问这两处是否仍适配你的任务。
如果非英语、极小数据,或每层宽度过大,就别拿它判断通用最优。部分单句任务里,去掉句子顺序目标影响也有限。
《ALBERT》(2019)|下次复查 2027-09-20