资讯1 分钟阅读·
RL训练LoRA改写策略对齐SFT数据分布,三骨干非下游退化均降低
作者自报:用强化学习训练轻量LoRA改写策略,在任务一致性硬门下优化问答式分布对齐与语义多样性,三个指令微调骨干上下游增益与标准SFT大致相当。
重要性局部证据E2 未复现
用强化学习训练轻量LoRA改写策略来改写SFT数据,可在任务一致性硬门下优化问答式分布对齐与语义多样性;作者自报,三个指令微调骨干的上下游增益与标准SFT大致相当,且所有评测设置中非下游基准退化均降低。
此前SFT数据改写缺乏这种形式化处理,改写质量与下游代价难以同时控制。
该结果为作者自报:三个指令微调骨干上,上下游增益与标准SFT大致相当,非下游基准退化在所有评测设置中均降低;跨域复用改写策略仅为初步证据。
边界:结果未经第三方复现;该工作为arXiv预印本2602.11220,2月11日首提,9月16日更新v2。来源:arXiv摘要页 ↗