苹果研究称激活导向在指令微调模型上明显失效
依赖激活导向控制大模型输出的团队需留意:研究称其对指令微调模型效果大减,且常牺牲流畅度。
苹果机器学习研究团队与庞培法布拉大学的研究者发现,激活导向方法在指令微调模型上的效果远不如在基座模型上。
激活导向(activation steering)指不改模型权重、直接干预内部激活来引导输出(如去除毒性概念)的方法。这篇发表于BlackBoxNLP 2026工作坊的论文还测出,此类高效方法常以生成流畅度大幅下降为代价;提示词和完整监督微调适合概念注入,但不擅长概念移除。
论文arXiv版本于6月10日首次提交,苹果研究页标注2026年9月发布。研究为作者自测,摘要未列出具体模型清单与样本规模,外推需谨慎。
信息源:https://machinelearning.apple.com/research/effectiveness-fluency-llm-conditioninghttps://arxiv.org/abs/2606.12234