激活导向失效
4 节点1 篇4 来源
苹果与庞培法布拉大学联合研究指出,曾被视为轻量级控制大模型输出的“激活导向”(Activation Steering)技术在指令微调模型上效果显著下降,且常以牺牲生成流畅度为代价。【背景】此前IBM等机构大力推广该技术作为RLHF或全量微调的低成本替代方案,但新研究发现其有效性高度依赖模型训练范式:在基础模型上尚可,但在经过指令微调的生产级模型中往往失效。此外,简单的提示词工程和监督微调在概念注入上优于激活导向,但在概念移除(如去毒性)任务上表现不佳。这一发现挑战了业界对低成本推理时干预手段的乐观预期,表明目前尚无一种方法能同时兼顾高效、可控与高质量输出。
事情怎么走到这一步
IBM发布预印本论文《Programming Refusal with Conditional Activation Steering》,推出通用激活导向库,主张通过修改内部激活值来低成本控制模型行为。
github.com ↗苹果机器学习团队发表博客介绍“激活传输”(AcT)框架,试图通过最优传输理论解决传统向量式激活导向导致的分布外偏移问题,强调其计算开销低。
machinelearning.apple.com ↗苹果与庞培法布拉大学提交arXiv论文《On The Effectiveness-Fluency Trade-Off In LLM Conditioning》,系统评估多种条件化方法。
arxiv.org ↗上述研究结论被媒体广泛报道,确认激活导向在指令微调模型上效果大减,且困惑度(Perplexity)不能可靠反映生成质量。
machinelearning.apple.com ↗
还没定论的部分
- 是否存在能同时在指令微调模型上保持高有效性与高流畅度的新型轻量级干预方法?
- 廉价文本指标(如Type-Token Ratio)能否完全替代昂贵的LLM-as-judge评估体系?
- 对于概念移除任务(如去除毒性),是否有比激活导向更优的非微调解决方案?