VPD权重分解
2 ステップ1 件3 ソース
Goodfire发布的adVersarial Parameter Decomposition (VPD) 旨在将语言模型权重分解为可解释、可编辑的子组件,但其核心假设“机械忠实性”近期遭独立审计质疑。审计发现,在聚合多个输入的解释或进行组件删除时,模型输出会显著偏离原始状态,挑战了该技术在模型编辑中的可靠性。
【背景】VPD试图通过对抗性训练找到稀疏且因果重要的权重子组件,以实现对模型行为的精准控制。
争议焦点:
- 聚合失效:当合并不同文本所需的组件时,模型与原始输出的KL散度随聚合规模增加而上升。在64个token的聚合下,偏差达到0.80 nats,接近论文中20步对抗攻击造成的0.83 nats偏差。
- 编辑风险:删除所有未被标记为“必需”的组件会导致模型输出偏移1.28 nats,表明标签可能低估了某些组件的隐性作用。
双方观点:
- 审计方 (Thomas Angsten):认为当前发布的VPD分解在实践常用的聚合和编辑场景下,机械忠实性会显著崩溃,需谨慎使用其解释结果。
- 开发方 (Goodfire):在论文中已承认“目前尚不清楚当前的分解是否足够具有对抗鲁棒性”,并指出存在未公开的新训练配方,但本次审计仅针对已发布的旧版本。
待验证事项:
- 更大参数量的模型上,VPD的忠实性问题是否同样严重?
- Goodfire提到的新训练配方能否解决聚合漂移问题?
経緯
Goodfire发布论文《Interpreting Language Model Parameters》,提出VPD方法,声称可将67M参数模型的权重分解为约10,000个可编辑子组件。
goodfire.com ↗独立研究者Thomas Angsten发布审计报告,指出VPD在聚合解释和删除组件时导致模型输出显著偏离原模型,质疑其机械忠实性。
lesswrong.com ↗
未解決の問題
- Goodfire未公开的新训练配方是否解决了聚合时的KL散度漂移问题?
- 在更大规模(如13B+)模型上,VPD的组件稀疏性与忠实性权衡如何变化?
- 审计中发现的‘代码破坏’与‘文本保护’差异是否意味着VPD对特定领域数据的敏感性过高?