获奖论文警告对齐技术正沦为审查工具箱
ICML获奖立场论文称对齐方法用途中立,可被国家或厂商用于审查,作者主张透明与模型多元应对。
原始事件 2026-09-28
这是一篇历史文章。正文中的预测、价格和后续节点均属于当时的时间范围。
一篇获ICML 2026杰出立场论文奖的文章警告:让模型「变安全」的对齐技术,同一套方法也能用来审查和扭曲信息。
作者Sarah Ball与Phil Hackemann指出,对齐方法本身用途中立——它让模型服从某个主体的意志,但不保证这个主体善意。他们把控制手段分为预训练数据过滤、后训练对齐和推理时干预三层,成本递减、改动变易。
论文称这不是假设:中国网信办要求模型维护拒答数据集,马斯克曾公开表示要「修正」Grok的输出,后续行为变化被追溯到系统提示词改动。作者不建议停止对齐,而是主张透明、可验证对齐与模型多元化。