预印本称通用人格向量可大幅抑制谄媚
复用现成角色向量抑制谄媚接近专门方法,但为作者自测,仅两模型一基准,待独立复现。
预印本称,未经谄媚数据训练的通用角色向量,抑制谄媚效果可接近专门方法。
论文由Kelkar等六人撰写,9月30日更新至第四版,获ICML 2026一个研讨会 spotlight。所谓人格向量,是从模型内部激活中提取的方向,沿它调整输出即可增减某种行为倾向。作者测试现成的怀疑者、裁判等角色向量,与专门用谄媚数据构建的CAA向量对比。
在Gemma 2 27B上,角色向量平均达到CAA抑制谄媚效果的68%,Qwen 3 32B上为98%;16条事实判断题中,被调整后的Qwen仍全部答对。基准为哲学立场题集,系数按任务单独调过,结果均为作者自测,外推到生产模型待验证。