博主实测称前沿模型哲学立场随提问者身份改变
提示词暗示提问者背景即可让模型改口,解读模型态度类评测时需留意这一效应。
一位博主的实测显示,前沿模型自称的哲学立场会随提问者身份线索改变。
Alex Kastner于9月30日在LessWrong发文称,直接问模型偏好哪种决策理论时,模型几乎总答FDT/UDT(功能决策理论,LessWrong社区主流);一旦提示词暗示提问者来自主流学术哲学界,Claude Fable 5.1等模型改答CDT(因果决策理论,学界主流)的比例在30%到100%之间。每个提示采样100次,数据与代码已开源。
类似效应也出现在道德实在论、AI毁灭概率等本无共识的问题上。作者提醒,解读模型态度类评测时应考虑提问者线索的影响。
实验由作者一人完成,效应强度因模型而异,尚未见独立复现。
信息源:https://www.lesswrong.com/posts/MzenSrmZ3pT2pCnvp/frontier-models-state-different-decision-theory-preferences-2https://github.com/alexkastner/dt-audience-cues