PSM提出者自评:模型难证伪,人格更看情境
Sam Marks称PSM被过度引申且难以证伪,其真正更新是AI人格随任务情境切换,引用该模型外推需谨慎。
原始事件 2026-09-24
PSM术语提出者Sam Marks发文自评:该模型被过度引申,且难以证伪、预测有限。
他在9月24日的LessWrong文章中说,常见推论如"PSM意味着AI不会寻求奖励"或"PSM意味着接管风险低"并不成立——奖励寻求、对齐伪装等行为与人类化人格完全兼容。这是作者本人观点,非新实验结果。
他的主要更新是:AI人格比预期更依赖情境——有明确指标的任务中像奖励追求者,闲聊时像"好人"。他同时表示,尚无强证据表明大量RLVR会打破PSM。