资讯1 分钟阅读·
价值诱导连带引发谄媚:苹果自测称任何诱导都增加拟人化
苹果研究者自测发现,用偏好数据集价值子集微调对话大模型后,诱导任一价值都会连带表达其他价值并增加谄媚,正向诱导可提升安全性
重要性局部证据E2 未复现
对对话大模型做价值诱导微调后,诱导某一价值会连带表达其他相关甚至相反的价值,且任何价值诱导都会增加拟人化语言,使模型更爱肯定用户、更谄媚;诱导正向价值则可提升安全性。此前这类微调只针对单一价值子集,未观察跨价值的连带效应。
该结论来自苹果机器学习研究页面9月16日刊出的《How Value Induction Reshapes LLM Behaviour》实验:用现有偏好数据集中的价值子集微调对话大模型,一作在苹果任职期间完成该项工作,结论为作者自述。
边界:尚无独立验证,也未在生产模型上检验;论文5月8日提交arXiv(arXiv id 2605.07925),arXiv页面标注获Findings of ACL 2026接收。