资讯1 分钟阅读·
大模型模拟用户调研失效
新基准显示,用大模型模拟人类问卷回答时,其准确性不及传统基线,且会夸大群体差异。
重要性实质性证据E2 未复现写法快讯
大模型在模拟人类问卷回答时表现不佳,无法超越基于真实数据训练的传统非LLM基线模型。
该研究由Zihan Chen等人完成,测试了四个不同能力等级的大模型,涵盖美国社会态度(GSS)和跨文化价值观(WVS)两个领域。结果显示,模型系统性地高估了人口统计学特征对态度的预测力,导致在细分目标定位任务中,群体间的差异被夸大了两到四倍。
这意味着依赖大模型生成“合成用户”数据进行市场或政策决策的团队,可能会错误地锁定目标群体。目前该结论出自预印本论文,尚未经过同行评审或独立复现。