AI合成受访者
5 Schritte1 Beiträge8 Quellen
AI合成受访者——用大语言模型模拟人类回答问卷的"数字受访者"——正在被市场研究和政策分析行业当作快速、廉价的真人替代品,但2026年以来的多项同行评审研究一致表明:它们目前不能替代真实调查数据。
争议的核心不是模型能否生成"像问卷"的答案(显然能),而是这种替代何时有效、何时失效。韩国一项同行评审研究测得合成受访者误差达14至19个百分点,认为只能作诊断用途【背景:该研究于2026年10月发表】。另一项跨领域基准测试覆盖美国综合社会调查与世界价值观调查两个领域、四个模型,发现两类失败在所有模型上复现:个体层面没有任何LLM胜过最简单的统计基线;模型还系统性"过度决定"人口学属性,把身份对态度的预测力放大到远超真人。在细分市场定向任务中,模型会把群体间差距夸大两到四倍,一半的美国案例会指向错误细分。第三项心理测量审计(37个模型、立陶宛组织心理学数据集)结论类似:高斯copula基线在样本驱动指标上击败所有LLM,且更大的模型并未改善。
行业一方(如NIQ等研究机构)承认早期产品"令人信服但缺乏依据",主张用真实数据训练和验证;另一方(如Synthetic Respondents等创业公司)则直接以"6分钟、10美元替代4周、上万美元的传统研究"为卖点。定性研究者用实测指出:真人受访者会在追问下暴露"供应链紧张时宁可放弃可持续性"这类隐藏权衡,而合成受访者不会。
目前较有共识的边界是:合成受访者可作探索性、方向性用途,高风险决策仍需真人数据;尚无定论的是更丰富的persona构建或微调方法能否弥补这些失败。
Wie es dazu kam
NIQ发文讨论合成受访者在市场研究中的兴起,指出大量厂商仓促推出"令人信服但可能缺乏依据"的产品,提出优质合成模型的三项标准。
nielseniq.com ↗Merrill Research发表实测对比:合成与真人设计工程师都称可持续性重要,但真人追问后透露供应链紧张时优先供货,AI完全看不到这一隐藏权衡。
merrillresearch.com ↗心理测量审计论文《Plausible but Not Valid》提交arXiv:37个模型中无一在心理测量相似度上胜过统计基线,LLM样本不是人类调查数据的即插即用替代品。
arxiv.org ↗跨领域基准论文《When Synthetic Users Fail》提交arXiv:在GSS与WVS两个领域复现两类系统性失败,细分定向任务中模型会夸大群体差距两到四倍并指向错误细分。
arxiv.org ↗韩国团队同行评审研究发表:合成受访者误差达14至19个百分点,只能作诊断用途,替代真实问卷为时尚早。