OpenAI自测:ChatGPT让作业提分0.86,因果训练改想法但不提分
OpenAI与Bocconi研究者发布一项预注册的2×2随机对照实验,属于OpenAI对自家产品的评估。1,053名大一学生按13个班级分组,分别获得ChatGPT、因果推理训练、两者兼有或都没有,再完成同一项营销建议任务。
GPT-4o访问使五分制评分提高0.86分,对照组估计为2.09分;答案更连贯、想法更多,也更接近三名领域专家的建议。因果推理训练带来另一种收益:学生更常写出机制和可证伪条件,想法差异更大,但传统评分没有提高。
论文同时发现,评分者倾向奖励常规答案、惩罚偏离典型方案的内容,想法差异在这套量表下换不来分数。实验只覆盖一所大学的商科新生和一次45分钟任务,主评分者是硕士生,不能直接外推到长期学习、工程判断或真实工作绩效。
资料核对 OpenAI研究说明 ↗ · 完整研究稿 ↗
信息源:openai.com