NBER AI复现论文
3 ステップ2 件3 ソース
NBER工作论文W35782揭示,大语言模型(LLM)在批量复现经济学研究时,对近八成论文标记出结果出入。Matthew Schwartz、Isaiah Andrews与Jesse M. Shapiro开发的开源工作流,利用已发表的复现包对五本经济学期刊的4,452个案例进行自动重算、敏感性分析及算法优化。结果显示,3,460篇文章或其附录被标记存在差异,另有496篇通过不同实现方式将计算时间缩短10倍以上,923篇生成了符合原假设的新扩展分析。
这一发现挑战了传统学术复现的低效现状,但也引发争议:【存疑】被标记的“出入”究竟源于原论文的统计错误、代码缺陷,还是LLM对复杂经济学逻辑的理解偏差?目前尚无定论,需依赖专家逐项核验。Schwartz指出,当前LLM擅长处理“Claude-shaped”问题(即适合其编码与广度优势的定量计算),但在深层概念问题上仍需人类科学家引导,二者存在“阻抗失配”。
读者应关注后续是否有独立团队验证这3,460篇被标记论文的具体错误类型,以及该开源工具在更多学科中的误报率表现。
経緯
NBER发布工作论文W35782,介绍一种能复现、改进和扩展已发表经济学研究的LLM开源工作流。
wesearch.press ↗经济学家Tyler Cowen在Marginal Revolution撰文,详细披露该研究数据:4,452个复现包中3,460篇被标记结果出入。
marginalrevolution.com ↗Anthropic发布博客,作者Matthew Schwartz阐述“Claude-shaped science”理念,解释为何LLM在特定定量科学任务上高效但需专家把关。
anthropic.com ↗
未解決の問題
- 被LLM标记为“结果出入”的3,460篇论文中,有多少比例经人工复核确认为真实错误?
- 该开源工作流在非经济学领域的通用性及误报率如何?
- 学术界是否会建立针对LLM辅助复现的标准验证协议?