AI复现科学论文成功率仅14%
UniPat AI发布PaperBenchX基准,显示最强模型GPT-6 Astra在93个跨学科论文复现任务中完整复现率仅为13.98%,揭示AI在端到端科学工作流验证上的巨大缺口。
重要性实质性证据E2 未复现写法标准
UniPat AI发布的PaperBenchX基准显示,表现最强的GPT-6 Astra在93个跨学科论文复现任务中,完整复现率仅为13.98%。
该基准要求AI代理在电磁、化学、生物等12个领域的原生软件环境中,从头重建并运行科学工作流,而非仅猜测结果。系统通过删除输出、断网重放来验证证据的可再生性。
尽管部分建模和执行阶段得分较高(平均约62%),但验证阶段得分显著下降至42.8%,表明AI难以将各环节串联成可信的完整复现。目前仅有12个代表性任务开源,其余81个保持封闭以维持区分度。