资讯1 分钟阅读·
引文真实仍难判论文新颖性
NovGauge 测试 18 个模型:引文真实且方向正确,超 70% 正面证据仍不足以支持新颖性。
即使引文真实、结论方向正确,超过 70% 的正面证据仍不足以在逻辑上支持论文“具有新颖性”。NovGauge 用 619 对论文和 50 组多论文材料测试 18 个模型的新颖性判断,作者报告幻觉率介于 0% 至 39%,最佳 Verified F1 约为 43% 至 72%。
此前判断新颖性依赖引文是否真实、结论方向是否正确,但这一标准会漏掉大量逻辑上不成立的正面证据。
该测量由作者自测:619 对论文、50 组多论文材料、18 个模型,幻觉率 0% 至 39%,最佳 Verified F1 约 43% 至 72%。
这是作者构建、尚未独立复现的预印本基准,适合检验引文是否支持结论,不能外推为所有 AI 文献综述的准确率。