资讯1 分钟阅读·
CommentBench:最强模型也只能匹配8.3%的人类AI安全评论要点
作者自建基准显示模型评论与人类要点匹配率最高仅8.3%,OpenAI模型意外偏弱,结果为署名第一方数据,可作追踪刻度。
重要性局部证据E2 未复现写法快讯
Oscar Gilg与Hasan Baig于9月19日在LessWrong发布CommentBench基准:从LessWrong、EA Forum帖子、shortform及私人Google Doc研究草稿中提取2,847个人类评论要点,让各前沿模型写评论,再用Opus 5作裁判判断匹配。结果是Fable 5最佳,匹配8.3%的要点,Fable 5.1为7.5%,Opus 5为6.3%;OpenAI的GPT-6 Astra(5.5%)与GPT-5.6 Sol(5.3%)明显低于其在其他能力基准上的表现。作者检验了记忆效应,模型在知识截止前发布的文档上并无一致优势。需要说明的是,这是作者自建、自评的第一方基准,匹配判定本身依赖Opus 5,作者也承认一旦模型评论质量追平人类,人类评论就不再是好的质量信号;他们计划将该基准选择性分享给AI实验室作为held-out评估。对关注AI加速能力研究的读者,8.3%这个数字本身就是一个可追踪的刻度。
原文:CommentBench: Can Models Match Human Comments on AI Safety Posts? ↗