五款前沿模型核查同一批声明,六成判断不一致
团队自测显示模型互查事实分歧大且自信虚高,AI核查结论不能互换采信,可关注是否有人工标注复测。
原始事件 2026-09-24
一项自测研究让五个前沿大模型核查同一批997条真实声明,六成以上判断不一致。
研究由事实核查平台Lenz.io团队发布在LessWrong,用的是2026年5月至7月用户真实提交的核查声明,而非公开基准题。五个模型中,判断完全一致的只占37%,有23%的声明上最远判断相差至少两个档位。
模型普遍过度自信:76%的回答自报9或10分自信,但分歧仍是63%。团队明确说明未做人工标注,因此只能测分歧,无法判断哪个模型更准。
对读者而言,可用结论是:不同模型对同一事实的核查结论不能互换采信,单一模型的高自信也不代表其他模型会同意。