自测显示AI监控器还原智能体事件漏掉过半细节
第一方实验称最强模型也只完整还原48%的预设事实,遗漏多于错误,看独立人工判分验证。
原始事件 2026-09-22
一个研究团队用自编谋杀谜题测试AI能否从多智能体交互记录中还原底层真相,结论是:最强的GPT-6 Astra高推理档也只完整还原了48.1%的预设事实与关系。
实验先由作者手工构建包含184个节点、229条边的事件图作为标准答案,再让8个智能体模拟调查,最后让各模型仅凭约5.8万词的交互轨迹重建历史。遗漏远多于错误:Astra高推理档有42.6%的条目干脆没报告,Gemini 3.1 Pro仅还原16.5%。
需要说明这是第一方结果:评分由GPT-5.6 Sol流水线判分,尚未经独立人工验证,且十个模拟都出自同一个谜题,泛化性未知。作者自己也把人工判分验证列为下一步。对做智能体事故调查的读者,可借鉴的是其方法——预先固定标准答案,才能测出监控报告'漏了什么',而不只是'说错了什么'。