AI记账任务超过持证会计师,完整结账仍做不到
在APEX会计基准的简化任务上,AI如今几乎全部做对,而已超过12名平均5.5年经验的持证会计师约37%的平均得分——这是Mercor自建研究给出的对比。
此前18个月,最好的模型还低于人类会计师这一水平,替代能力一直停留在人类之下。
但在包含10家模拟公司、160项任务的完整APEX基准上,领先的Claude Opus 5.5只满足61.8%的评分标准,Fable 5.1为61.0%,GPT-6 Astra为57.9%,Mercor称近60%的任务没有任何模型完全解决。
Mercor承认这些任务测的正是AI擅长的细节检索与指令遵循,未覆盖客户沟通、同事协作和多年积累的业务上下文。
信息源:mercor.com