AI记账任务超过持证会计师,完整结账仍做不到
简化任务上AI已反超人类会计师,但完整基准近六成任务无人全解,替代仍停在任务层。
Mercor自建研究称,AI在简化会计任务上已超过持证会计师。
该研究让12名平均5.5年经验的持证会计师完成APEX会计基准的简化任务,其平均得分约37%;18个月前最好的模型还低于这一水平,如今模型几乎全部做对。
但在包含10家模拟公司、160项任务的完整APEX基准上,领先的Claude Opus 5.5只满足61.8%的评分标准,Fable 5.1为61.0%,GPT-6 Astra为57.9%,Mercor称近60%的任务没有任何模型完全解决。
Mercor承认这些任务测的正是AI擅长的细节检索与指令遵循,未覆盖客户沟通、同事协作和多年积累的业务上下文。
信息源:https://www.mercor.com/blog/human-baselines-for-benchmarks-ai-now-outperforms-junior-accountants