Mercor会计基准
5 steps1 pieces5 Sources
【背景】Mercor发布的APEX基准测试旨在量化AI在知识工作中的实际生产力。最新数据显示,在简化的结构化会计任务中,Claude Opus 5等模型以100%准确率和低于10分钟的耗时,大幅超越平均得分37%的人类持证会计师,单次评分标准成本仅为人类的约1/50。
然而,这一“完胜”仅局限于特定场景。在包含160项任务、模拟真实企业环境的完整APEX会计基准中,表现最佳的模型得分仅为61.8%,且近六成任务无人能完全解决。这表明AI目前擅长的是指令遵循与数据检索,而非需要专业判断、客户沟通及多步骤规划的完整“结账”流程。
争议核心在于“任务层”与“职业层”的错位:一方认为AI已具备替代初级分析师的能力并带来巨大效率红利;另一方(包括Mercor研究者)强调当前测试未覆盖非结构化工作,AI仍需人类监督才能交付可用成果。未来需关注模型在多步长程任务中的成功率突破,以及行业对“人机协作”新标准的定义。
How it got here
TIME报道Mercor发布APEX指数,GPT-5在综合知识工作中得分为64.2%,但仅两项任务获满分,指出其难以处理开放式问题。
time.com ↗AOL报道Mercor CEO Brendan Foody称,尽管AI代理在咨询任务首次尝试成功率不足25%,但进步迅速,预计年底可达50%。
aol.com ↗The Decoder披露完整APEX会计基准结果:Claude Opus 5.5领先(61.8%),但无模型能独立解决近60%的任务,强调仍需监督。
the-decoder.com ↗Mercor官方博客发布人类基线研究,确认AI在简化记账任务上反超人类,但完整结账仍无法独立完成。
mercor.com ↗The420.in详细对比数据:Claude Opus 5在20次尝试中获100%分,成本$0.21/项,而12名CPA平均37%分,成本$10.35/项。
the420.in ↗