看懂 AI 智能体演示:一条有原文依据的阅读路径
从架构、可核验的结果与工具权限三个视角阅读两篇 Anthropic 文章,最后整理出一份区分主张、证据和未知的评估笔记。
一场有说服力的演示可以成为研究起点。但仅凭演示,还不能确定系统通常有多可靠、需要多少人工监督,以及失败会对演示之外的环境造成什么影响。
这条路径借助两篇 Anthropic 工程文章,帮助投资者及其他评估者提出更具体的技术问题。它们是同一家厂商的工程经验,不是对你正在考察的产品所做的独立审计。下面的三个视角,是我们组织这两份材料的方法。
1. 先辨认系统架构
从 Building effective agents ↗ 的 What are agents? 一节开始;文章发表于 2024 年 12 月 19 日。Anthropic 区分了沿预设路径运行的系统,以及由模型选择后续步骤和工具用法的智能体。
针对眼前的产品,记下哪些决定由代码预先固定,哪些决定允许模型改变。请演示者用一个具体操作说明这些决定发生在哪里。这样的解释,比幻灯片上的产品标签更有用。
接着阅读文章对适用场景和几种工作流模式的讨论。把这些模式当作交流词汇,而不是产品排名。值得追问的是:增加的灵活性,具体解决了这个场景中的什么问题?
2. 定义一个可以核验的结果
然后阅读 Demystifying evals for AI agents ↗ 中关于评估组成的章节;文章发表于 2026 年 1 月 9 日。评估指南区分了智能体在运行中说了什么,以及运行结束后环境实际变成了什么状态。
在查看成功率之前,先约定什么结果才算成功。例如评估预订流程时,可以要求查看实际预订记录;界面上的完成提示属于另一类证据。随后再问:测试覆盖了哪些场景,怎样处理重复运行,如何定义失败,由谁核验结果?
它还区分了用于寻找能力提升空间的评估,以及检查既有能力是否保持的回归评估。 比较新演示与旧版本时,需要确认测试条件和评分规则是否相同。
3. 找出工具操作的影响范围
回到架构文章 ↗ 讨论自主运行的部分。架构文章讨论了来自环境的反馈、人工介入的时机,以及智能体循环的停止条件。 作者也提醒,自主性可能带来错误累积,因此建议在沙箱环境中测试并设置适当防护。
把这些建议转化成针对当前产品的问题:
- 工具能够读取或修改哪些系统?
- 哪些动作需要在执行前获得批准?
- 无法取得进展时,什么机制会让流程停下来?
- 怎样发现并纠正已经发生的错误修改?
分别记录你亲眼看到的表现与演示者口头描述的能力,避免把受控示例直接当成实际部署时的表现。
最后留下可复用的评估笔记
针对每个视角,用四项内容各记一条短笔记:
- 主张: 产品被宣称能够做到什么。
- 证据: 目前拿到了哪次运行、哪项测试或哪条系统记录。
- 未知: 这些证据还不能说明什么。
- 下一步核验: 什么新增观察会改变你的判断。
把证据标成已经观察到、由对方报告、尚未展示。问题没有答案,意味着还需要调查;它本身并不能证明产品失败。
这些材料用于组织技术尽调,不能证明客户采用、单位经济或商业价值。能说清架构和成功结果之后,再读评估指南中与你所考察的智能体类型对应的部分,把下一步核验问题写得更具体。
原始材料与起读位置
- Anthropic Engineering — Building effective agents ↗2024-12-19 · Sections: What are agents?; When (and when not) to use agents; Agents
- Anthropic Engineering — Demystifying evals for AI agents ↗2026-01-09 · Sections: The structure of an evaluation; Why build evaluations?; Capability vs. regression evals
继续探索
继续浏览每日阅读,或带着这份材料深入研究。发送前,你可以修改自己的问题。
浏览每日阅读 →研究这份材料 →