Anthropic选定埃森哲为首家嵌入式安全评估方,放慢AI发展计划落地第一步
Anthropic于9月18日宣布,选定埃森哲旗下AI业务Faculty的员工作为首家嵌入式评估方进入公司内部,负责测试安全防护、对模型做红队测试,并评估模型行为是否符合人类价值观。这是CEO Dario Amodei上周六发布的三步放慢AI发展计划
原始事件 2026-09-18
Sources checked:09/19/2026, 05:52 · Original article in Chinese
Anthropic于9月18日宣布,选定埃森哲旗下AI业务Faculty的员工作为首家嵌入式评估方进入公司内部,负责测试安全防护、对模型做红队测试,并评估模型行为是否符合人类价值观。这是CEO Dario Amodei上周六发布的三步放慢AI发展计划中第一步的首次具体落实——该步骤允许第三方评估者以员工级别权限核查安全实践并报告事故。据公告,Anthropic与埃森哲各自承诺未来五年投入至少10亿美元用于该领域能力建设,现阶段由Anthropic直接支付费用,长期则希望改由共同资金池或政府资金承担。合作不具排他性,Anthropic称正与研究机构METR等第三方洽谈。公司强调模型安全责任仍在自身,嵌入式评估不会降低其问责。需要留意的是,评估方由Anthropic自行选定并出资,业界已有公开信要求真正独立的评估者,此举亦正值Anthropic被广泛预期筹备IPO之际,该机制的实际效力尚待观察。原文:CNBC ↗、Anthropic公告 ↗、Amodei原文 ↗