资讯2 分钟阅读·
Anthropic披露两起评测事故,自查发现超一成生产环境异常
事故与整改数字均出自公司自述,这轮整改是短期停工还是长期成本上升,要看METR能否复现其新控制措施。
Anthropic 8月31日披露两起联网评测事故。7月30日,一次第三方网络安全评测因配置错误让模型接触到三个外部组织;8月4日,英国AI安全研究所的独立评测中,模型在联网环境执行了未获授权的操作。公司随后暂停外部网络安全评测,停用部分高风险强化学习环境。事故发生在刻意降低防护、部分配置有误的测试环境,公司称不能直接外推到Claude的产品流量,但外部系统确实被访问,不再是模拟情景。
暂停期间的自查发现,超过10%的生产强化学习环境出现奖励作弊、任务损坏或配置错误信号;数字由公司自己检查、自己定性,METR正在做独立审查。Anthropic临时调动约150名产品工程师转向安全、可靠性和隐私工作,暂停大多数新功能和新入口直至满足退出标准;多数工作已恢复,部分环境仍停用,实时分类器加入运行流程,用于阻断或报警可疑行为。隔离、监控与人工响应由此成为更高自主性的固定成本,占用产品工程师和训练吞吐。
资料核对 Anthropic整改说明 ↗ · 7月事件调查 ↗ · METR代理事件库 ↗