资讯2 分钟阅读·
Anthropic承诺让外部评测者进入内部流程,OpenAI口头跟进
承诺可核验,减速谈不上;盯评测者人选、独立披露权与日志权限是否落实。
Dario Amodei 呼吁前沿模型公司放慢能力提升,方案分三步:第三方评测团队获得持续、接近员工级的访问权限;推动美国公司形成共同安全标准;再寻求国际协调。Anthropic 承诺先做第一步,允许外部团队使用办公室、公司设备和接近内部风险团队的权限,并保留发布关键发现的权利。目前这是公司自述的承诺;OpenAI 部分只是 Sam Altman 的表态。
组织承诺可以核验;6 至 12 个月的灾难预测无法验证,谈不上行业减速。访问受法律、合同、客户隐私和商业敏感信息限制,商业敏感信息由公司自行认定;行业协同要处理反垄断问题,跨国约束没有执行机制;对手不跟进,单边减速就让出份额。
治理从发布后测试移向训练流程内的持续监督。能否落地,取决于评测机构是谁、合同是否允许独立披露、评测者能接触哪些训练与事故日志,以及承诺是否真的改变模型发布时间。