阿波罗研究提出嵌入式评估原则,落实程度决定成效
评估机构Apollo Research发布嵌入式评估原则提案,主张按预先固定的安全声明逐项核查,能否被开发商采纳待观察。
前沿AI安全评估机构Apollo Research于9月30日发布嵌入式评估原则提案,称评估成效取决于访问权、资源与结论的实际分量。
提案核心是“声明式评估”:不笼统评判开发商,而是逐项核查预先固定的具体声明,例如“模型在内部部署中从未试图关闭或规避监控”。每项声明以五档结论收尾,访问不足得最差档,开发商自报的问题好于评估方查出的问题,且开发商不能否决结论。
提案同时主张默认公开发布报告,评估方的结论永远不可删改;并称自愿承诺大概率不够,嵌入式评估最终应由法律强制。这是评估机构单方提案,尚无开发商表态采纳。
信息源:https://www.apolloresearch.ai/blog/principles-for-embedded-evaluationshttps://www.lesswrong.com/posts/jD32DPYdZEcyLZqto/principles-for-embedded-evaluations