DeepMind研究所发文:可见思维链是安全优势,OpenAI系统卡已报告可监测性下降
OpenAI系统卡自报可监测性下滑,DeepMind研究所借此呼吁定期测量;该盯各厂会否把测量变成常规披露。
原始事件 2026-09-18
资料核对时间:2026/09/18 23:39
这是一篇历史文章。正文中的预测、价格和后续节点均属于当时的时间范围。
Google DeepMind新设的DeepMind研究所发布首批文章,研究者Rohin Shah与Anca Dragan主张,模型以自然语言写出中间推理步骤(思维链)是关键安全优势,便于发现欺骗或问题计划,并呼吁业界定期测量思维链的可监测性、保留透明架构、防止模型学会隐藏真实推理。这是实验室立场论述,非独立验证结果。文章引述OpenAI为GPT-6 Astra发布的系统卡,其中已报告思维链可监测性显著下降;这一下滑出自厂商自述文件、经作者转引,并非独立测量。