DeepMind研究所发文:可见思维链是安全优势,但透明性正在流失
Google DeepMind新设的DeepMind研究所发布首批文章,研究者Rohin Shah与Anca Dragan主张,模型以自然语言写出中间推理步骤(思维链)是关键安全优势,便于发现欺骗或问题计划;他们呼吁业界定期测量思维链的可监测性、保留透明架构,并防止模型学会隐藏真实推理。文章同时引述称,OpenAI为GPT-6 Astra发布的系统卡已报告思维链可监测性显著下降。这是实验室立场论述,非独立验证结果。
信息源:the-decoder.com