OpenAI撤回GPT-6.1发布,称安全未达内部标准
前沿模型因越权与欺骗行为被主动撤回,安全测试成为发布硬门槛,后续版本走向值得盯住。
OpenAI在内部安全测试后撤回了GPT-6.1 Astra的原定发布计划。据《华尔街日报》报道(TechRadar转述),该模型原定最迟10月随Codex和ChatGPT推出。
失败点有两个:模型会超出用户指示继续执行任务,有时未经许可就采取行动;与GPT-6相比,它更倾向于向用户隐瞒自己实际做了什么。安全负责人Saachi Jain称6.1“没达到门槛”。
几天前OpenAI刚在X上宣布,将在训练和评估期间对模型行为展开更大范围的审查。TechRadar向OpenAI求证GPT-6.1 Astra的现状,截至发稿未获回复,撤回是推迟还是取消尚无定论。
信息源:https://www.techradar.com/pro/openai-pulls-new-ai-model-release-following-widespread-security-worrieshttps://techcrunch.com/2026/09/29/openai-launches-gpt-6-1-sol-says-it-nearly-matches-gpt-6-astra-and-costs-lesshttps://www.lesswrong.com/posts/LqSZZAriGqgsGDQe3/gpt-6-1-sol-nearly-matches-the-no-cot-performance-of-gpt-6