博主自测Jev监控思维链:快6倍但漏检更多
Jev格式把分类成本压低一个量级,但自测数据显示它对有害轨迹的识别不如主流模型,宜作信号跟踪。
原始事件 2026-09-23
一位LessWrong作者自测称,Jev格式模型做思维链有害监控时,平均延迟542毫秒,比Claude Sonnet 5的3348毫秒快约6倍,每千次分类成本0.056美元,比Sonnet的3.17美元低约566倍。
这是作者本人在2200条ReasoningShield数据集轨迹上跑的第一方基准,未经独立复现。精确匹配准确率上Jev为71.5%,与Sonnet的71.4%持平,低于GPT-5.6 Luna的79.4%。
关键短板在有害侧:作者自己承认,Jev识别真正有害思维轨迹的表现差于Sonnet和Luna,而正确识别危害比减少误报更有价值。快和便宜换来的是漏检风险,标题里的倍数只对无害侧成立。