资讯1 分钟阅读·
可解释性工具有了新考场,幻觉率首次被强制计分
研究者自建并开源WorkspaceBench测激活读取工具,属作者自评基准,能否被业界采用待观察。
重要性局部证据E2 未复现写法快讯
可解释性研究者发布并开源WorkspaceBench,专门测激活到文本工具能否读出模型全局工作区的内容。
基准含3356道题、27个评测族,覆盖安全、逻辑推理与多跳计算,并单独设幻觉评测,因为J-lens可靠但只输出单token,NLAs表达力强却易虚构。
基准针对Qwen-3.6-27B开发,作者承认未完全排除从提示词反推的捷径。这是作者自建自评的基准,能否被独立采用仍是未知数。