新指标量化推理冗余,重复识别准确率高基线逾10点
论文提出Step-RRI指标量化推理冗余,并用于微调数据选择提升推理效率,结果为作者自测。
一篇9月30日提交的论文提出Step-RRI指标,在PRMBench数据集的冗余类别上,步骤级冗余识别准确率比嵌入相似度和信息增益两类基线高出逾10点。
该指标来自SLIDER框架:用信息论中的部分信息分解,把相邻两个推理步骤对最终答案的信息拆成独有、冗余与协同三部分,冗余占比高即判定为重复推理。论文称轨迹级版本与QwQ-32B、DeepSeek-R1-Distill-Qwen-32B和GPT-4.1的实际推理长度强相关。
作者还演示按该指标挑选微调数据可提升推理效率、基本不损任务表现。论文已被ICLR 2026大模型逻辑推理工作坊接收,评测为作者自测,覆盖范围限于该冗余数据集。