选项名称语义干扰
2 steps1 pieces1 Sources
【背景】大语言模型在结构化决策任务中常出现“类型安全但逻辑错误”的现象,其核心原因在于模型过度依赖选项名称的语义线索,而非绑定的定义。
最新预印本《Type-Safe Is Not Error-Free》显示,当仅改变选项名称与定义的映射关系时,Jev及两个开源权重模型的决策翻转率显著上升。在1200个决策任务中,使用“yes/no”作为选项名称比使用“0/1”控制组导致的决策翻转率高出最多70.4个百分点。更严重的是,这种语义干扰使模型的平均AUC从93.8%骤降至低于随机水平的23.2%,尽管输出的类型错误率始终为0%。这表明,即使输出格式完全符合规范,模型仍可能因名称的极性暗示而违背显式定义。
这一发现挑战了传统观点,即认为只要约束输出结构即可保证决策一致性。争议在于:是应通过架构调整(如强制提取特征后由确定性规则决策)来消除名称干扰,还是需在训练阶段强化对定义文本的关注?此前另一项针对LLM偏见的研究指出,权威和框架偏差远超人口统计偏差,且结构化分解可将翻转率降低高达100%,这为解决名称语义干扰提供了潜在路径。
后续需关注:1. 该预印本是否被主流AI安全基准采纳;2. 是否有新研究量化“名称极性”在不同领域(如医疗、法律)的具体影响阈值;3. 开发者是否在提示工程中引入“中性命名”标准以规避此类干扰。
How it got here
Yu Sun等人提交预印本v1,提出类型安全的决策模型仍受选项名称语义干扰。
arxiv.org ↗预印本更新至v3,确认在1200个任务中,“yes/no”名称相比“0/1”控制组导致最高70.4个百分点的决策翻转率增加。
arxiv.org ↗
What is still unsettled
- 如何在不牺牲可读性的前提下,设计对模型无偏见的选项命名规范?
- 结构化分解(LLM提取+规则决策)是否能完全消除名称语义带来的AUC下降?
- 该现象在多步推理或复杂状态空间中的表现是否与二元决策一致?
Sources
Coverage in this topic
- Type Safety Does Not Ensure Logical Correctness
New preprint reveals LLMs often follow option name semantics over definitions, causing high decision flip rates.