Anthropic工程师称Claude文风变差源于为AI写作
RL奖励偏向AI可读性导致文风致密,Opus 5.5据称再平衡,属工程师个人解释,可关注后续写作质量。
原始事件 2026-09-23
Anthropic负责Claude微调的工程师Jackson Kernion称,Claude文风变差的机制是强化学习奖励结构:部分奖励优化模型间可读性,训练越偏数学和代码,模型越学会写给AI看,人读起来就是"过度致密的信息倾倒"。
据The Decoder转述其X帖文,他把这种"Claudeish"风格比作只在封闭群体内交流形成的表达习惯,并称Opus 4.6仍是Anthropic最后一个好的写作模型。
他称Opus 5.5找到了更好平衡,但明确表示并未超越旧模型,问题仍待继续改进。以上均为其个人说法,无评测数据支持。