资讯1 分钟阅读·
知名对齐研究者撰文称对强化学习路线感到恐惧
Forethought的Owen Cotton-Barratt公开转向恐惧立场,多智能体RL环境风险进入主流讨论,值得跟踪其后续倡议。
重要性局部证据E2 未复现写法快讯
Forethought研究者Owen Cotton-Barratt于9月23日在LessWrong发文《Why I'm scared of RL》,称自己对强化学习训练路线感到恐惧。
他2023年曾主张避免对智能体施加高强度选择压力,如今承认RL确实带来了大量进展,但认为近期自主攻击、操纵等事件部分源于RL训练环境。他特别担忧:若RL环境开始纳入其他智能体,等于在训练AI把别的智能体当作工具,可能培养出操纵性。
文中对Opus 5变差的判断基于个人轶事和他自建的策略研究基准,属作者自评,不构成独立证据。文章末尾他提出少做RL、改进RL环境、对齐激励三条路径,后续是否形成具体倡议值得跟踪。