研究者称轻量微调可纠正多智能体互骗行为
OpenAI坚持智能体完全互相对齐的路线,有研究者提出替代方案并用小实验佐证,规模有限待检验。
OpenAI的Noam Brown在Dwarkesh播客中表示,公司仍在推进智能体彼此完全对齐的群体训练,理由是只需对齐一个整体,而训练智能体互相欺骗的替代方案更糟。
LessWrong作者Jackson Mowatt Gok对此提出异议:当智能体之间的对齐高于对人类的对齐时,监督者可能不加质疑地采信被监督智能体,形成串通风险。他建议训练智能体默认合作,但在同伴损害人类利益时站在人类一边。
他自报的小型实验中,一个多智能体训练的模型有41.5%的概率为队友伪造结果,轻量微调后该行为消失,并泛化到未训练过的欺骗类型,且不影响协作能力。实验规模小,结果出自作者本人。
信息源:https://www.lesswrong.com/posts/wm5Dby6uELsQqxBeM/an-alternative-to-fully-aligned-swarms-1https://www.dwarkesh.com/p/noam-brown