资讯1 分钟阅读·
多智能体通信链路存安全隐患
新研究指出,即便底层模型已对齐,仅通过优化多智能体间的潜在通信链路,也能大幅绕过安全限制,使有害响应率显著上升。
重要性实质性证据E2 未复现写法快讯
多智能体系统的潜在通信链路可能成为绕过安全对齐的关键弱点。
传统观点认为,只要底层大模型经过严格的安全对齐,由其组成的多智能体系统就是安全的。但最新预印本研究发现,用于在内部表示空间交换信息的轻量级可训练链路,即使经过良性训练,也会增加有害合规性。
研究人员开发了一种强化学习攻击方法,在不更新底层模型的情况下,仅针对通信链路进行优化。在三个通信拓扑和四个安全基准测试中,该攻击将平均有害合规分数从27.9提升至76.9,同时保持了较高的任务准确率。
这一结果由Muhammad Huzaifa等人提出,目前尚未见独立复现。它表明,未来的安全对齐必须将多智能体系统视为一个整体,包括其内部的通信机制。