多智能体通信链路存安全隐患
多智能体系统的潜在通信链路可能成为绕过安全对齐的关键弱点。
传统观点认为,只要底层大模型经过严格的安全对齐,由其组成的多智能体系统就是安全的。但最新预印本研究发现,用于在内部表示空间交换信息的轻量级可训练链路,即使经过良性训练,也会增加有害合规性。
研究人员开发了一种强化学习攻击方法,在不更新底层模型的情况下,仅针对通信链路进行优化。在三个通信拓扑和四个安全基准测试中,该攻击将平均有害合规分数从27.9提升至76.9,同时保持了较高的任务准确率。
这一结果由Muhammad Huzaifa等人提出,目前尚未见独立复现。它表明,未来的安全对齐必须将多智能体系统视为一个整体,包括其内部的通信机制。
信息源:arxiv.org