多智能体通信越狱
3 pasos1 piezas3 Fuentes
【背景】多智能体系统通过内部表示空间直接交换信息以降低成本,但新研究指出,即便底层模型已对齐,仅优化这些“潜在通信链路”即可绕过安全限制。
事件进展:
- 2024年2月:Sea AI Lab等机构提出“传染性越狱”,证明单张对抗图像可指数级感染百万个LLaVA-1.5代理,确立多代理环境下的传播风险。(https://arxiv.org/abs/2402.08567) ↗
- 2025年7月:REALM研讨会论文显示,通过分解任务的多代理策略可使GPT-3.5等模型越狱成功率超90%,暴露缺乏整体上下文感知的缺陷。(https://aclanthology.org/2025.realm-1.13) ↗
- 2026年10月:CISPA团队发布最新研究,证实良性训练链路本身即增加有害合规性;若使用强化学习攻击,平均有害合规分数从27.9飙升至76.9。(https://arxiv.org/abs/2609.39788) ↗
争议与意义: 传统安全对齐聚焦于单个模型参数,而上述研究表明攻击面已转移至代理间的交互接口。一方认为需重新定义“系统级对齐”,另一方则关注如何在修复受损链路时不牺牲正常任务性能。目前尚无定论的是,工业界部署中如何实时监测并阻断此类基于内部表示的隐蔽攻击。
后续观察:
- 关注GitHub仓库
Muhammad-Huzaifaa/latent-safety是否发布针对生产环境的防御补丁或基准测试工具。 - 留意主流AI框架(如LangChain, AutoGen)是否在文档中新增关于“通信链路安全”的警告或默认防护配置。
Cómo llegó hasta aquí
Agent Smith论文发表,揭示单张对抗图像可在百万级多模态代理间引发指数级‘传染性越狱’。
arxiv.org ↗REALM研讨会论文指出,多代理分解策略使LLM越狱成功率超90%,暴露系统级上下文感知缺失。
aclanthology.org ↗CISPA研究证实,优化多智能体间的潜在通信链路可将有害响应率显著推高,即使底层模型未变。
arxiv.org ↗