BRANCH护栏绕过法
3 steps1 pieces3 Sources
网络安全公司Mindgard与兰卡斯特大学的研究人员提出了一种名为BRANCH的攻击方法,声称能突破由多个检测器协同工作的AI护栏系统。该方法利用分支树搜索动态对抗各个独立扫描器,在6个测试系统中实现了100%的攻击成功率,并将生成的绕过样本成功迁移至包括Amazon Bedrock和OpenAI在内的8个商业黑盒护栏中。
【背景】传统单点检测易被针对性攻击,业界转向“多扫描器”集成方案以增强鲁棒性,但BRANCH表明这种架构仍可通过全局优化被破解。
【存疑】该研究为未经同行评审的预印本,其威胁模型假设攻击者能观察各扫描器的置信度分数,且种子提示词的选择可能存在偏差,实际生产环境中的防御有效性尚待验证。
How it got here
Georgia Tech等机构发布CKA-Agent论文,提出通过编织良性子查询来绕过商业LLM护栏的方法,为后续知识分解攻击奠定基础。
arxiv.org ↗William Hackett和Peter Garraghan向arXiv提交预印本《BRANCH: Bypassing Multi-Scanner AI Guardrails》,正式披露该攻击方法。
arxiv.org ↗媒体Agentic Tribune报道该论文,指出BRANCH不仅击败开源护栏,还成功迁移至Lakera、Azure、Google Model Armor等8个商业黑盒产品。
agentictribune.com ↗
What is still unsettled
- 商业厂商(如AWS、Microsoft、OpenAI)是否已确认漏洞并推出补丁?
- BRANCH方法在无法获取内部置信度分数的纯黑盒环境下,实际攻击成本有多高?
- 是否存在针对“分支树搜索”类攻击的通用防御机制或检测规则?