模拟实验称认知多样的AI评审团更抗攻击
作者自测显示按推理方式组队比按厂商组队错误率低10%,样本小,待复现。
原始事件 2026-09-25
一项模拟实验称,让AI评审团按认知推理方式多样化,比按模型厂商多样化更抗对抗攻击,错误率低10%。
作者Anya Habana在LessWrong发文,这是她在BlueDot技术AI安全冲刺项目下的探索性工作。实验用120个自生成的错误信念场景,比较「同一模型但被设定为不同推理人格」与「OpenAI、Mistral、Google不同架构模型」组成的评审团。
文中还称,仅靠提示词诱导不同推理方式会泄漏模型既有能力,而用LoRA微调可让多样化评审团比单一评审模型准确率高逾4%。全部数字出自作者自测,场景由Gemini Flash Lite 3.5生成,样本量小,结论有待第三方复现。