资讯1 分钟阅读·
BudgetAPO预印本:噪声自适应评估降低提示优化失败率
新算法通过动态调整评估切片大小,在有限API调用预算下显著减少提示优化失败。
重要性实质性证据E2 未复现写法快讯
重点:BudgetAPO在250次调用预算下将返回原始提示词(seed)的失败率从GEPA的86%降至13%,解决了自动提示优化(APO)在付费API限制下的实际可用性问题。
背景:现有APO方法如GEPA和OPRO通常假设数百至数千次模型调用,这在受限或计费的API环境中不切实际。在紧预算下,多阶段流程易耗尽预算并退回初始状态,单阶段方法则因固定评估批次忽略任务噪声差异而表现不佳。
结论:该预印本提出噪声自适应规则,根据任务噪声动态调整评估切片大小,并通过配对比较进行接受/拒绝决策。作者在七个基准测试和五个模型上自测显示,BudgetAPO在所有受试模型中排名第一,且在Holm校正配对检验中优于所有基线。例如在GPT-OSS-20B上,GEPA需5倍调用次数才能匹配BudgetAPO在100次调用时的得分。
边界:结果基于作者自测,尚未见独立复现;论文为arXiv预印本v2版本(2026年10月8日更新),未说明是否经过同行评审。