VisTA视觉弃权模型
2 ステップ1 件2 ソース
南加州大学与加州大学圣地亚哥分校团队提出VisTA(Visual Transformation and Abstention)训练方法,旨在解决统一多模态模型(UMMs)在图像编辑中无法识别“不可行指令”的问题。该研究正式定义了“视觉弃权”概念:当请求的视觉变换违反任务规则时,模型应识别无解并拒绝生成。
此前,即使是最强的编辑器模型(如UniREdit-BAGEL),其编辑准确率为68.4%,但对不可行请求的拒绝率仅为0.4%。这些模型往往忽略冲突,强行规划编辑或篡改请求以完成生成。显式提示模型报告不可行性虽能增加文本拒绝,却会牺牲编辑准确率。
VisTA通过配对可行与不可行示例进行训练,使模型在生成前判断可行性。实验显示,VisTA-BAGEL在无额外提醒的情况下,对不可行请求的拒绝率达到93.0%,同时保持74.3%的可行编辑完成率,高于所有评估的8个基线模型,且误拒率仅为0.8%。这一进展表明,将理解能力整合进生成决策是提升多模态系统可靠性的关键路径。
経緯
论文《Visual Abstention in Unified Multimodal Models》提交至arXiv,提出DoD基准和VisTA方法。
arxiv.org ↗新闻发布指出VisTA使模型能识别并拒绝93%的不可行绘图请求,同时保持高编辑准确率。
arxiv.org ↗
未解決の問題
- VisTA方法是否适用于其他类型的多模态生成任务(如视频编辑)?
- 在实际部署中,如何平衡高拒绝率带来的用户体验影响与安全收益?