自蒸馏新方法让电脑操作智能体训练效果小幅提升
该方法把执行反馈转成逐步训练信号,作者自测提升有限,方向可关注、待独立复现。
ComputerSD把智能体执行操作后的实时反馈转成训练信号,作者称在OSWorld-Verified基准上超过只用结果奖励的训练方法。
具体数字:在Qwen3-VL-8B-Thinking骨干上高1.9个百分点,在专用的EvoCUA-8B上高4.1个百分点,均为论文作者自测。
提升幅度不大,基准也由作者自己运行,方法能否在真实使用中带来同等收益,需等独立复现。
信息源:https://arxiv.org/abs/2609.40253https://github.com/ZJU-REAL/ComputerSD