模型看图查家具装错十个月内从28%升至80%
视觉查错能力快速提升,但每张照片约需三分钟,离实时指导仍远,值得跟踪。
原始事件 2026-09-26
Epoch AI的家具装配基准显示,模型识别宜家家具装错步骤的准确率十个月内从28%升到80%。
该基准让模型对照说明书检查三件家具的装配照片并指出错误。2025年11月最好的模型Claude Opus 4.5只得28%,如今OpenAI的GPT-6 Astra达到80%,Anthropic的Claude Fable 5.1以70%居次。
限制同样明确:Astra每张照片约需三分钟,Epoch AI称这一速度尚不能支持实时装配指导。中国开源权重模型如Kimi K3落后领先者至少七个月。