VLA机器人架构
5 étapes1 pièces7 Sources
视觉语言动作模型(VLA)是当前机器人AI的核心架构,它将视觉感知、语言理解与电机控制统一在一个Transformer框架中。【背景】随着Figure、Physical Intelligence等公司推出π0、Helix等模型,VLA已成为连接大模型能力与物理世界操作的关键桥梁。
技术演进上,早期研究聚焦于如何将动作组件注入视觉语言模型(VLM)。2025年,字节跳动与清华团队发布RoboVLMs,通过600多次实验确立了骨干网络选择、架构公式化及跨具身数据使用时机三大设计准则。随后,微软提出VLA+概念,在Rho-alpha模型中引入触觉传感与在线学习,突破传统VLA仅依赖视觉和语言的局限。2026年8月,τ0-VLA进一步引入分层架构与世界模型引导的测试时计算,以解决长序列任务中的决策优化问题。
争议在于通用性与实时性的平衡:一方面,SimVLA等简化基线证明小参数模型即可达到SOTA,质疑复杂架构的必要性;另一方面,VLA-RAIL指出异步推理链接器对消除动作抖动至关重要,暗示单纯模型优化不足以应对硬件延迟。目前尚无定论哪种架构范式将主导未来部署。
后续需关注:1. RoboVLMs开源代码库的实际复现效果;2. 更多厂商是否跟进“VLA+”多模态扩展;3. 分层模型在真实工业场景中的成功率数据。
Comment on en est arrivé là
Nature Machine Intelligence发表《What matters in building vision–language–action models》,提出RoboVLMs框架,明确VLA设计的三个关键选择。
nature.com ↗Hugging Face发布SimVLA论文,展示仅0.5B参数的简化基线即可超越多十亿参数模型,挑战复杂架构假设。
huggingface.co ↗arXiv提交VLA-RAIL论文,提出实时异步推理链接器,解决VLA模型在机器人执行中的动作抖动与延迟问题。
arxiv.org ↗Turing Post解析VLA模型演进,介绍微软Rho-alpha作为首个VLA+模型,引入触觉与在线学习。
turingpost.com ↗arXiv提交τ0-VLA论文,提出分层机器人基础模型,利用世界模型引导的测试时计算优化长序列任务。
arxiv.org ↗