资讯1 分钟阅读·
vLLM称其支持英伟达Rubin平台,自测吞吐量为GB200的7.8倍
vLLM团队发布博客称已支持英伟达Vera Rubin NVL72,自测数据显示在AgentX负载下每GPU吞吐量是GB200的7.8倍。
重要性实质性证据E2 未复现写法快讯
vLLM团队宣布其推理引擎现已支持英伟达最新的Vera Rubin NVL72硬件平台。
根据官方博客发布的初步测试结果,在AgentX工作负载并保持相同交互性标准的前提下,Vera Rubin NVL72上的每GPU吞吐量达到上一代GB200 NVL72的7.8倍。此外,在MLPerf视觉语言模型测试中,其吞吐量比GB300 NVL72高出3.7倍。
这一提升主要得益于Rubin平台5倍的NVFP4浮点运算能力、2.4倍的HBM带宽以及第六代NVLink网络。vLLM通过FlashInfer 0.7.0引入了针对Rubin调优的内核,并利用CUDA 13.4的局部性域特性优化了混合专家模型(MoE)的内存访问效率。
需要注意的是,上述数据均为vLLM、英伟达及红帽等合作方进行的内部基准测试,尚未经过独立第三方验证。实际生产环境中的性能表现可能因具体模型架构和工作负载类型而异。