Ai2开源新版MoE训练框架,自测吞吐提升2.7倍
开放社区获得可扩展到万亿参数的MoE训练工具,性能数字为官方自测,实用效果待第三方使用验证。
Ai2于10月1日发布开源训练框架Olmo-core 3,官方称可将混合专家模型(MoE)训练扩展到万亿参数级。
在8块NVIDIA B300 GPU上的自测中,47B参数MoE每GPU每秒处理52,000个token,旧实现为19,400个,约2.7倍。另一项测试在512块GPU上跑通1.2万亿参数模型,但用的是随机路由,只测系统性能而非模型质量。
框架改用分布式数据并行,让专家权重常驻GPU,避免反复搬运;还支持MXFP8低精度格式,自测吞吐比BF16高约21%。它是下一代开源模型Olmo的训练底座,代码和技术报告已公开,实际训练效果有待第三方使用检验。