龙芯GPU软件栈首次成套发布,ONNX模型可直接部署
龙芯补齐自研GPU的AI推理软件栈,CUDA兼容降低迁移成本,但性能均为自述,实际可用性待早期客户验证。
原始事件 2026-09-22
龙芯中科9月22日发布龙芯加速计算平台首个软件版本,面向2K3000和9A1000集成的LG200系列通用GPU,覆盖驱动、编译器、算子库到推理引擎。
平台支持OpenCL 3.0和CUDA两类编程接口,并将自研推理引擎LacInfer作为ONNX Runtime的执行后端,PyTorch、TensorFlow导出的ONNX模型可直接部署,无需改写代码。算子库对FP32、INT8的GEMM等运算做了汇编级优化。
公司称软件已服务部分早期客户,并基于2K3000、9A1000开展具身智能设备研发。需要说明的是,推理速度与精度损失均为龙芯自述口径,无第三方实测,9A1000显卡按此前公司口径预计明年上半年才开售。