算子融合成为跑快万亿参数模型的共同解法
开源与商用两条路线同周押注算子融合跑Kimi K3,性能均为自报,待第三方复现。
海内外两个团队在一周内先后用算子融合方法跑快2.8万亿参数的Kimi K3。
据智东西报道,9月21日浪潮信息发布SD200 Ultra超节点,称单机承载K3、时延5.85毫秒;9月23日团队Inferact开源tpu-megakernels,称16颗谷歌TPU v7上解码吞吐达709 tokens/s。数字均为各自口径。
两案共同点是合并算子、减少数据搬运。K3官方推荐64卡部署,未经优化时约10 tokens/s,提速幅度仍待第三方复现。