RecodeX 重构消息,Inferact公布其开源TPU megakernel在低并发投机解码测试中的表现:使用16块TPU v7芯片时,Kimi K3模型推理速度达到每秒709个token,而16块GB200 GPU为每秒452个token。联合创始人Woosuk Kwon是vLLM的共同创建者,参与了该开源内核的构建。