🎯

💻 本地推理性能

0 今日
1 7 天
1 30 天
1 全部
07月25日 1 条
07:30

在RTX 3090上测试Qwen3.6-35B-A3B模型,Vulkan版峰值生成速度122 tok/s,CUDA版达140 tok/s,通过CPU卸载FFN层可达到完整262k上下文窗口。

Gilesthomas