RecodeX 重构消息,在RTX 3090上测试Qwen3.6-35B-A3B模型,Vulkan版峰值生成速度122 tok/s,CUDA版达140 tok/s,通过CPU卸载FFN层可达到完整262k上下文窗口。
在RTX 3090上测试Qwen3.6-35B-A3B模型,Vulkan版峰值生成速度122 tok/s,CUDA版达140 tok/s,通过CPU卸载FFN层可达到完整262k上下文窗口。
AI 辅助判断中性仅供信息参考,不构成投资建议
原始信息来源Gilesthomasgilesthomas.com
查看原文 ↗