RecodeX 重构消息,Go语言编写的LLM推理引擎dlgo采用Vulkan GPU后端,在RTX 4070 Ti SUPER上测试Qwen3.5 0.8B模型时比Ollama的CUDA快28%,支持AMD、Intel和移动GPU,并兼容多种模型和量化格式。
Go语言编写的LLM推理引擎dlgo采用Vulkan GPU后端,在RTX 40...
原始信息来源github.comgithub.com
查看原文 ↗RecodeX 重构消息,Go语言编写的LLM推理引擎dlgo采用Vulkan GPU后端,在RTX 4070 Ti SUPER上测试Qwen3.5 0.8B模型时比Ollama的CUDA快28%,支持AMD、Intel和移动GPU,并兼容多种模型和量化格式。