Inco AI开源本地推理引擎Splash,M5 Max上27B模型达144Token/s
RecodeX 重构消息,Inco AI开源本地推理引擎Splash,将Qwen3.8-27B在M5 Max MacBook Pro上的推理速度提升至最高144 Token/s,LM Studio已在0.4.25版本接入支持。Splash目前仅支持Qwen3.8-27B和Qwen3.6-35B-A3B两款模型,为每款模型单独配置了GPU kernel、内存方案和DFlash 2小模型。在48GB M5 Pro上,Qwen3.8-27B单路短上下文达74 Token/s,4路并发总吞吐达170 Token/s,为第二名的3.9倍。该引擎开源且不绑定LM Studio,需M3或更新Mac、macOS 26.4以上、至少36GB统一内存。