YC系RunAnywhere推出Wally托管推理服务,称GLM-5.3 Flash达380 tokens/秒
RecodeX 重构消息,YC W26孵化公司RunAnywhere将其端侧推理技术栈扩展至托管推理服务,推出名为Wally的新产品。该公司称,Wally在GLM-5.3 Flash模型上实现每秒380个token的推理速度,并宣称其开源模型推理性能超过规模更大的服务商。
持续追踪RunAnywhere托管推理相关报道与进展。
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。RecodeX 重构消息,YC W26孵化公司RunAnywhere将其端侧推理技术栈扩展至托管推理服务,推出名为Wally的新产品。该公司称,Wally在GLM-5.3 Flash模型上实现每秒380个token的推理速度,并宣称其开源模型推理性能超过规模更大的服务商。