RecodeX 重构消息,蚂蚁百灵正式开放Ling-3.0-tiny模型权重,提供BF16、FP8和INT4三个版本,采用MIT许可。模型有79亿参数,每个Token仅激活13亿参数,包含128个路由专家,每个Token使用其中8个及1个共享专家。注意力采用3:1的KDA与MLA混合架构。官方称FP8版在M4 Pro MacBook上可达约86-90 Token/s,DGX Spark上约100-105 Token/s。