RecodeX 重构消息,英伟达发布文章称,阿里巴巴最新预览模型Qwen3.8-Flash-Next已获得GB300 NVL72平台支持。该模型总参数1760亿,每Token激活约60亿参数,原生支持26.2万Token上下文,可通过YaRN扩展至100万Token,面向智能编程、文档处理及工具调用等长上下文Agent应用。
该模型采用Gated DeltaNet与Qwen Sparse Attention混合架构,降低长上下文场景下的计算和KV缓存开销。测试显示,在GB300 NVL72上单GPU吞吐量超1.6万Token/秒,单用户吞吐超200Token/秒,支持SGLang、vLLM及TensorRT-LLM等推理框架。