产品简介
Qwen3.8-Flash-Next 是阿里通义千问于北京时间 2026 年 8 月 26 日深夜开源的多模态 MoE 模型,作为下一代 Qwen4 架构的先导预览版,提前释出架构改动供全球开发者检验。该模型主模型总参数 125B,每 token 仅激活 6B,并配备约 51B 参数的 N-gram 词表层。原生支持 256K 上下文,可扩展至 1M,同时内置视觉编码器。其训练成本较 Qwen3.7-Plus 降近九成,权重已在 Hugging Face 与魔搭社区开源,SGLang 提供 Day-0 支持。
核心功能
- 混合注意力机制:融合 GatedDeltaNet 线性注意力与 QwenSparseAttention 稀疏注意力,优化长序列处理效率与质量。
- N-gram Embedding:将常见词组作为独立词条存入短语词典,可放置在系统内存而非 GPU 上,降低显存占用。
- 门控残差与多超连接流:优化深层网络梯度流动与信息传递,提升模型训练稳定性和表现。
- Muon 优化器:新一代训练优化方案,显著降低训练成本,仅为 Qwen3.7-Plus 的约九分之一。
- 高效推理架构:每 token 仅激活 6B 参数,官方称可在单张 RTX 4090 上不量化本地运行,部署门槛低。
- 超长上下文支持:原生 256K 上下文,借助 YaRN 技术可扩展至 1M,满足大规模文档处理需求。
适合谁用
以下类型的用户会特别受益于 Qwen3.8-Flash-Next:
- 本地低延迟推理:在单张 RTX 4090 上运行,适合个人开发者或中小团队搭建私有服务。
- 长文档理解与分析:利用 256K 至 1M 上下文处理大型代码库、学术论文或法律合同。
- 多模态任务:内置视觉编码器,支持图像输入与文本联合推理场景。
- 编码辅助:在 SWE-bench Pro、LiveCodeBench v6 等基准上表现突出,可用于复杂编程任务。
- 架构研究与验证:作为 Qwen4 先导模型,供开发者测试新架构特性与推理栈兼容性。
优点亮点
- 训练成本较 Qwen3.7-Plus 降低近 90%,经济性突出。
- 推理侧仅激活 6B 参数,可在消费级硬件上运行。
- 原生支持 256K 上下文并扩展至 1M,长文本能力强劲。
- 多模态 MoE 设计,兼顾性能与效率。
- 在推理与编码多项评测中表现优于或接近同期效率型模型。
- 权重完全开源,并同步提供 FP8 量化版本,生态接入便捷。
价格与方案
姊妹模型 Qwen3.8-Flash(非 Next 版)已上线 QwenCloud / 千问平台提供 API 服务,每百万 token 输入 1 元、输出 3 元(约 $0.16/$0.47)。Qwen3.8-Flash-Next 为开源权重模型,具体使用成本以官网为准。
总结与建议
Qwen3.8-Flash-Next 是阿里通义千问为 Qwen4 架构铺路的开源先导模型,以 125B 总参、6B 激活的高效 MoE 设计,结合混合注意力、N-gram 词表等创新,实现低成本训练与本地化部署。其在编码与推理基准上表现亮眼,同时通过开源策略推动社区生态适配,为后续完整版 Qwen4 奠定基础。
版本演进
- Qwen3.8-Flash-Next 开源(Qwen4 架构先导预览) (2026-08-26):阿里通义千问深夜开源基于下一代 Qwen4 架构的先导预览模型 Qwen3.8-Flash-Next:多模态 MoE,主模型总参 125B、每 token 仅激活 6B,另含 51B N-gram 词表层;原生 256K 上下文可经 YaRN 扩展至 1M;混合注意力(GatedDeltaNet + 稀疏注意力)、N-gram Embedding、门控残差、Muon 优化器四大架构创新提前剧透 Qwen4;训练成本较 Qwen3.7-Plus 降近九成;同步发布 FP8 量化版,权重已在 Hugging Face 与魔搭开源。