阿里通义千问团队在HuggingFace上正式开源了Qwen3.8-2.4T-A95B,这是Qwen开源模型家族中迄今为止能力最强的一代,也是Qwen-Max级别模型首次向社区开放。

Qwen3.8-2.4T-A95B是一款总参数量2.4万亿、激活参数95B的因果语言模型。与Qwen3.5共享架构基础,但在编码、专业工作、研究和长周期代理任务方面实现了显著提升。模型采用独特的混合架构设计,每个隐藏层由23组模块组成,每组包含3个Gated DeltaNet层(线性注意力机制)和1个Gated Attention层(标准注意力机制),每个模块后接一个512个专家的MoE(混合专家)层,每次激活10个路由专家加1个共享专家。
Qwen3.8-2.4T在推理效率上的设计非常精妙:Gated DeltaNet使用128个V头来捕获丰富的状态信息,但仅用16个QK头来控制计算成本;Gated Attention则使用64个Q头和4个KV头,结合64维的旋转位置编码。模型原生支持26万token的上下文长度,可扩展至101万token。此外还采用了多token预测(MTP)训练策略。

值得注意的是,这个开源版本仅支持thinking模式,即所有回答都包含推理过程。用户可以通过reasoning_effort参数控制推理深度(xhigh、medium、low三档),并通过preserve_thinking选项保留历史对话中的推理上下文。推荐使用temperature=1.0、top_p=0.95、top_k=20的采样参数。
在基准测试中,Qwen3.8-Max(云端API版本,包含视觉输入、非thinking模式和内置工具等额外功能)的表现相当亮眼:Terminal Bench 2.1达到86.6分,PaperBench达到93.0分,GPQA Diamond达到92.6分,在全球开源模型中处于领先地位。


模型已提供8种量化版本,兼容llama.cpp、Ollama、LM Studio等主流推理框架,推荐使用SGLang、vLLM或TokenSpeed进行部署。
参考来源: