AI News · AI新情报

阿里 Qwen3.8-2.4T-A95B 开放权重:2.4 万亿参数模型可在单节点 8 卡部署,MTP 让首字延迟降近六成

AWS 官方博客介绍,阿里 Qwen 团队于 2026 年 8 月 12 日发布 Qwen3.8-2.4T-A95B,这是 Qwen-Max 级模型首次以开放权重形式提供。模型总参数 2.4 万亿、每令牌激活 95 亿,原生上下文 262K 令牌并可扩展至 100 万。

阿里 Qwen3.8-2.4T-A95B 开放权重:2.4 万亿参数模型可在单节点 8 卡部署,MTP 让首字延迟降近六成
AI辅助整理:本文基于下方列出的公开原始来源改写,不代替原文。

核心摘要: AWS 官方博客介绍,阿里 Qwen 团队于 2026 年 8 月 12 日发布 Qwen3.8-2.4T-A95B,这是 Qwen-Max 级模型首次以开放权重形式提供。模型总参数 2.4 万亿、每令牌激活 95 亿,原生上下文 262K 令牌并可扩展至 100 万。官方给出在 SageMaker HyperPod 上使用 vLLM 与 NVFP4 量化在单台 8 卡 B300 节点部署的完整路径,并披露基准:开启 MTP 推测解码后首字延迟降低约 58.7%,叠加专家并行后降低约 59.7%、输出吞吐提升约 12.6%。

业务背景:万亿级模型首次以开放权重提供

AWS 官方博客介绍,阿里 Qwen 团队于 2026 年 8 月 12 日发布 Qwen3.8-2.4T-A95B,这是 Qwen-Max 级模型首次以开放权重形式提供。模型总参数 2.4 万亿,每个令牌激活约 95 亿参数,原生上下文 262,144 令牌,可扩展至约 101 万令牌。

开放权重意味着企业可以把数据留在自有基础设施内,定制推理行为,并在规模化后避免按令牌计费的 API 成本;代价是需要自备 GPU 基础设施与优化过的服务栈。

架构要点:混合注意力让长上下文成本可控

模型采用细粒度混合专家结构,共 512 个路由专家加 1 个共享专家,每令牌激活 10 个路由专家,共 92 层。层布局按 3 层门控 DeltaNet 加 1 层门控注意力的比例重复。

官方解释,69 层 DeltaNet 使用带固定递归状态的线性注意力,用固定大小内存替代不断增长的 KV 缓存;只有 23 层全注意力贡献随上下文增长的内存开销。这一设计对需要累积工具输出、代码与推理轨迹的多轮智能体任务尤为关键。

部署路径:单节点 8 卡与 NVFP4 量化

官方给出在 SageMaker HyperPod 上使用 vLLM 部署的完整路径。BF16 精度下 2.4 万亿参数仅权重就需约 4.8TB 显存,超出单台 8 卡节点;NVFP4 量化把权重压到约 1.2TB,可放入 p6-b300 实例的 2.1TB 聚合显存,并为 KV 缓存与激活留出余量。

服务命令的关键参数包括张量并行设为 8、启用量化与 fastsafetensors 加载、开启前缀缓存、指定推理解析器与工具调用解析器,并通过推测解码配置启用模型内置的多令牌预测草稿头。

结果证据:MTP 是首字延迟的主要优化项

官方在单台 p6-b300 节点上以 512 次请求、1024 输入与 1024 输出令牌、并发 32 的条件做了四组对比。仅开 MTP 时首字延迟降低 58.7%,请求延迟降低 7.0%,输出吞吐提升 6.2%;仅开专家并行收益有限,约 3.5% 首字延迟与 1% 吞吐。

两者叠加效果最佳:首字延迟降低 59.7%,请求延迟降低 12.2%,输出吞吐提升 12.6%。令牌间延迟也从 17.97 毫秒降到 16.36 毫秒。官方建议生产部署同时开启专家并行与 MTP。

边界与可复制动作

容量方面,ml.p6-b300.48xlarge 不支持按需购买,必须通过预留计划获取,并需把目标可用区与预留分配对齐。首次部署在没有缓存权重的情况下,预计需要 15 至 30 分钟完成下载与加载。

落地建议:先确认预留容量,再按官方参数起步,推测解码令牌数从 1 开始并监控接受率;对多轮智能体场景优先验证前缀缓存收益,再逐步调高推测令牌数。

证据与边界

  • 正文称 2026 年 8 月 12 日阿里 Qwen 团队发布 Qwen3.8-2.4T-A95B,为 Qwen-Max 级模型首次开放权重。
  • 正文给出模型规格:总参数 2.4 万亿、每令牌激活 95 亿、原生上下文 262,144 令牌、可扩展至 1,010,000。
  • 正文基准显示 TP+EP+MTP 配置下首字延迟降低 59.7%、请求延迟降低 12.2%、输出吞吐提升 12.6%。
  • 正文说明 ml.p6-b300.48xlarge 不支持按需购买,需通过 Flexible Training Plan 预留容量,首次部署预计 15–30 分钟。

企业今天可以做什么

评估自建前沿模型时,建议先确认是否有可用的预留 GPU 容量,再按官方给出的 vLLM 参数起步:张量并行设为 8、启用量化与前缀缓存、开启自动工具调用与推理解析器,并把推测解码令牌数从 1 开始验证接受率。对多轮智能体场景,优先验证前缀缓存带来的首字延迟收益,再逐步调高推测令牌数。

资料来源

公众号原题:Deploying Qwen3.8-2.4T-A95B on Amazon SageMaker HyperPod with vLLM · 查看公众号原文

你的企业,AI最该先改哪一段?

带着一个真实业务问题,先做一次增长诊断。

获取增长诊断