背景 三档是怎么来的
2026 年 8 月 12 日,阿里 Qwen 团队开放 Qwen3.8-2.4T-A95B 权重;8 月 14 日,开源 Qwen3.8-27B。同一周发布的三档模型(27B、2.4T、Max 云端)容易让人混淆,本文把三者的关系、参数差异、适用场景一次讲清。
三档不是独立设计,而是同一个基座上的不同表现形式:Qwen3.8-2.4T-A95B 是底座(2.4 万亿总参数 MoE,每个 token 激活 95B),Qwen3.8-27B 是蒸馏版本(稠密 27B,从 2.4T 蒸馏出单卡可跑的模型),Qwen3.8-Max 是云端旗舰(同 2.4T 架构 + 生产环境增强 + 视频长输入)。
三档规格对比
| 维度 | Qwen3.8-27B | Qwen3.8-2.4T-A95B | Qwen3.8-Max |
| 参数 | 27B(稠密 Dense) | 2.4T 总参 / 95B 激活(MoE,512 专家 × 10 路由 + 1 共享) | 同 2.4T 架构 |
| 上下文 | 262K 原生,YaRN 外推 1M | 256K 原生,外推约 1M | 以官方为准 |
| 多模态 | 原生(vision tower) | 原生 | 原生 + 长视频输入 |
| 容量 / 显存 | 4-bit 量化 16-19GB 显存可跑 | 全精度 4.9TB 存储;1-bit 量化 397GB | 按 token 调用,无本地部署 |
| 推理加速 | MTP 多 token 预测(需推理引擎支持) | MTP 多 token 预测,吞吐量更高 | 官方加速 |
| 授权 | Apache 2.0(可商用) | 开源权重(可商用) | 百炼 API,按调用计费 |
| 发布形式 | 模型权重(Hugging Face / ModelScope) | 模型权重(ModelScope) | 阿里云百炼 API |
能力曲线 哪些任务三档有差,哪些没差
Qwen 官方公布的评测覆盖编程 Agent、通用 Agent、专业工作和长上下文等方向。三档模型的差距主要集中在这几类任务:
- 长周期 Agent 任务:跨天任务、多文件工作区、复杂异构目录。2.4T/Max 在办公 Agent 后训练里用了"持续扩展真实环境 + 统一奖励系统 + 在线数据均衡器"三环节(Qwen 官方 blog),27B 天花板低一截。
- 多模态视频:Max 支持视频长输入,27B 和 2.4T 以图像/文本为主。
- 编程与办公场景的端到端任务:三个档位都有提升,幅度上 27B 已超过 Qwen3.7-Plus 的基线(Qwen 官方描述)。
简单任务(对话、代码补全、翻译、摘要)——三档差异可忽略。这类任务选最轻的那档即可。
按使用场景的组合
- 桌面/小团队本地跑:27B + 4-bit 量化(16-19GB 显存,RTX 4090/5080、Mac M1-M3 Pro 系列可跑)。部署框架 Ollama 或 vLLM,数据不出本地网络。
- 企业私有化、数据不出内网:2.4T-A95B 多卡集群(FP8 量化最低 4×H100/H200 或 8×A100 80G 级别)。推理框架 vLLM/SGLang 配 MTP 加速。
- ToC 应用或快速原型:Max 百炼 API(首月常有促销),支持工具调用、长上下文、视频,不用维护 GPU。
- 横向扩展不升级 GPU:27B + 4-bit 多实例(按硬件预算横向扩容)。比上 2.4T 便宜得多,能力覆盖见"能力曲线"一节。
三个容易混淆的点
- 27B ≠ 2.4T 的"小号":是稠密蒸馏版,不是缩水 MoE。每层全激活,无路由开销,所以显存按 27B 全参数算。
- "MoE 激活 95B"≠"27B 稠密":2.4T 每个 token 只激活 95B 参数(10 专家 + 1 共享),计算量低于 2.4T 全参;但存储量按 2.4T 算。
- Max 和 2.4T 差别在哪:Max 的"云端增强"包括视频长输入、更稳的 API SLA、生产环境优化;纯推理能力上和 2.4T 同级别。