2026 年 8 月 3 日,阿里正式发布新一代基座大模型 Qwen3.8,旗舰版本 Qwen3.8-Max 随即上线(预览版 7 月 19 日已先行开放)。官方给出的成绩单相当有分量:多项基准测试分数与 Anthropic 的顶级模型 Fable 5 相当,并宣布模型权重将开源。
对大多数普通用户来说,「2.4 万亿参数」只是一个很大的数字。这篇文章把它翻译成三件与使用体验直接相关的事。
关键一:2.4 万亿总参数,每次只激活 95B
Qwen3.8-Max 采用第三代 MoE(混合专家)架构:模型整体有 2.4 万亿参数,但每次处理一个问题时,只「激活」其中约 95B(950 亿)参数的专家网络参与计算。
这个设计解决的是大模型的老矛盾:模型越大越聪明,但推理成本也越高。MoE 的思路相当于一家大医院——科室齐全(总知识量大),但你挂号后只有对应科室的医生出诊(单次计算量可控)。这也是为什么旗舰模型能在保持强能力的同时,把 API 价格维持在普通开发者也用得起的区间。想理解国产模型在这条路线上的另一种打法,可以对照DeepSeek 的完全解读。
关键二:100 万 token 上下文,长文档不再「读了后面忘前面」
Qwen3.8-Max 支持百万级(1M token)上下文窗口,粗略折算相当于一次性读完几本厚书或数小时的会议记录。对普通用户,这直接改变三类任务的做法:
- 长文档问答:整份合同、整本手册丢进去直接提问,不需要人工切段;
- 跨文件分析:多个文档放在一起对比、汇总,模型能看到全貌;
- 长视频/长对话理解:配合多模态能力,可以理解长视频内容。
关键三:原生多模态 + 原生「慢思考」
这一代的另一个标签是「首个 2.4T 参数级的原生多模态旗舰模型」:视觉理解不是后期外挂,而是贯穿训练全流程,官方称其在 Vision Arena 视觉评测榜上排名第二。同时引入原生「慢思考」机制——在回答复杂问题前先进行内部推理,换取更高的准确率。
落到能力宣传上,官方主打两个场景:一是自主编程,可以持续多日推进完整项目;二是专业办公(Cowork),数百种专业任务争取一次对话端到端交付。这两项目标能否在真实场景中稳定兑现,还需要时间检验,但方向已经很清楚:从「回答问题」走向「完成任务」。
对普通用户意味着什么
三条实际的影响:
- 选择更多了。国产旗舰模型的第一梯队已经成型,Qwen、DeepSeek、智谱各有侧重——智谱一系的演进可以看这篇 ChatGLM 解读。模型竞争压低成本,最终受益的是使用者。
- 开源承诺值得关注。官方已宣布权重将开源,若兑现,中小团队自行部署旗舰级模型的路径会进一步打开。
- 你已经在用了。包括本站 AI家园 在内的许多 AI 应用,文本能力背后跑的正是通义千问系列模型——旗舰模型的每次升级,会直接变成普通用户手里工具的升级。本站此前也报道过 Qwen3.8 发布与开源计划(AI早报:千问3.8-Max发布将开源)。
参数竞赛的叙事看了很多年,真正值得记住的只有一句话:模型的价值不在跑分表上,而在它把多少原来做不了、做不起的任务,变成了普通人随手可用的日常功能。
Q: Qwen3.8-Max 的 2.4 万亿参数为什么每次只用 95B?
这是 MoE(混合专家)架构的设计:参数总量大保证知识覆盖面,但每次推理只激活与当前任务相关的一小部分专家网络。好处是能力上限高的同时,单次计算成本和速度可控,API 定价也能压到普通用户可负担的水平。
Q: 100 万 token 上下文对普通人有什么用?
最直接的用途是处理长内容:整份合同、整本手册、多份文档对比、长会议记录,都可以一次性交给模型而不丢失前后文。之前因为「超长就要切段、切段就会丢信息」而做不了的任务,现在可以直接做了。
Q: Qwen3.8-Max 和 Fable 5 相比到底谁更强?
官方口径是多项基准测试分数与 Fable 5 相当。但基准测试只反映特定任务集上的表现,真实体验因场景而异:不同模型在中文语境、编程、多模态等方向各有侧重。对用户的实际建议是按自己的任务选模型,或者直接使用已经做好模型调度的应用,而不必执着于跑分排名。
💬 评论