Qwen 与 Z.ai 在 8 月 26 日开放 Qwen3.8-Flash-Next 和 GLM-5.3-Flash 权重。两者聚焦长上下文和多模态 Agent,但企业要看清:Flash 表示计算路径更高效,不表示完整权重能由普通 AI PC 或手机承载。
官方事实:两种长上下文效率路线
Qwen 官方仓库把该模型定义为 Qwen4 架构预览。它由 125B 主模型、51B N-gram Embedding 与 4B MTP 组成,每 Token 激活 6B;Gated DeltaNet 压缩历史,Qwen Sparse Attention 按微块检索关键上下文。模型原生 262,144 token,可扩展至 1M,并处理文本、图像与视频。
GLM-5.3-Flash 官方发布列出 320B 总参数、18B 激活参数,以线性与稀疏注意力混合架构把层数降至 45。它是 GLM-5 首个原生多模态型号,面向编码、长程 Agent、视觉办公和 GUI 操作,最高上下文为 1M。
6B 与 18B 都不是显存答案
MoE 的激活参数描述每个 Token 经过多少专家,主要影响计算量。加载模型时通常仍要容纳全部专家权重。Qwen 还明确列出 51B N-gram Embedding;官方称该表可以卸载到主机内存并与模型计算异步预取,这改变了内存分层和带宽压力,却不等于权重消失。
按参数位宽粗算,约 180B 权重即使全部按 4-bit 也接近 90GB,320B 则接近 160GB;实际还要加入量化元数据、视觉编码器、KV Cache、并发和运行时。Qwen 当前官方主权重是 BF16,社区量化不能自动继承官方承诺;GLM 提供 FP8 与 BF16,但 FP8 仓库仍是 300GB 以上量级。
因此,Qwen3.8-Flash-Next和 GLM-5.3-Flash均归入本地服务器层。Mac、AI PC 或单卡工作站应优先从端侧模型目录选择 4B—35B 候选。
1M 上下文不是默认经济配置
稀疏与线性注意力能降低长序列成本,但 1M 仍受预填充、KV Cache、检索准确率与失败重试约束。企业应先按权限检索并压缩证据,只为长代码库、视频或长轨迹扩大窗口;每档记录成功率、引用、工具参数、延迟和单位成功成本。上限是测试变量,不是采购承诺。
许可差异会直接改变产品路线
GLM-5.3-Flash 标注 MIT,但训练数据、输出、第三方组件和行业义务仍需审查。
Qwen3.8-Flash-Next 使用 Qwen Community License 1.0。Model as a Service 或 AI Work Assistant 商业使用需要另行许可,达到特定规模还有名称展示要求,内部使用另有例外。编码助手、办公助手或外部托管服务必须先由法务核对,不能把“开放权重”写成 Apache 2.0 或无限制开源。
厂商自测应该怎样进入选型
Qwen 的训练成本、代码、办公与设备操作基准,以及 Z.ai 的价格、Agent 榜单、KV Cache 和国产芯片集群效率,均是厂商指定条件下的自测。企业应把它们转成自己的补丁、文档引用、GUI 误操作、恢复和成本测试,最终比较每次成功任务,而不是单项榜单。
企业路由建议
两款模型值得进入服务器级候选池,但不能替代模型网关。小模型处理分类、抽取和敏感预处理,27B—35B 工作站模型承担一般推理;复杂长程编码、视觉操作和跨文档任务再进入 Flash 或云端模型。高风险动作仍需最小权限、参数校验、沙箱、审批与回退。
Qwen 列出 Transformers、llama.cpp、SGLang、vLLM 与 TokenSpeed;GLM 列出 SGLang、vLLM、TokenSpeed 与 KTransformers。新架构上线前必须固定权重、运行时、模板、视觉预处理和工具解析器,并按Agent Runtime 清单回放测试,参考基座模型选型框架避免被单一参数绑架。
研究限制与编辑判断
本文核对官方发布、模型卡、许可和运行时,没有下载权重或复现 1M 上下文、榜单、价格及芯片结果。位宽计算只是理论下限,不是实际显存或吞吐。
编辑判断是:稀疏注意力、线性状态、Embedding 卸载和更低激活比例正在重构服务器级 Agent 成本,但采购仍要按完整权重、上下文、运行时、许可和单位成功任务成本决策。
来源
- P0 官方仓库:QwenLM/Qwen3.8-Flash-Next,发布于 2026-08-26。
- P0 官方模型卡:Qwen/Qwen3.8-Flash-Next,规格、上下文、运行时与 Qwen Community License 1.0。
- P0 官方发布:Z.ai · GLM-5.3-Flash: Frontier Intelligence, Flash Cost,发布于 2026-08-26。
- P0 官方模型卡:zai-org/GLM-5.3-Flash,权重、MIT 许可与本地运行时入口。