智谱 Z.ai · 本地服务器

GLM-5.3-Flash

Z.ai 首个 GLM-5 原生多模态 Flash 型号,用更低激活参数、混合稀疏/线性注意力与 45 层架构面向编码、长程 Agent、视觉办公和 GUI 操作。

查看官方资料 官方源核验于 2026/08/29
参数规模320B 总参数 / 18B 激活参数
架构稀疏注意力 + 线性注意力 · 原生多模态 MoE
模态文本、图像、视频、代码、GUI 操作
上下文最高 1M;不同评测与运行时采用 164K—1M 配置
Local deployment verdict

部署判断

18B 激活参数只描述每 Token 的计算路径,加载仍需容纳约 320B 总权重。官方 FP8 仓库权重仍是 300GB 以上量级,生产部署还要加入视觉编码器、KV Cache、上下文、并发、通信与运行时工作区。

推荐起点
本地服务器
常见运行时
SGLang、vLLM、TokenSpeed、KTransformers
许可
MIT

型号与精度版本

FP8
BF16

同一模型家族中的基础、指令、推理、量化或多模态检查点用途可能完全不同。下载前应核对模型卡、提示模板、分词器、量化方法和运行时版本。

适合放进哪些本地工作流

服务器级多模态数字员工
长程编码 Agent
视觉办公与文档任务
国产算力集群适配

端侧模型更适合边界清楚、输入可控、失败可回退的任务。涉及客户承诺、财务写入、生产控制或复杂多步工具调用时,应保留云端高能力模型与人工审批作为升级路径。

进入数字员工路由前怎么测

  1. 加载测试记录具体设备、精度、运行时、上下文与首 Token 时间,避免只写“能跑”。
  2. 任务测试用脱敏企业样本测任务成功率、结构化输出和工具参数正确率。
  3. 压力测试加入长上下文、并发、热启动、内存峰值、功耗和降频观察。
  4. 治理测试验证模型许可、日志、更新、漏洞响应、人工接管与云端回退。

当前研究限制

  • Flash 命名不代表可在普通 PC 或手机芯片直接运行
  • 18B 激活参数不等于 18B 权重内存
  • 1M 上下文会显著增加缓存、通信与延迟成本
  • 榜单、十倍价格差、三倍集群效率及国产芯片对比均为厂商自测
  • 本地运行时刚加入新架构,必须固定版本并回归多模态、工具解析和长上下文

本页是官方资料索引与企业选型分析,不构成速度、显存、质量、许可或合规承诺。社区量化与第三方运行时应作为独立供应链组件审计。