智谱 Z.ai · 本地服务器

GLM-5.3

Z.ai 在 GLM-5.2 基座上通过后训练更新编码、长程 Agent 与网络安全任务能力的 744B-A40B 文本模型,提供 FP8、BF16 权重和多套服务器运行时。

查看官方资料 官方源核验于 2026/08/29
参数规模744B 总参数 / 40B 激活参数
架构DSA 稀疏注意力 MoE · 文本推理与编码 Agent
模态文本、代码、工具调用
上下文最高 1,048,576;官方 API 文档列出最大输出 128K
Local deployment verdict

部署判断

40B 激活参数只描述每 Token 的专家计算路径,不是完整权重内存。官方 FP8 仓库 141 个权重分片合计约 755.6GB;生产服务还要预留 KV Cache、并发、通信和运行时工作区,属于多 GPU 或集群级部署。

推荐起点
本地服务器
常见运行时
SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth、vLLM-Ascend / xLLM
许可
GLM-5.3 License;运营 MaaS 且关联方任意连续 12 个月总收入超过 100 亿美元时,商业使用前须通过 Z.AI 安全审查

型号与精度版本

FP8
BF16

同一模型家族中的基础、指令、推理、量化或多模态检查点用途可能完全不同。下载前应核对模型卡、提示模板、分词器、量化方法和运行时版本。

适合放进哪些本地工作流

服务器级编码 Agent
大型代码库研究
受控网络安全辅助
多 GPU 私有化推理评测

端侧模型更适合边界清楚、输入可控、失败可回退的任务。涉及客户承诺、财务写入、生产控制或复杂多步工具调用时,应保留云端高能力模型与人工审批作为升级路径。

进入数字员工路由前怎么测

  1. 加载测试记录具体设备、精度、运行时、上下文与首 Token 时间,避免只写“能跑”。
  2. 任务测试用脱敏企业样本测任务成功率、结构化输出和工具参数正确率。
  3. 压力测试加入长上下文、并发、热启动、内存峰值、功耗和降频观察。
  4. 治理测试验证模型许可、日志、更新、漏洞响应、人工接管与云端回退。

当前研究限制

  • A40B 不等于只加载 40B 权重,官方 FP8 权重约 755.6GB
  • 1M 上下文与 128K 最大输出是产品上限,不是默认经济配置
  • 代码和网络安全基准、相对 GLM-5.2 的提升均为厂商自测,本文未独立复现
  • 官方明确披露网络安全利用能力增强,接入终端、代码仓库和扫描工具时必须沙箱隔离、最小权限并对高风险动作人工审批
  • 模型采用专用许可,不能沿用 GLM-5 仓库代码的 Apache 2.0 标牌判断权重商用条件

本页是官方资料索引与企业选型分析,不构成速度、显存、质量、许可或合规承诺。社区量化与第三方运行时应作为独立供应链组件审计。