NVIDIA · 本地服务器

Kimi K3 / NVIDIA NVFP4

NVIDIA 为 Moonshot Kimi K3 提供的混合 NVFP4/FP8 检查点和 8×B300 部署配方,把 2.8T 多模态 Agent 模型从理论开放权重推进到可复核的集群运行路径。

查看官方资料 官方源核验于 2026/08/30
参数规模2.8T 总参数 / 104B 激活参数;每 Token 选择 896 个专家中的 16 个
架构Kimi Delta Attention + LatentMoE · 原生多模态 MoE
模态文本、图像、视频、代码、工具调用
上下文原生 1,048,576;NVIDIA vLLM 的 8×B300 已验证配置为 196,608
Local deployment verdict

部署判断

104B 激活参数只描述每 Token 的计算路径,加载仍需容纳 2.8T 总权重。NVIDIA 官方 NVFP4 检查点权重元数据约 1.42TB,快速开始说明首次下载约 1.6TB,并在 8 张 B300 上验证;KV Cache、并发、运行时、通信与高可用副本还会继续增加资源需求。

推荐起点
本地服务器
常见运行时
vLLM Kimi-K3 专用公开镜像 + 官方兼容补丁、SGLang 开发镜像 + Kimi-K3 cookbook、vLLM 0.28.0 Kimi-K3 优化(不等于混合 NVFP4 已全量主线化)
许可
NVIDIA Open Model Agreement;同时受 Kimi K3 License 的 MaaS 签约与大型商业产品名称展示条款约束

型号与精度版本

Moonshot MXFP4 / MXFP8 原始权重
NVIDIA NVFP4 路由专家 + 分块 FP8 注意力

同一模型家族中的基础、指令、推理、量化或多模态检查点用途可能完全不同。下载前应核对模型卡、提示模板、分词器、量化方法和运行时版本。

适合放进哪些本地工作流

大型集群长程编码 Agent
多模态知识工作
Kimi K3 私有化容量验证
Blackwell 推理架构评估

端侧模型更适合边界清楚、输入可控、失败可回退的任务。涉及客户承诺、财务写入、生产控制或复杂多步工具调用时,应保留云端高能力模型与人工审批作为升级路径。

进入数字员工路由前怎么测

  1. 加载测试记录具体设备、精度、运行时、上下文与首 Token 时间,避免只写“能跑”。
  2. 任务测试用脱敏企业样本测任务成功率、结构化输出和工具参数正确率。
  3. 压力测试加入长上下文、并发、热启动、内存峰值、功耗和降频观察。
  4. 治理测试验证模型许可、日志、更新、漏洞响应、人工接管与云端回退。

当前研究限制

  • 104B 激活参数不等于 104B 权重内存,NVFP4 也没有把 2.8T 模型变成单机模型
  • 8×B300 是 NVIDIA 厂商验证配置,不是独立最低硬件门槛或企业生产容量结论
  • 模型原生 1M 上下文,但 NVIDIA vLLM 配方只在 196,608 上验证,必须把上下文与并发共同压测
  • 官方模型卡的基准与量化质量对比均为厂商自测,8 月 29 日还修订过结果,生产评测应锁定权重与模型卡版本
  • vLLM 配方仍依赖兼容补丁,SGLang 使用开发镜像;合入 PR 不等于已进入稳定版本
  • NVIDIA 与 Moonshot 两层许可均需核对,不能把模型卡中的商业可用表述当作无条件法律结论

本页是官方资料索引与企业选型分析,不构成速度、显存、质量、许可或合规承诺。社区量化与第三方运行时应作为独立供应链组件审计。