NVIDIA 在 8 月 15 日公开 Kimi-K3-NVFP4 检查点,并于 8 月 29 日修订官方评测。它为 Moonshot AI 的 2.8T 多模态 MoE 增加了可执行的 Blackwell、vLLM 与 SGLang 配方,使“开放权重”进一步变成“可以复核的集群路径”。但企业采购最容易得出错误结论:NVFP4 是 4-bit 量化,不代表模型已经缩到一台服务器;8 张 B300 跑通,也不代表运行时已经达到即装即用的稳定版本。
官方事实:2.8T 总参数没有因量化消失
Moonshot AI 官方模型卡列出 2.8T 总参数、104B 激活参数、896 个专家、每 Token 选择 16 个专家,以及 1,048,576 token 原生上下文。模型覆盖文本、图像、代码与长程 Agent;对视频能力的概述与结构表层级并不完全一致,仍需按具体检查点和接口核验。
NVIDIA Kimi-K3-NVFP4 模型卡说明,量化过程把原始 MXFP4 路由专家转换为 NVFP4,并把受支持的注意力投影转换为 128×128 分块 FP8,其他张量保留原精度。官方权重元数据约 1.42TB,快速开始提示首次下载约 1.6TB。
这组数字说明了量化的真实作用:它改变权重格式、内核与 Blackwell 执行效率,但没有删除全部专家。104B 激活参数主要影响每 Token 的计算量,不是显存容量;部署仍要为 2.8T 完整权重、量化尺度、视觉组件、KV Cache、通信、批次和运行时工作区准备资源。
8 张 B300 是厂商验证点,不是最低配置承诺
NVIDIA 的 vLLM 配方使用 8 张 B300、张量并行 8、FP8 KV Cache、32 个最大并发序列,并把模型长度设为 196,608。官方解释,这是经过验证的 TP8 运行点,而不是模型 1M 架构上限。上下文和并发必须一起调节,不能把 1M 写进采购表后仍沿用 196K 配方的容量判断。
模型卡还披露,在指定 8×B300 环境中,fastsafetensors 启动约 18 分钟。这是 NVIDIA 在特定镜像、权重缓存、网络、补丁与硬件下的厂商自测,不是独立测量,也不是重启恢复 SLA。企业还要测试冷下载、缓存命中、节点故障、权重校验、滚动升级、并发爬升与长上下文峰值;生产通常还需要第二副本或可接受的冷备策略。
因此,Kimi K3 NVFP4 型号页把它归为本地服务器/集群候选。NVFP4 可以降低相对高精度权重的内存和带宽压力,却不能把 1.6TB 下载量推导成单机、单卡或普通 AI PC 部署。
vLLM 0.28 的性能进展不等于混合量化已完全主线化
vLLM 0.28.0 官方发布包含一组 Kimi K3 优化:Decode Context Parallel、KDA 融合内核、序列并行通信、推测解码和共享专家分片等。发布说明中的 1.5—3 倍内核收益、约 60% DSpark TTFT 改进与每 GPU 节省约 17GiB,都是项目在特定组件和条件下披露的结果,不能直接相加,也不能外推为端到端吞吐倍数。
更关键的是,NVIDIA 模型卡仍要求 Kimi-K3 专用公开镜像和仓库内兼容补丁,并列出混合 FP8_PB_WO、Kimi K3 融合投影等尚在推进的上游工作。安装最新稳定版 vLLM,并不自动等于能按模型卡命令加载该检查点。
SGLang 的混合 NVFP4/FP8 支持 PR 已合入,但 NVIDIA 配方使用从开发分支构建的专用镜像,并明确提醒普通 pip 版本不能加载该检查点。合并代码、进入开发镜像、进入正式 Release 和形成长期维护承诺,是四个不同成熟度阶段。企业架构评审必须记录具体权重提交、容器摘要、补丁、CUDA 与驱动,而不是只写“支持 vLLM/SGLang”。
厂商自测只决定是否进入企业评测池
NVIDIA 比较了原始 Kimi K3 与 NVFP4 在 GPQA Diamond、SciCode、MMMU-Pro、长上下文和 Terminal-Bench 等结果,8 月 29 日还对基准数字做了修订。所有分数与量化差异都属于厂商自测;本文没有下载约 1.6TB 权重,没有占用 8 张 B300,也没有复现吞吐、启动时间、基准或多模态输入。
企业应该建立自己的回放集:长代码库任务测补丁正确率、测试通过率和回退;多模态知识工作测证据引用与视觉输入失败;工具 Agent 测参数正确率、重复写入、超时和人工接管。容量测试至少覆盖 32K、128K、196K 和确有业务价值的更长窗口,同时记录首 Token、稳态输出、峰值内存、通信、失败恢复和每次成功任务成本。
编辑判断是:这次更新显著提高了 Kimi K3 私有化的可验证性,但成熟度仍处于“固定镜像和补丁的受控评测”,而不是“任意稳定版运行时的标准化生产部署”。采购合同需要把镜像、补丁维护、权重版本、驱动升级和故障支持写清楚。
两层许可必须同时进入上线门禁
NVIDIA 模型卡把检查点置于 NVIDIA Open Model Agreement 下,并同时链接 Kimi K3 License。后者对达到收入门槛的 Model as a Service 要求另行签约,并对超大规模商业产品提出名称展示条件,内部使用与认证推理伙伴另有例外。
“官方模型卡写明可商业使用”不能替代法务审查。企业要分别判断模型权重、NVIDIA 转换检查点、容器、兼容补丁、推测解码模型和输入数据的权利,还要确认业务属于内部数字员工、内嵌功能、托管服务还是允许第三方控制输入与参数的 MaaS。本文不构成法律意见。
对企业部署与采购的建议
第一,先比较 API 与自部署路线。Kimi K3 适合高难度长程任务,不应默认承担摘要、分类等常规节点;用模型路由方法比较每次成功任务成本,而不是只比较 Token 单价或 GPU 数量。
第二,把运行时当成受控供应链。镜像使用摘要锁定,补丁进入内部仓库,权重记录提交哈希;升级 vLLM、SGLang、CUDA 或驱动前必须回放工具调用、多模态、长上下文和失败恢复。
第三,把 8×B300 当作厂商基线,不是采购答案。根据目标并发、上下文、可用性和恢复时间设计容量,验证单节点与多节点边界,并把高可用副本、网络和 1.6TB 权重分发时间纳入总拥有成本。
第四,渠道和自部署事实分栏。本次 Kimi K3 端点深度核验显示,VibeToken 渠道接口仍列输入 ¥20、缓存 ¥2、输出 ¥100 / 100 万 token;它只是 P2 渠道报价观察,不能证明 Moonshot 官方价格,也不能推导 NVIDIA 自部署成本。
Kimi K3 NVFP4 的价值不是让 2.8T 变“小”,而是把量化格式、硬件、运行时和补丁暴露成可审计的部署对象。企业真正要采购的,是可复现、可升级、可回退的整条推理供应链。
来源与研究限制
- P0 官方量化模型卡:NVIDIA Kimi-K3-NVFP4,初始公开快照为 2026-08-15,评测于 2026-08-29 修订。
- P0 官方基座资料:Moonshot AI Kimi-K3与 Kimi K3 License。
- P0 官方运行时发布:vLLM 0.28.0与 SGLang 0.5.18。
- P0 上游实现记录:SGLang Kimi K3 混合 NVFP4/FP8 支持与 vLLM ModelOpt 混合检查点支持。
研究限制:本文只核对公开模型卡、仓库、Release 与 PR 状态,没有运行模型或获得 Moonshot、NVIDIA 的企业合同、SLA 与生产账单。文件大小来自官方元数据,8×B300、启动时间和基准属于厂商自测;实际资源、质量、稳定性和法律结论必须由企业在目标环境复核。