MoonshotAI · 对话与推理 · chat

Kimi K3

chat.kimi_k3

Kimi K3 端点深度核验:分离渠道报价与官方规格,解释 2.8T MoE、NVIDIA NVFP4、8×B300 运行时和 Kimi K3 许可边界。

来源等级P2 第三方渠道目录
核验状态已由官方交叉核验
官方参考6 个已登记链接
端点状态渠道标记为可用
Channel price observation

渠道价格快照

输入 ¥20 / 输出 ¥100 · 每百万 Tokens。这是 VibeToken 模型目录与价格接口 在 2026/08/13 的人民币渠道报价,不等同于模型厂商官方价格、合同结算价或性能承诺。

输入 / 百万 Tokens
¥20
输出 / 百万 Tokens
¥100
渠道折扣标记
5%
模型家族kimi-k3
任务类型对话与推理
调用形态Chat API
渠道更新时间2026/07/25

结论:开放权重不等于低门槛私有化

VibeToken 当前收录 kimi-k3 对话端点并给出人民币渠道报价。ClawSphere 将其记录为渠道可用性线索,而不是 Moonshot AI 的官方价格或服务承诺。Kimi K3 的型号、开放权重、架构与上下文已经由 Moonshot AI 官方博客、GitHub 仓库和 Hugging Face 模型卡交叉确认,但渠道的限流、数据保留、地域、可用性与账单仍需独立核验。

官方技术博客于 2026 年 7 月 16 日发布,完整权重仓库随后于 7 月 27 日公开。官方模型仓库列出 2.8T 总参数、104B 激活参数、1,048,576 token 上下文,以及 MXFP4 权重与 MXFP8 激活。这里最重要的企业边界是:104B 激活参数主要描述每 Token 的计算路径,不能用来估算完整权重内存。

官方规格与文档限制

Kimi K3 采用 MoE 架构,每个 Token 从 896 个专家中选择 16 个,并使用共享专家。模型卡的结构表明确列出文本与图像模态;页面叙述同时提到视频理解,因此生产接入前仍应按具体 API 与运行时验证视频输入,而不是从营销性概述直接推导支持范围。

Moonshot AI 公布了大量推理、代码与 Agent 基准,但这些结果主要来自厂商评测、指定推理强度和特定 harness。它们可以帮助设计候选测试集,不能代替企业自己的任务成功率、工具参数正确率、延迟、失败恢复与人工接管测试。

自部署需要按总权重算账

按 2.8T 参数和 4-bit 粗略计算,权重载荷理论下限约 1.4TB;MXFP4 元数据、运行时、KV Cache、视觉编码器、并发和冗余还会继续增加资源需求。因此,Kimi K3 的开放权重价值更接近“可审计、可定制、可在大型集群部署”,而不是“普通工作站可本地运行”。

1M 上下文同样是能力上限,不是默认经济配置。企业应通过检索、摘要、记忆分层和上下文预算控制输入;只有需要跨大量文档、长代码库或长程任务历史时才扩展窗口,并记录真实 KV Cache、延迟和单位成功任务成本。

8 月 29 日运行时核验:NVFP4 仍是集群级部署

NVIDIA 官方 Kimi-K3-NVFP4 模型卡在 8 月 29 日修订评测结果,并补齐可执行的 vLLM 与 SGLang 路径。该检查点把 Kimi K3 的 MXFP4 路由专家转换为 NVFP4,部分注意力投影使用分块 FP8;官方权重元数据约 1.42TB,快速开始说明首次下载约 1.6TB。量化改变精度格式和 Blackwell 执行效率,没有把 2.8T 完整权重变成单机模型。

NVIDIA 的 vLLM 配方在 8 张 B300 上验证,使用 196,608 token,而不是直接验证架构上限 1,048,576;官方模型卡还要求 Kimi-K3 专用公开镜像与兼容补丁。SGLang 的混合 NVFP4/FP8 支持已经合入项目,但模型卡仍使用开发镜像,并提醒等待稳定版本。vLLM 0.28.0 包含大量 Kimi K3 性能优化,也不能自动证明这个混合量化检查点已经不依赖补丁。

8×B300、约 18 分钟启动、榜单差异与量化质量对比都属于 NVIDIA 在指定检查点、镜像和硬件下的厂商自测。企业应该把它们当作容量实验起点,锁定权重提交、镜像、补丁、上下文、并发与工具解析器,再测自己的端到端成功率、启动恢复、峰值内存和单位成功任务成本。完整分析见 Kimi K3 NVFP4 私有化部署研究。

许可不是 Apache 2.0

官方Kimi K3 License允许使用、修改和分发,但对达到特定收入门槛的 Model-as-a-Service 业务要求另行签约,对达到特定月活或收入门槛的商业产品提出名称展示要求;内部使用、官方产品和认证推理伙伴另有例外。企业应由法务按实际业务形态解释条款,本页不构成法律意见,也不把“开放权重”写成“开源软件许可”。

渠道报价与采购边界

VibeToken 在 2026 年 8 月 30 日复核的结构化接口仍列出输入 ¥20、缓存输入 ¥2、输出 ¥100 / 100 万 token,并显示 0.05 折扣字段。本次渠道详情页哈希没有变化,结构化端点也与既有记录一致。该数字只说明渠道当前如何展示报价,不能证明 Moonshot AI 官方价格,也没有自动回答折扣含义、缓存命中规则、税费、SLA、并发和数据驻留。

采购前应分别向模型厂商与渠道确认:API 模型版本是否固定、视觉与工具调用是否完整支持、是否保存请求与输出、数据处理地域、限流与扩容、账单单位、故障赔偿和下线通知。渠道接入和自部署还应作为两条独立路线测算,不能混成一个单价比较。

数字员工路由建议

Kimi K3 适合进入复杂研究、长程代码、多模态文档和高难度工具链候选池;摘要、分类、字段提取等常规节点应优先由更小、更快的模型承担。路由决策至少同时记录成功率、工具调用正确率、端到端延迟、模型与基础设施成本、人工接管率。

生产上线前,用脱敏真实样本比较 Kimi K3 与至少一个独立供应商模型;对工具调用执行幂等、权限、超时与回退测试;自部署按总权重、KV Cache 和高可用冗余做容量规划;商用前完成许可与数据条款审查。

来源与研究限制

研究限制:本页没有下载约 1.6TB 检查点、独立复现实验、测量真实集群成本或审计渠道服务;厂商榜单、启动时间与硬件结果仅视为厂商自测。Moonshot 与 NVIDIA 对视频模态、运行时和验证配置的描述层级不同,接入前需要按具体检查点实测确认。

公开参数字段

来自渠道结构化接口,仅反映当前接入形态。

渠道暂未给出结构化参数;接入前需检查当前 API 文档。