截至 2026 年 8 月 19 日,企业基座模型市场已经从“几个聊天机器人谁更强”变成多层供应体系:旗舰推理模型、低成本吞吐模型、代码模型、原生多模态模型、实时语音、媒体生成、开放权重和端侧模型同时演进。
因此,企业不应只问“最强模型是谁”,而应回答三个问题:我们的任务组合需要哪些模型档位?哪些数据可以进入哪类端点?当价格、版本或供应商发生变化时,能否在不重做业务系统的情况下切换?
14 个主流模型家族的当前坐标
下表中的“当前主线”来自厂商官方模型、价格或产品文档。品牌名不等于固定模型,正式采购仍要核对具体模型 ID、区域和合同。
| 模型家族 | 2026-08-19 当前主线 | 企业观察重点 |
|---|---|---|
| OpenAI GPT | GPT-5.6 Sol / Terra / Luna | 1.05M 上下文、工具与计算机操作、三档成本路由 |
| Anthropic Claude | Claude Fable 5 / Opus 5 / Sonnet 5 | 1M 上下文、代码、知识工作和长程 Agent |
| Google Gemini | Gemini 3.7 Flash 与 Gemini 3.x | 原生多模态、实时交互、Computer Use 与 Google Cloud |
| 阿里 Qwen | Qwen3.7 Max / Plus / Flash | 百万上下文、GUI Agent、代码、开放权重与区域选择 |
| DeepSeek | DeepSeek V4 Flash / Pro | 思考/非思考统一、代码、成本与开放部署 |
| Meta Llama | Llama 4 Scout / Maverick | 多模态 MoE、私有部署、许可与推理生态 |
| Mistral | Medium 3.5 / Small 4 / Large 3 | 欧洲供应链、Apache 2.0 型号、OCR、语音与代码 |
| xAI Grok | Grok 4.6 | 500K 上下文、实时搜索、代码与媒体 API |
| 百度 ERNIE | ERNIE 5.0 Thinking / 4.5 Turbo | 中文、搜索、知识库、千帆 Agent 与版本迁移 |
| 火山豆包 | Doubao Seed 2.0 / Seed-Evolving | GUI Agent、实时语音、图像视频与高并发 API |
| 腾讯混元 | Hunyuan A13B / HY Vision 1.5 | 混合推理、腾讯云生态与 TokenHub 迁移 |
| MiniMax | MiniMax-M3 | 1M 上下文、Agent、代码、语音、视频与音乐 |
| Kimi | Kimi K3 | 1M 上下文、持续思考、动态工具与长程工程 |
| 智谱 GLM | GLM-5.1 | 200K 上下文、128K 输出、Agentic Coding 与多模态 |
2026 年最明显的五个变化
1. 百万上下文从卖点变成工程变量
GPT-5.6、Claude 5、Qwen3.7、MiniMax-M3 和 Kimi K3 都进入百万级上下文区间。上下文变长并没有消除检索、权限和缓存,反而放大了三个问题:无关信息会稀释注意力,敏感信息更容易被过量注入,长输入和长输出会改变成本曲线。
企业要测“关键证据在不同位置时能否被正确使用”,不能只测请求是否成功。
2. Agent 能力正在替代纯聊天能力成为主战场
函数调用只是起点。当前模型开始竞争代码仓库操作、GUI 导航、搜索、动态工具加载、计算机操作和长任务恢复。Agent 评测必须记录工具选择、参数正确性、权限、外部副作用、重试和人工接管,不能只对最终文本打分。
3. 同一家族内部已经需要模型路由
GPT-5.6 有 Sol、Terra、Luna;Qwen3.7 有 Max、Plus、Flash;DeepSeek V4 有 Pro、Flash;Claude 有 Fable、Opus、Sonnet、Haiku。企业无需在“一个供应商一个模型”和“十个供应商任意切换”之间二选一,可以先在家族内部完成高、中、低成本路由,再准备跨供应商回退。
4. 开放权重与闭源 API 的边界更模糊
Qwen、Llama、Mistral、DeepSeek、GLM 等提供开放权重或开放部署选择;OpenAI 也提供 gpt-oss。开放权重提高可控性和部署选择,但不自动带来低成本,也不自动满足合规。闭源 API 则可以通过网关、脱敏、版本固定、审计和区域控制建立治理边界。
真正需要比较的是总拥有成本、数据责任、团队能力和恢复时间。
5. 模型退役已经是生产风险
Kimi 已明确 K2.5 与 Moonshot v1 的关闭日期,腾讯混元将旧文本端点迁往 TokenHub,DeepSeek 旧别名也退出主线。模型生命周期不是厂商新闻,而是业务连续性事项。每个生产端点都要有 owner、固定版本、退役监控、回归集和替代模型。
企业多模型路由的四层结构
第一层是低成本高频模型,用于分类、抽取、去重、格式转换和普通生成。第二层是主力模型,用于知识问答、业务分析、内容生产和常规 Agent。第三层是高能力模型,用于复杂推理、关键代码、长程研究和高风险判断。第四层是专项或本地模型,用于视觉、语音、媒体生成、敏感数据和低时延任务。
路由输入至少包含:任务类型、数据级别、语言、模态、延迟预算、质量阈值、成本上限、所需工具和风险等级。路由输出不仅是模型 ID,还应记录选择原因、实际版本、Token、工具调用、结果和回退路径。
价格不能只看输入 Token
价格页经常同时包含缓存命中、未命中、输出、批处理、长上下文阶梯、思考模式、区域和促销。以当前官方价格为例,OpenAI GPT-5.6 Luna 与 Sol 的输出单价相差 25 倍;Kimi K3 的缓存命中输入与未命中输入相差 10 倍;Qwen3.7 Plus 在输入超过 256K 后进入更高阶梯。
企业应以“成功完成一次业务任务”的成本比较模型:
单任务成本 = 输入 + 缓存 + 输出 + 工具调用 + 检索/媒体 + 失败重试 + 人工复核 + 基础设施分摊
本站的模型规格与价格目录把第三方渠道观察与官方事实分开,适合发现候选;采购结论仍需回到厂商官方文档和企业实测。
结论:稳定资产不是某个模型,而是模型运营系统
公开榜单可以用于发现候选,不能替代真实业务评测。企业真正可积累的资产是任务定义、企业知识、工具契约、评测集、权限体系、路由策略、监控和迁移流程。
访问基座模型观察站可以进入 14 个家族的最新版本、价格、Agent 能力和官方来源;使用企业基座模型选型清单可以把这些信息转成可执行的采购评分卡。