当前主线
GPT-5.6 以三档能力构成企业路由:Sol 面向最复杂的软件工程、研究和长程 Agent;Terra 面向需要较强推理但更关注吞吐与成本的主流程;Luna 面向分类、抽取、批量生成和高并发工具调用。三档均提供 1.05M 上下文与最高 128K 输出,避免企业只按“大小模型”粗略分层。
OpenAI 还提供实时音视频、语音、图像、嵌入与审核模型,以及 gpt-oss-120b / 20b 开放权重型号。它们应作为不同能力端点评估,不能用 GPT 主线的表现替代专项模型测试。
Agent 与企业评估
重点测试函数调用、Web Search、File Search、Computer Use、结构化输出与长流程恢复。生产环境应固定模型快照,保存回归集和回退模型,并把推理强度、缓存、批处理与输出长度纳入成本模型。
风险与边界
- 模型别名、工具支持与价格会变化,采购前应按具体模型 ID 复核。
- 百万级上下文不等于应把全部企业资料一次注入;检索、权限过滤和缓存仍然必要。
- 对外部系统有写权限的 Agent 必须使用最小权限、审批点和可追溯日志。