当前主线
MiniMax-M3 提供原生多模态输入、1M 上下文,并聚焦 Agent 推理、代码和工具使用;M2.7 保留为 204,800 上下文的成熟文本档位。Hailuo H3、Speech 2.8、image-01 与音乐模型覆盖视频、语音、图像和音乐生产。
Agent 与企业评估
文本 Agent 应测试工具调用、长任务状态、代码执行与 OpenAI 兼容层差异;语音与视频则应独立测首帧/首包时延、异步任务失败率、风格一致性和并发。百万上下文场景还要验证信息召回率,而不是只验证请求能否发送。
风险与边界
超过 512K 的输入会进入更高价格区间,长任务也会扩大输出成本。媒体端点涉及肖像、声音克隆、版权与内容审核,必须使用授权素材和审批流程。