OpenBMB · 轻薄本与普通 AI PC

MiniCPM-o 4.5

OpenBMB 的 9B 端侧全模态模型,在一个本地模型中处理视觉、实时语音理解与生成、打断和角色化语音。

查看官方资料 官方源核验于 2026/08/20
参数规模约 9.37B
架构SigLIP2 + Whisper-medium + CosyVoice2 + Qwen3-8B
模态文本、图像、视频、语音理解、语音生成、全双工交互
上下文以具体模式和模型卡为准
Local deployment verdict

部署判断

完整 PyTorch 路径官方建议至少 28GB GPU;llama.cpp-omni 半双工建议 Apple M3/M4/M5 16GB 内存或 NVIDIA 12GB,完整全双工建议 M4 Max 24GB 或 NVIDIA 12GB。

推荐起点
轻薄本与普通 AI PC
常见运行时
Transformers、llama.cpp-omni、OpenBMB 本地实时 Demo、FlagOS
许可
Apache 2.0

型号与精度版本

BF16
GGUF / llama.cpp-omni
AWQ
FlagOS 多芯片版本

同一模型家族中的基础、指令、推理、量化或多模态检查点用途可能完全不同。下载前应核对模型卡、提示模板、分词器、量化方法和运行时版本。

适合放进哪些本地工作流

本地语音数字员工
全双工客服原型
视频与屏幕理解
多芯片端侧验证

端侧模型更适合边界清楚、输入可控、失败可回退的任务。涉及客户承诺、财务写入、生产控制或复杂多步工具调用时,应保留云端高能力模型与人工审批作为升级路径。

进入数字员工路由前怎么测

  1. 加载测试记录具体设备、精度、运行时、上下文与首 Token 时间,避免只写“能跑”。
  2. 任务测试用脱敏企业样本测任务成功率、结构化输出和工具参数正确率。
  3. 压力测试加入长上下文、并发、热启动、内存峰值、功耗和降频观察。
  4. 治理测试验证模型许可、日志、更新、漏洞响应、人工接管与云端回退。

当前研究限制

  • 28GB、16GB、12GB 和 24GB 均为特定模式的厂商建议,不代表统一生产容量
  • 全双工链路包含多个编码器和解码器
  • 公开能力与延迟数据需按中文业务音频复测

本页是官方资料索引与企业选型分析,不构成速度、显存、质量、许可或合规承诺。社区量化与第三方运行时应作为独立供应链组件审计。