NVIDIA · 本地服务器

NVIDIA NemotronLabs VoiceChat 11B

NVIDIA 面向实时语音 Agent 发布的 11B 全双工统一模型,在一个架构内处理流式理解、语音生成、打断和工具调用。

查看官方资料 官方源核验于 2026/08/20
参数规模11B
架构11B Dense · 全双工统一语音模型
模态文本提示、流式语音理解、流式语音生成、语音工具调用
上下文官方模型卡未公布
Local deployment verdict

部署判断

11B 权重之外还需加载 Fast Conformer 语音编码器、Nemotron Nano V2 9B 主干、TTS 解码器、音频 codec、KV Cache 与实时服务容器。官方没有给出统一显存占用;不能只按 11B 权重理论下限做容量规划。

推荐起点
本地服务器
常见运行时
vLLM、NVIDIA NeMo Speech、Triton 实时 WebSocket 容器
许可
OpenMDW License 1.1

型号与精度版本

v1.0 Safetensors

同一模型家族中的基础、指令、推理、量化或多模态检查点用途可能完全不同。下载前应核对模型卡、提示模板、分词器、量化方法和运行时版本。

适合放进哪些本地工作流

企业语音数字员工原型
实时客服与坐席辅助评测
语音工具调用
离线与流式语音研究

端侧模型更适合边界清楚、输入可控、失败可回退的任务。涉及客户承诺、财务写入、生产控制或复杂多步工具调用时,应保留云端高能力模型与人工审批作为升级路径。

进入数字员工路由前怎么测

  1. 加载测试记录具体设备、精度、运行时、上下文与首 Token 时间,避免只写“能跑”。
  2. 任务测试用脱敏企业样本测任务成功率、结构化输出和工具参数正确率。
  3. 压力测试加入长上下文、并发、热启动、内存峰值、功耗和降频观察。
  4. 治理测试验证模型许可、日志、更新、漏洞响应、人工接管与云端回退。

当前研究限制

  • 当前模型卡仅标注英语
  • 官方运行路径要求 Linux 与 NVIDIA A100/H100/H200/B100/B200 或 RTX 6000 级 GPU
  • 约 450ms 延迟、榜单与工具调用结果均为厂商指定环境自测
  • OpenMDW 1.1 需按企业用途审查,不能仅凭可下载权重写成宽松开源
  • 模型卡未提供统一显存与并发数据,实时生产容量必须实测

本页是官方资料索引与企业选型分析,不构成速度、显存、质量、许可或合规承诺。社区量化与第三方运行时应作为独立供应链组件审计。