NVIDIA · 高配笔记本与单卡工作站

Nemotron 3.5 Lightning 30B-A3B

NVIDIA 面向长运行 Agent 与本地推理发布的 30B-A3B 混合 MoE 模型,提供 BF16 参考权重和 NVFP4 生产部署路径。

查看官方资料 官方源核验于 2026/08/16
参数规模30B 总参数 / 3B 激活参数
架构Hybrid MoE · Mamba-2 / Attention / MTP
模态文本、代码
上下文最高 1M;BF16 单 H100 官方验证为 256K
Local deployment verdict

部署判断

3B 激活参数主要影响每 Token 计算量,部署仍需容纳 30B 总权重。官方将 BF16 单 H100 80GB 的验证上下文限制为 256K;NVFP4 才是 DGX Spark、H100 与本地推理的优先路径。

推荐起点
高配笔记本与单卡工作站
常见运行时
vLLM、SGLang、llama.cpp / Ollama 生态、NVIDIA DSpark
许可
OpenMDW-1.1

型号与精度版本

BF16
NVFP4
W4A16 / GGUF 部署路径

同一模型家族中的基础、指令、推理、量化或多模态检查点用途可能完全不同。下载前应核对模型卡、提示模板、分词器、量化方法和运行时版本。

适合放进哪些本地工作流

本地 Agent 工作节点
代码与工具调用
领域后训练
DGX Spark / 单卡推理

端侧模型更适合边界清楚、输入可控、失败可回退的任务。涉及客户承诺、财务写入、生产控制或复杂多步工具调用时,应保留云端高能力模型与人工审批作为升级路径。

进入数字员工路由前怎么测

  1. 加载测试记录具体设备、精度、运行时、上下文与首 Token 时间,避免只写“能跑”。
  2. 任务测试用脱敏企业样本测任务成功率、结构化输出和工具参数正确率。
  3. 压力测试加入长上下文、并发、热启动、内存峰值、功耗和降频观察。
  4. 治理测试验证模型许可、日志、更新、漏洞响应、人工接管与云端回退。

当前研究限制

  • A3B 不等于只加载 3B 权重
  • 1M 是模型上限而非所有硬件的默认能力
  • 榜单、吞吐和硬件结果均为 NVIDIA 厂商自测
  • OpenMDW-1.1 需法务核对

本页是官方资料索引与企业选型分析,不构成速度、显存、质量、许可或合规承诺。社区量化与第三方运行时应作为独立供应链组件审计。