On-device & local model research

端侧模型与本地部署研究站

从手机、嵌入式设备到 AI PC、Mac、单卡工作站和企业本地服务器,持续研究通用语言、视觉、语音、OCR、设备操作与安全模型真正需要什么资源、适合什么任务,以及进入数字员工路由前还要验证什么。

48 个模型家族150 个型号与版本19 家厂商6 类端侧工作负载核验于 2026/08/30
“能下载”不等于“能在你的设备稳定生产运行”。

页面只收录有官方开放权重或本地部署路径的模型。硬件层级用于缩小候选范围;最终内存、速度、能力和许可要按量化格式、上下文、KV Cache、并发与真实业务样本复核。

Urgent update · 2026-08-30

Kimi K3 NVFP4:8 张 B300 验证仍不等于“量化后即装即用”

官方检查点约 1.6TB,104B 激活参数不是权重内存;vLLM 与 SGLang 的镜像、补丁和稳定版本边界会直接影响私有化采购。

近期更新:GLM-5.3 编码 Agent 安全治理 · UI-Venus-2 GUI Agent 治理 · M5 Ultra 本地推理

2026-08-30 目录状态

从“本地聊天模型”扩展到完整端侧 Agent 栈

当前覆盖 48 个模型家族,并为通用、视觉、语音、OCR、设备操作和安全模型标注官方来源、资源判断、许可与厂商自测边界。

01

通用语言与 Agent

17 个模型家族

02

视觉与多模态

12 个模型家族

03

语音与全模态

9 个模型家族

04

文档与 OCR

4 个模型家族

05

设备操作 Agent

4 个模型家族

06

安全护栏

2 个模型家族

先按设备选候选池

参数量只是入口。MoE 的激活参数影响计算量,但部署时通常仍要容纳全部专家权重。

01

嵌入式与手机

优先观察 90M—4B、移动优化检查点与设备专用运行时。

典型:Gemma 3n、LFM2.5、MiniCPM-V、SmolVLM2
02

普通 AI PC

关注 4B—14B 量化模型、统一内存带宽、能效与离线交互延迟。

典型:Qwen 小型系列、Phi-4、Ministral 3、Ling Tiny
03

单卡工作站

可进入 20B—35B 量化或稀疏 MoE,但必须测量 KV Cache 与并发余量。

典型:Qwen 27B、GPT-OSS-20B、Gemma 4 26B-A4B
04

本地服务器

面向多用户、长上下文和高可用,重点转向吞吐、隔离、审计与总拥有成本。

不要把“本地运行成功”误当成“生产服务可用”

端侧与本地模型目录

搜索具体型号,也可按厂商、工作负载和设备层级筛选。

阅读选型方法
48 个模型家族符合条件 · 最多选择 3 个横向比较
NVIDIA语音与全模态

NVIDIA NemotronLabs VoiceChat 11B

NVIDIA 面向实时语音 Agent 发布的 11B 全双工统一模型,在一个架构内处理流式理解、语音生成、打断和工具调用。

规模
11B
架构
11B Dense · 全双工统一语音模型
模态
文本提示、流式语音理解、流式语音生成、语音工具调用
本地判断
11B 权重之外还需加载 Fast Conformer 语音编码器、Nemotron Nano V2 9B 主干、TTS 解码器、音频 codec、KV Cache 与实时服务容器。官方没有给出统一显存占用;不能只按 11B 权重理论下限做容量规划。
v1.0 Safetensors
NVIDIA视觉与多模态

Kimi K3 / NVIDIA NVFP4

NVIDIA 为 Moonshot Kimi K3 提供的混合 NVFP4/FP8 检查点和 8×B300 部署配方,把 2.8T 多模态 Agent 模型从理论开放权重推进到可复核的集群运行路径。

规模
2.8T 总参数 / 104B 激活参数;每 Token 选择 896 个专家中的 16 个
架构
Kimi Delta Attention + LatentMoE · 原生多模态 MoE
模态
文本、图像、视频、代码、工具调用
本地判断
104B 激活参数只描述每 Token 的计算路径,加载仍需容纳 2.8T 总权重。NVIDIA 官方 NVFP4 检查点权重元数据约 1.42TB,快速开始说明首次下载约 1.6TB,并在 8 张 B300 上验证;KV Cache、并发、运行时、通信与高可用副本还会继续增加资源需求。
Moonshot MXFP4 / MXFP8 原始权重NVIDIA NVFP4 路由专家 + 分块 FP8 注意力
智谱 Z.ai通用语言与 Agent

GLM-5.3

Z.ai 在 GLM-5.2 基座上通过后训练更新编码、长程 Agent 与网络安全任务能力的 744B-A40B 文本模型,提供 FP8、BF16 权重和多套服务器运行时。

规模
744B 总参数 / 40B 激活参数
架构
DSA 稀疏注意力 MoE · 文本推理与编码 Agent
模态
文本、代码、工具调用
本地判断
40B 激活参数只描述每 Token 的专家计算路径,不是完整权重内存。官方 FP8 仓库 141 个权重分片合计约 755.6GB;生产服务还要预留 KV Cache、并发、通信和运行时工作区,属于多 GPU 或集群级部署。
FP8BF16
智谱 Z.ai视觉与多模态

GLM-5.3-Flash

Z.ai 首个 GLM-5 原生多模态 Flash 型号,用更低激活参数、混合稀疏/线性注意力与 45 层架构面向编码、长程 Agent、视觉办公和 GUI 操作。

规模
320B 总参数 / 18B 激活参数
架构
稀疏注意力 + 线性注意力 · 原生多模态 MoE
模态
文本、图像、视频、代码、GUI 操作
本地判断
18B 激活参数只描述每 Token 的计算路径,加载仍需容纳约 320B 总权重。官方 FP8 仓库权重仍是 300GB 以上量级,生产部署还要加入视觉编码器、KV Cache、上下文、并发、通信与运行时工作区。
FP8BF16
百灵 / inclusionAI通用语言与 Agent

Ling-3.0-flash

百灵面向长程 Agent 与生产推理发布的 124B-A5.5B 混合线性 MoE 模型,提供官方量化权重及三类预训练 Base 检查点。

规模
124B 总参数 / 5.5B 激活参数(非嵌入 5.1B)
架构
Hybrid-linear MoE · KDA / MLA / MTP
模态
文本、代码
本地判断
5.5B 激活参数主要影响每 Token 计算量,部署仍需容纳 124B 总权重。官方 FP4 与 INT4 示例均使用 2 张 Blackwell GPU;上下文、缓存、并发和运行时工作区还会增加实际占用。
BF16FP8INT4FP4
阿里云 Qwen设备操作 Agent

Qwen3.8-Flash-Next

Qwen 面向 Qwen4 架构预览开放的多模态 MoE 模型,用稀疏注意力、门控残差与可卸载 N-gram Embedding 降低长上下文和推理计算成本。

规模
125B 主模型 + 51B N-gram Embedding + 4B MTP / 6B 激活参数
架构
Gated DeltaNet + Qwen Sparse Attention · 多模态 MoE
模态
文本、图像、视频
本地判断
官方仓库权重统计约 180B 参数;6B 激活参数主要影响每 Token 计算量,不能用来估算完整权重内存。N-gram Embedding 可卸载到主机内存并异步预取,但只是改变内存分层与带宽压力,不会消除 51B Embedding 权重。
BF16 官方权重社区 GGUF / MLX 量化需单独核验
Apple通用语言与 Agent

Apple OpenELM

Apple 发布的 270M—3B 高效语言模型与完整训练框架,是端侧架构研究的重要基线,而非 Apple Intelligence 产品模型。

规模
270M / 450M / 1.1B / 3B
架构
Layer-wise Scaled Transformer
模态
文本
本地判断
参数规模适合 Apple Silicon 和端侧研究,但官方原始路径依赖 CoreNet/Transformers 自定义代码;企业使用应先验证当前 MLX、量化和系统版本兼容。
BaseInstruct270M450M
Google语音与全模态

Gemma 4 E2B / E4B

Gemma 4 中面向手机和笔记本的多模态小型型号,原生处理文本、图像与音频,适合端上助手和感知任务。

规模
E2B / E4B 有效参数档
架构
高效 Dense · Per-Layer Embeddings
模态
文本、图像、音频、视频输入
本地判断
Google 将 E2B 定位于移动设备,将 E4B 定位于移动设备与笔记本;有效参数不是静态权重占用的直接等价物。
Gemma 4 E2BGemma 4 E4B
Google语音与全模态

Gemma 3n E2B / E4B

Google 专为手机、平板和笔记本设计的多模态端侧模型,支持文本、视觉、视频与音频输入。

规模
E2B / E4B 有效参数;E2B 标准加载超过 5B
架构
MatFormer · PLE Cache · MobileNet-V5
模态
文本、图像、视频、音频输入
本地判断
E2B/E4B 是有效参数口径。Google 说明 E2B 标准执行会加载超过 5B 参数,只有配合 PLE 缓存、参数跳过和条件模态加载才能接近 1.91B 有效内存负载。
E2B ITE4B ITLiteRT-LM
Hugging Face通用语言与 Agent

SmolLM3-3B

Hugging Face 完整开放训练配方的 3B 长上下文小模型,兼顾推理模式、工具调用和多种端侧运行时。

规模
3B
架构
Dense Transformer Decoder
模态
文本、推理、工具调用
本地判断
官方提供多种端侧格式,适合 CPU、Apple Silicon、移动运行时和单卡服务;128K 不是低内存设备的免费能力,KV Cache 仍需单独预算。
Instruct / ReasoningBaseGGUFONNX
Hugging Face视觉与多模态

SmolVLM2 本地视觉家族

从 256M 到 2.2B 的超轻量视频语言模型,覆盖手机本地视频理解、图像问答和浏览器端视觉任务。

规模
256M / 500M / 2.2B
架构
Idefics3-based Compact VLM
模态
文本、图像、视频
本地判断
500M 模型官方给出视频推理约 1.8GB GPU RAM;256M 和 500M 可通过 MLX、ONNX/WebGPU 进入手机、浏览器和轻量设备。
256M Video Instruct500M Video Instruct2.2B Video InstructMLX
Liquid AI通用语言与 Agent

LFM2.5-2.6B

Liquid AI 面向设备端 Agent 发布的 2.6B 混合架构模型,覆盖工具调用、长上下文、多平台量化和 DSpark 推测解码。

规模
2.69B
架构
Hybrid Convolution / GQA
模态
文本、工具调用、推理
本地判断
官方提供 GGUF、ONNX、MLX 与 WebGPU 路径;ONNX Q4F16 约 1.5GB、MLX 4-bit 约 1.47GB。厂商宣称低于 2.5GB 内存可运行,但具体速度和内存属于指定设备自测。
AgenticBaseGGUFONNX
Meta通用语言与 Agent

Llama 3.2 1B / 3B

Meta 面向移动与边缘设备发布的轻量 Llama 型号,适合摘要、改写、知识检索和设备端文本助手。

规模
1B / 3B
架构
Dense Transformer
模态
文本
本地判断
Meta 明确将 1B 与 3B 定位为边缘和移动设备的轻量文本模型;真实可用上下文仍受设备内存限制。
Llama 3.2 1BLlama 3.2 3BInstruct
Microsoft通用语言与 Agent

Phi-4-mini

Microsoft 面向受限算力与低延迟场景的轻量模型系列,覆盖通用指令、函数调用和数学推理。

规模
3.8B
架构
Dense Transformer
模态
文本
本地判断
3.8B 参数适合量化后进入普通 AI PC 与部分边缘设备;128K 是能力上限,不是端侧默认可用配置。
Phi-4-mini-instructPhi-4-mini-reasoningPhi-4-mini-flash-reasoning
Mistral AI视觉与多模态

Ministral 3

Mistral 面向 edge 与 local 场景发布的 3B、8B、14B 多模态模型系列,每个尺寸包含基础、指令和推理版本。

规模
3B / 8B / 14B
架构
Dense · 多模态
模态
文本、图像
本地判断
3B、8B、14B 覆盖边缘设备到本地工作站;每个尺寸均有不同训练用途和精度版本,不能只按名称判断占用。
Ministral 3 3BMinistral 3 8BMinistral 3 14BBase / Instruct / Reasoning
NVIDIA语音与全模态

Nemotron 3 Nano 4B

NVIDIA 首个专门面向端上部署优化的 Nemotron 3 小模型,聚焦本地对话 Agent、角色和 IoT 自动化。

规模
4B
架构
Hybrid Mamba/Attention
模态
文本、代码
本地判断
NVIDIA 将其定位为 Jetson Thor、Jetson Orin Nano、GeForce RTX 与 DGX Spark 的 edge-ready 小模型。
BF16GGUF
NVIDIA设备操作 Agent

Cosmos3-Edge

NVIDIA 面向机器人、自动驾驶和智能空间的 4B 多模态世界模型,可生成文本、图像、视频与动作轨迹,并提供 Jetson 设备操作路径。

规模
4B 可训练参数
架构
Mixture-of-Transformers · 自回归 + 扩散双塔
模态
文本、图像、视频、动作轨迹
本地判断
官方仅验证 BF16 与 NVIDIA GPU 路径,并公布 Jetson Thor 16GB—128GB、AGX Orin 64GB 等平台结果;这证明特定嵌入式设备路径,不代表普通手机芯片可直接加载运行。
Cosmos3-EdgeCosmos3-Edge-Policy-DROID
OpenBMB文档与 OCR

MiniCPM-V 4.6

OpenBMB 面向低资源设备发布的超轻量视觉语言模型,覆盖单图、多图、视频、OCR 与工具调用。

规模
约 1.3B
架构
SigLIP2-400M + Qwen3.5-0.8B
模态
文本、图像、视频、工具调用
本地判断
官方 GGUF Thinking 版本给出约 2GB CPU 内存起点,BNB/AWQ/GPTQ 量化版本给出约 3GB GPU 内存起点;图像分辨率、视频帧数和视觉 Token 会显著改变峰值。
InstructThinkingGGUFBNB INT4
TII通用语言与 Agent

Falcon-H1-Tiny

TII 的极小混合架构语言模型家族,用 90M—100M 参数覆盖嵌入式实验、专用微调和轻量离线任务。

规模
90M / 100M 多语言档
架构
Hybrid Transformer + Mamba
模态
文本
本地判断
90M BF16 权重约 185MB,官方同时提供 GGUF、llama.cpp、Ollama 与 MLX 路径,适合作为嵌入式分类、提取和专用微调基座。
90M Base90M Instruct90M Reasoning100M Multilingual
智谱 Z.ai文档与 OCR

GLM-OCR 0.9B

面向企业文档、表格、印章和复杂版面的轻量 OCR 模型,可在 Ollama 或本地服务中运行。

规模
约 0.9B(仓库统计约 1.33B)
架构
轻量视觉语言 OCR 模型
模态
图像、PDF、文本输出、表格与版面
本地判断
模型规模适合边缘文档流水线,但完整 OCR 方案还可能加载 PP-DocLayoutV3 进行版面分析;应把两部分许可、内存和延迟共同计入。
BF16Ollama 本地包
智谱 Z.ai语音与全模态

GLM-ASR-Nano-2512

智谱面向中文、英文、粤语和低音量场景发布的轻量本地语音识别模型。

规模
厂商口径 1.5B;仓库统计约 2.26B
架构
轻量语音识别 Transformer
模态
语音输入、文本转写、中文、英文、粤语
本地判断
官方 BF16 权重文件约 4.52GB;运行时还需要音频处理器、缓存和解码内存,低内存设备应优先验证量化与分段策略。
BF16官方兼容 Transformers
百灵 / inclusionAI安全护栏

SingGuard 多模态安全护栏

可把运行时自然语言安全策略作为输入的多模态护栏家族,覆盖文本、图像、图文组合以及请求侧和响应侧审核。

规模
0.8B / 2B / 4B / 8B
架构
Qwen3-VL 系列微调 · 生成式多模态护栏
模态
文本、图像、图文组合、用户输入与模型响应
本地判断
0.8B—4B 型号与 GGUF 便于在受限设备或本地网关评测,但视觉编码器、图像分辨率、策略文本、推理输出与 KV Cache 都会增加实际占用;官方未给出统一设备内存或吞吐数据。
SingGuard 0.8BSingGuard 2BSingGuard 4BSingGuard 8B
阿里云 Qwen通用语言与 Agent

Qwen3.5 小型系列

覆盖从嵌入式实验到普通 AI PC 的轻量 Qwen 型号,适合按设备能力建立分级模型路由。

规模
0.8B / 2B / 4B / 9B
架构
Dense Transformer
模态
文本、以具体模型卡为准
本地判断
0.8B—4B 更适合内存受限设备;9B 更适合 8—16GB 级本地环境。真实占用需加入上下文、缓存和运行时开销。
Qwen3.5-0.8BQwen3.5-2BQwen3.5-4BQwen3.5-9B
DeepSeek通用语言与 Agent

DeepSeek-R1 Distill Local

把 R1 推理模式蒸馏到 Qwen 与 Llama 小型基座的模型组,是本地推理研究的常用基线。

规模
1.5B / 7B / 8B / 14B / 32B / 70B
架构
Dense Distill · Qwen / Llama 基座
模态
文本、推理
本地判断
1.5B—14B 覆盖普通本地设备,32B 更适合高配工作站,70B 通常进入多卡或大统一内存设备。
R1-Distill-Qwen-1.5BR1-Distill-Qwen-7BR1-Distill-Llama-8BR1-Distill-Qwen-14B
Google语音与全模态

Gemma 4 12B Unified

Gemma 4 的统一多模态 12B 型号,覆盖文本、图像与音频输入,并提供 MTP assistant drafter 作为推测解码路径。

规模
12B
架构
Dense · 统一多模态
模态
文本、图像、音频、视频输入
本地判断
官方定位为笔记本、台式机和小型服务器;量化后仍需为多模态编码与长上下文预留额外内存。
Gemma 4 12B Unified12B IT MTP assistant drafter
IBM通用语言与 Agent

Granite 4.2 Local

IBM 面向企业 Agent 发布的 3B、8B、30B Dense 开放权重模型,在同一权重中提供完整推理、低强度推理和非推理模式,并支持工具调用。

规模
3B / 8B / 30B
架构
Dense Transformer · 原生推理
模态
文本
本地判断
3B BF16 权重文件元数据约 6.8GB,GGUF 量化大小随格式变化;8B 与 30B 应分别按高配工作站和本地服务器评估。128K/512K 上下文还会显著增加 KV Cache 与运行时占用。
Granite 4.2 3BGranite 4.2 8BGranite 4.2 30BGGUF
Meta视觉与多模态

Llama 3.2 Vision 11B

Meta 的 11B 本地视觉语言模型,覆盖图像识别、视觉推理、描述和单图问答。

规模
10.6B / 11B
架构
Llama 3.1 + Vision Adapter Cross-Attention
模态
文本、图像输入
本地判断
官方 BF16 仓库约 21GB,适合 24GB 级显存或更大统一内存;消费级设备通常需要量化,并额外计算视觉适配器和图像输入开销。
BaseInstruct
Microsoft语音与全模态

Phi-4-multimodal

把语音、视觉和语言放在统一表示空间中的紧凑模型,适合离线感知、文档理解和多模态设备助手。

规模
5.6B
架构
统一多模态 · Mixture-of-LoRAs
模态
文本、图像、音频
本地判断
5.6B 模型面向设备与边缘计算,但完整音频、视觉能力对运行时和显存的要求高于纯文本 5.6B 模型。
Phi-4-multimodal-instruct
Mistral AI安全护栏

Shieldstral 1.0 3B

Mistral 的 3B 策略自适应多模态安全分类器,可按自然语言政策在本地对文本和图像输出连续风险分数。

规模
约 3.85B
架构
Policy-adaptive Multimodal Safety Classifier
模态
文本、图像、多模态安全评分
本地判断
官方说明 BF16 可在 16GB 显存运行;图像审核需要语言模型与独立 mmproj 文件,量化时不能漏算视觉投影组件。
BF16GGUF / llama.cpp 路径
NVIDIA语音与全模态

Nemotron-Labs-Audex-2B

NVIDIA 的 2B 统一音频文本模型,可在同一权重中处理音频理解、ASR、翻译、TTS、音频生成与文本推理,适合本地语音 Agent 原型。

规模
2B
架构
2B Dense · 统一音频文本模型
模态
文本、音频理解、语音识别与翻译、语音与音频生成
本地判断
2B Dense 主干降低了本地推理门槛,但音频编码器、离散音频词表、编解码器、128K KV Cache 与运行时插件都会增加实际内存;官方未给出统一设备占用,需按具体任务测量。
多阶段 SFT 权重
OpenBMB语音与全模态

MiniCPM-o 4.5

OpenBMB 的 9B 端侧全模态模型,在一个本地模型中处理视觉、实时语音理解与生成、打断和角色化语音。

规模
约 9.37B
架构
SigLIP2 + Whisper-medium + CosyVoice2 + Qwen3-8B
模态
文本、图像、视频、语音理解、语音生成、全双工交互
本地判断
完整 PyTorch 路径官方建议至少 28GB GPU;llama.cpp-omni 半双工建议 Apple M3/M4/M5 16GB 内存或 NVIDIA 12GB,完整全双工建议 M4 Max 24GB 或 NVIDIA 12GB。
BF16GGUF / llama.cpp-omniAWQFlagOS 多芯片版本
OpenGVLab文档与 OCR

InternVL3.5 小型系列

OpenGVLab 的多尺寸视觉语言系列,以 1B/2B 型号覆盖端侧视觉任务,并提供标准 Transformers 格式。

规模
1.1B / 2.35B / 4B / 8B
架构
InternViT + Qwen3 Language Model
模态
文本、图像、多图、视频
本地判断
1B/2B 适合低资源视觉任务,4B/8B 更适合普通 AI PC;图像块数量、多图和视频帧会快速推高视觉 Token 与显存。
1B2B Instruct2B MPO2B HF
TII视觉与多模态

Falcon Perception 0.6B

TII 的 0.6B 专用视觉语言模型,用自然语言查询在图像中定位一个或多个目标并输出像素级实例掩码;8 月 19 日增加高密度场景 RL 后训练版本。

规模
0.6B
架构
Dense early-fusion Vision-Language Transformer
模态
文本提示、图像、开放词汇定位、实例分割
本地判断
0.6B BF16 权重理论下限约 1.2GB,但实际还需图像 Token、全分辨率掩码、FlexAttention、编译缓存和运行时工作区。官方快速开始使用 CUDA,未公布统一显存占用,也没有证明可直接在手机芯片运行。
主检查点RL post-training revision 19-08-2026
智谱 Z.ai视觉与多模态

GLM-4.6V-Flash

智谱面向本地低延迟视觉 Agent 的 9B 级多模态模型,支持长上下文、界面理解与原生函数调用。

规模
约 10.3B
架构
Dense Vision-Language Transformer
模态
文本、图像、视频、函数调用
本地判断
官方 BF16 权重约 20.6GB,更适合 24GB 级显存或更高统一内存;消费级低内存设备通常需要量化,但社区量化不是官方性能承诺。
BF16社区量化需单独核验
智谱 Z.ai设备操作 Agent

AutoGLM-Phone-9B

面向 Android GUI 操作的开放权重手机 Agent,通过视觉理解、规划与 ADB 执行自然语言设备任务。

规模
9B 级
架构
GLM-4.1V-9B-Thinking · GUI Agent
模态
文本、手机截图、GUI 动作
本地判断
模型通常运行在电脑或本地服务器,通过 ADB 控制 Android 手机;它不是把 9B 权重直接装进手机。部署还需要截图传输、动作执行、应用适配和设备权限。
中文Multilingual
百灵 / inclusionAI通用语言与 Agent

Ling-3.0-tiny

面向本地 Agent 与真实任务的轻量 MoE 模型,每 Token 激活 1.4B 参数,提供 256K 部署配方、量化权重及三类预训练 Base 检查点。

规模
7.9B 总参数 / 1.4B 激活参数(非嵌入 1.14B)
架构
稀疏 MoE · 原生混合推理
模态
文本
本地判断
1.4B 激活参数只描述每 Token 的计算路径,加载仍需容纳 7.9B 总权重。官方称 FP8 在 8K 上下文的 M4 Pro MacBook 峰值约 8.34GiB;该数字属于厂商指定环境自测,不能替代 INT4、长上下文与并发实测。
BF16FP8INT4Base-30T
Google视觉与多模态

Gemma 4 26B-A4B / 31B

Gemma 4 的高能力本地与私有化候选,分别用稀疏 MoE 和 Dense 路线覆盖工作站与服务器部署。

规模
26B 总参数 / 4B 激活;31B Dense
架构
MoE 26B-A4B / Dense 31B
模态
文本、图像、视频输入
本地判断
Google 将 26B-A4B 定位于台式机与小型服务器,将 31B 定位于大型服务器或集群;量化和上下文决定能否进入单机工作站。
Gemma 4 26B-A4BGemma 4 31B
NVIDIA通用语言与 Agent

Nemotron 3.5 Lightning 30B-A3B

NVIDIA 面向长运行 Agent 与本地推理发布的 30B-A3B 混合 MoE 模型,提供 BF16 参考权重和 NVFP4 生产部署路径。

规模
30B 总参数 / 3B 激活参数
架构
Hybrid MoE · Mamba-2 / Attention / MTP
模态
文本、代码
本地判断
3B 激活参数主要影响每 Token 计算量,部署仍需容纳 30B 总权重。官方将 BF16 单 H100 80GB 的验证上下文限制为 256K;NVFP4 才是 DGX Spark、H100 与本地推理的优先路径。
BF16NVFP4W4A16 / GGUF 部署路径
NVIDIA通用语言与 Agent

Nemotron 3 Nano 30B-A3B

NVIDIA 的统一推理/非推理 MoE 模型,用较低激活参数瞄准高配本地工作站和企业边缘服务器。

规模
30B 总参数 / 约3.5B激活参数
架构
Hybrid MoE · Mamba-2/Attention
模态
文本、代码
本地判断
30B 总权重更适合 RTX 工作站、DGX Spark 或本地服务器;A3B 主要降低计算,不会把权重内存变成 3B。
BF16FP8
OpenAI通用语言与 Agent

gpt-oss-20b

OpenAI 面向低延迟、本地和专用场景发布的开放权重推理模型,以原生 MXFP4 在约 16GB 内存档运行。

规模
21B 总参数 / 3.6B 激活参数
架构
稀疏 MoE · MXFP4
模态
文本
本地判断
OpenAI 官方给出的 MXFP4 内存要求约为 16GB;Apple Silicon、Ollama、LM Studio 和 vLLM 的适配路径不同。
gpt-oss-20b
百度 ERNIE视觉与多模态

ERNIE 4.5 本地模型家族

百度开放的 ERNIE 4.5 本地家族,从 0.3B 测试模型延伸到 21B-A3B 文本与 28B-A3B 多模态型号。

规模
0.3B / 21B-A3B / VL 28B-A3B
架构
Dense + MoE + Multimodal Heterogeneous MoE
模态
文本、图像、视频、推理
本地判断
0.3B 适合架构实验和窄任务;21B-A3B 与 VL-28B-A3B 仍需加载全部 MoE 权重,A3B 只表示每 Token 激活计算量。量化后才更接近单卡工作站部署。
0.3B Base / PT21B-A3B Base / PT / ThinkingVL-28B-A3B Base / PT
百灵 / inclusionAI设备操作 Agent

UI-Venus-2-9B

面向移动应用、网页和桌面系统的 9B 视觉 GUI Agent 开放权重,通过截图观察、推理、动作和环境反馈形成闭环。

规模
9B 级 Dense 多模态模型;官方 BF16 权重文件约 18.82GB
架构
Qwen3.5-9B 微调 · 视觉闭环 GUI Agent
模态
截图、文本、移动端、网页与桌面 GUI 操作
本地判断
官方权重索引给出的 BF16 文件总大小约 18.82GB;实际服务还需视觉预处理、KV Cache、长轨迹历史、vLLM 工作区与执行框架内存。移动应用能力通过截图、ADB 或浏览器框架实现,不表示 9B 权重直接在手机芯片运行。
BF16 Safetensors
百灵 / inclusionAI文档与 OCR

ArmorOCR

面向低对比、旋转、编码和上下文融合等对抗性视觉文字的可定位 OCR 模型,可在原图上单次推理并输出文字区域与答案。

规模
约 8.77B BF16 参数
架构
Qwen3-VL-8B-Instruct 微调 · Grounded Adversarial OCR
模态
图像、文本、区域定位、OCR 与视觉问答
本地判断
8.77B BF16 权重理论下限约 17.5GB,实际还需视觉输入、KV Cache、生成输出、Transformers 与运行时工作区。官方目前未提供量化权重、统一显存或手机芯片运行数据,不能因 OCR 场景而写成可直接在移动端运行。
BF16 Safetensors
阿里云 Qwen视觉与多模态

Qwen3.8-27B

Qwen3.8 的 27B Dense 开放权重型号,原生支持文本、图像与视频,并为长程 Agent 提供可调推理强度和思考保留机制。

规模
27.8B
架构
Dense Hybrid Attention · 多模态
模态
文本、图像、视频
本地判断
27.8B Dense 权重按 4-bit 粗算理论下限约 13.9GB,但官方当前提供 BF16 与 FP8 权重;视觉编码、KV Cache、上下文和运行时会继续增加占用。1M 需要 YaRN 扩展,不是开放权重的默认窗口。
BF16FP8
阿里云 Qwen通用语言与 Agent

Qwen3.6-27B

Qwen 最新 27B 开放型号之一,适合希望在本地工作站获得更高综合能力、又不准备维护超大 MoE 集群的团队。

规模
27B
架构
Dense Transformer
模态
文本、以官方模型卡为准
本地判断
27B Dense 模型即使采用 4-bit 量化,权重理论下限也约 13.5GB;实际部署还需要额外上下文、缓存与运行时内存。
27B 开放权重
阿里云 Qwen视觉与多模态

Qwen3.5-27B

Qwen3.5 系列的 27B Dense 型号,兼顾多模态理解、推理和 Agent 接入,是本地高配工作站的重要候选。

规模
27B
架构
Dense Transformer · 默认推理模式
模态
文本、视觉理解
本地判断
适合 24GB 级显存或更高统一内存设备评估量化版本;具体能否加载取决于量化格式、上下文和运行时。
Qwen3.5-27B
阿里云 Qwen视觉与多模态

Qwen3.5-35B-A3B

以 3B 激活参数降低推理计算量的 Qwen3.5 MoE 型号,适合本地高配设备探索质量与吞吐平衡。

规模
35B 总参数 / 3B 激活参数
架构
稀疏 MoE
模态
文本、视觉理解
本地判断
3B 激活参数主要影响计算量,加载时仍需容纳 35B 总权重;不能按 3B Dense 模型估算内存。
Qwen3.5-35B-A3B
字节跳动 Seed通用语言与 Agent

Seed-OSS-36B

字节跳动开放的 36B 长上下文模型,提供 Base、无合成数据 Base 与 Instruct,面向本地研究、推理和工具调用。

规模
36B
架构
Dense Causal Language Model · GQA
模态
文本、推理、工具调用
本地判断
36B BF16 不属于普通端侧模型;4-bit 权重理论下限约 18GB,实际还要为 512K 上下文、KV Cache 和运行时预留大量空间,更适合 24GB 以上工作站或本地服务器。
InstructBaseBase without synthetic data4-bit / 8-bit 推理路径
Decision rule

端侧模型不是“云模型的缩小版”

真正的企业价值来自数据不出域、弱网可用、低延迟和边际调用成本可控;代价是硬件异构、模型升级、量化质量、散热能耗、安全补丁与运维责任回到企业自己。