On-device & local model research

端侧模型与本地部署研究站

从手机、嵌入式设备到 AI PC、Mac、单卡工作站和企业本地服务器,持续研究哪些开放权重模型真正能在本地跑、需要什么资源、适合什么任务,以及进入数字员工路由前还要验证什么。

17 个模型家族40 个型号与版本10 家厂商核验于 2026/08/14
“能下载”不等于“能在你的设备稳定生产运行”。

页面只收录有官方开放权重或本地部署路径的模型。硬件层级用于缩小候选范围;最终内存、速度、能力和许可要按量化格式、上下文、KV Cache、并发与真实业务样本复核。

先按设备选候选池

参数量只是入口。MoE 的激活参数影响计算量,但部署时通常仍要容纳全部专家权重。

01

嵌入式与手机

优先观察 0.8B—4B、移动优化检查点与设备专用运行时。

典型:Gemma 4 E2B/E4B、Llama 3.2、Nemotron 4B
02

普通 AI PC

关注 4B—14B 量化模型、统一内存带宽、能效与离线交互延迟。

典型:Qwen 小型系列、Phi-4、Ministral 3、Ling Tiny
03

单卡工作站

可进入 20B—35B 量化或稀疏 MoE,但必须测量 KV Cache 与并发余量。

典型:Qwen 27B、GPT-OSS-20B、Gemma 4 26B-A4B
04

本地服务器

面向多用户、长上下文和高可用,重点转向吞吐、隔离、审计与总拥有成本。

不要把“本地运行成功”误当成“生产服务可用”

端侧与本地模型目录

搜索具体型号,也可按厂商和设备层级筛选。

阅读选型方法
17 个模型家族符合条件 · 最多选择 3 个横向比较
Google嵌入式与手机

Gemma 4 E2B / E4B

Gemma 4 中面向手机和笔记本的多模态小型型号,原生处理文本、图像与音频,适合端上助手和感知任务。

规模
E2B / E4B 有效参数档
架构
高效 Dense · Per-Layer Embeddings
模态
文本、图像、音频、视频输入
本地判断
Google 将 E2B 定位于移动设备,将 E4B 定位于移动设备与笔记本;有效参数不是静态权重占用的直接等价物。
Gemma 4 E2BGemma 4 E4B
Meta嵌入式与手机

Llama 3.2 1B / 3B

Meta 面向移动与边缘设备发布的轻量 Llama 型号,适合摘要、改写、知识检索和设备端文本助手。

规模
1B / 3B
架构
Dense Transformer
模态
文本
本地判断
Meta 明确将 1B 与 3B 定位为边缘和移动设备的轻量文本模型;真实可用上下文仍受设备内存限制。
Llama 3.2 1BLlama 3.2 3BInstruct
Microsoft嵌入式与手机

Phi-4-mini

Microsoft 面向受限算力与低延迟场景的轻量模型系列,覆盖通用指令、函数调用和数学推理。

规模
3.8B
架构
Dense Transformer
模态
文本
本地判断
3.8B 参数适合量化后进入普通 AI PC 与部分边缘设备;128K 是能力上限,不是端侧默认可用配置。
Phi-4-mini-instructPhi-4-mini-reasoningPhi-4-mini-flash-reasoning
Mistral AI嵌入式与手机

Ministral 3

Mistral 面向 edge 与 local 场景发布的 3B、8B、14B 多模态模型系列,每个尺寸包含基础、指令和推理版本。

规模
3B / 8B / 14B
架构
Dense · 多模态
模态
文本、图像
本地判断
3B、8B、14B 覆盖边缘设备到本地工作站;每个尺寸均有不同训练用途和精度版本,不能只按名称判断占用。
Ministral 3 3BMinistral 3 8BMinistral 3 14BBase / Instruct / Reasoning
NVIDIA嵌入式与手机

Nemotron 3 Nano 4B

NVIDIA 首个专门面向端上部署优化的 Nemotron 3 小模型,聚焦本地对话 Agent、角色和 IoT 自动化。

规模
4B
架构
Hybrid Mamba/Attention
模态
文本、代码
本地判断
NVIDIA 将其定位为 Jetson Thor、Jetson Orin Nano、GeForce RTX 与 DGX Spark 的 edge-ready 小模型。
BF16GGUF
阿里云 Qwen嵌入式与手机

Qwen3.5 小型系列

覆盖从嵌入式实验到普通 AI PC 的轻量 Qwen 型号,适合按设备能力建立分级模型路由。

规模
0.8B / 2B / 4B / 9B
架构
Dense Transformer
模态
文本、以具体模型卡为准
本地判断
0.8B—4B 更适合内存受限设备;9B 更适合 8—16GB 级本地环境。真实占用需加入上下文、缓存和运行时开销。
Qwen3.5-0.8BQwen3.5-2BQwen3.5-4BQwen3.5-9B
DeepSeek轻薄本与普通 AI PC

DeepSeek-R1 Distill Local

把 R1 推理模式蒸馏到 Qwen 与 Llama 小型基座的模型组,是本地推理研究的常用基线。

规模
1.5B / 7B / 8B / 14B / 32B / 70B
架构
Dense Distill · Qwen / Llama 基座
模态
文本、推理
本地判断
1.5B—14B 覆盖普通本地设备,32B 更适合高配工作站,70B 通常进入多卡或大统一内存设备。
R1-Distill-Qwen-1.5BR1-Distill-Qwen-7BR1-Distill-Llama-8BR1-Distill-Qwen-14B
Google轻薄本与普通 AI PC

Gemma 4 12B Unified

Gemma 4 的统一多模态 12B 型号,覆盖文本、图像与音频输入,是本地多模态工作流的重要平衡档。

规模
12B
架构
Dense · 统一多模态
模态
文本、图像、音频、视频输入
本地判断
官方定位为笔记本、台式机和小型服务器;量化后仍需为多模态编码与长上下文预留额外内存。
Gemma 4 12B Unified
IBM轻薄本与普通 AI PC

Granite 4.0 Local

IBM 面向企业 Agent、RAG 和函数调用的高效开放模型系列,用混合架构覆盖浏览器实验、AI PC 到本地服务器。

规模
3B Micro / 7B总-1B激活 H-Tiny / 32B总-9B激活 H-Small
架构
Hybrid Mamba/Attention · Dense / MoE
模态
文本
本地判断
IBM 将 Micro 与 H-Tiny 定位为低延迟和本地应用;H-Small 更接近本地服务器或高配工作站。
Granite-4.0-H-MicroGranite-4.0-H-TinyGranite-4.0-H-Small
Microsoft轻薄本与普通 AI PC

Phi-4-multimodal

把语音、视觉和语言放在统一表示空间中的紧凑模型,适合离线感知、文档理解和多模态设备助手。

规模
5.6B
架构
统一多模态 · Mixture-of-LoRAs
模态
文本、图像、音频
本地判断
5.6B 模型面向设备与边缘计算,但完整音频、视觉能力对运行时和显存的要求高于纯文本 5.6B 模型。
Phi-4-multimodal-instruct
百灵 / inclusionAI轻薄本与普通 AI PC

Ling-3.0-tiny

面向本地 Agent 与真实任务的轻量 MoE 模型,每 Token 激活 1.3B 参数,强调推理、工具调用和本地数据边界。

规模
7.9B 总参数 / 1.3B 激活参数
架构
稀疏 MoE · 原生混合推理
模态
文本
本地判断
官方 INT4 版本降低了本地门槛;厂商文章给出的模型权重约 7.85GB 指向 FP8 版本。运行时仍需为上下文和 KV Cache 预留空间。
BF16FP8INT4
Google高配笔记本与单卡工作站

Gemma 4 26B-A4B / 31B

Gemma 4 的高能力本地与私有化候选,分别用稀疏 MoE 和 Dense 路线覆盖工作站与服务器部署。

规模
26B 总参数 / 4B 激活;31B Dense
架构
MoE 26B-A4B / Dense 31B
模态
文本、图像、视频输入
本地判断
Google 将 26B-A4B 定位于台式机与小型服务器,将 31B 定位于大型服务器或集群;量化和上下文决定能否进入单机工作站。
Gemma 4 26B-A4BGemma 4 31B
NVIDIA高配笔记本与单卡工作站

Nemotron 3 Nano 30B-A3B

NVIDIA 的统一推理/非推理 MoE 模型,用较低激活参数瞄准高配本地工作站和企业边缘服务器。

规模
30B 总参数 / 约3.5B激活参数
架构
Hybrid MoE · Mamba-2/Attention
模态
文本、代码
本地判断
30B 总权重更适合 RTX 工作站、DGX Spark 或本地服务器;A3B 主要降低计算,不会把权重内存变成 3B。
BF16FP8
OpenAI高配笔记本与单卡工作站

gpt-oss-20b

OpenAI 面向低延迟、本地和专用场景发布的开放权重推理模型,以原生 MXFP4 在约 16GB 内存档运行。

规模
21B 总参数 / 3.6B 激活参数
架构
稀疏 MoE · MXFP4
模态
文本
本地判断
OpenAI 官方给出的 MXFP4 内存要求约为 16GB;Apple Silicon、Ollama、LM Studio 和 vLLM 的适配路径不同。
gpt-oss-20b
阿里云 Qwen高配笔记本与单卡工作站

Qwen3.6-27B

Qwen 最新 27B 开放型号之一,适合希望在本地工作站获得更高综合能力、又不准备维护超大 MoE 集群的团队。

规模
27B
架构
Dense Transformer
模态
文本、以官方模型卡为准
本地判断
27B Dense 模型即使采用 4-bit 量化,权重理论下限也约 13.5GB;实际部署还需要额外上下文、缓存与运行时内存。
27B 开放权重
阿里云 Qwen高配笔记本与单卡工作站

Qwen3.5-27B

Qwen3.5 系列的 27B Dense 型号,兼顾多模态理解、推理和 Agent 接入,是本地高配工作站的重要候选。

规模
27B
架构
Dense Transformer · 默认推理模式
模态
文本、视觉理解
本地判断
适合 24GB 级显存或更高统一内存设备评估量化版本;具体能否加载取决于量化格式、上下文和运行时。
Qwen3.5-27B
阿里云 Qwen高配笔记本与单卡工作站

Qwen3.5-35B-A3B

以 3B 激活参数降低推理计算量的 Qwen3.5 MoE 型号,适合本地高配设备探索质量与吞吐平衡。

规模
35B 总参数 / 3B 激活参数
架构
稀疏 MoE
模态
文本、视觉理解
本地判断
3B 激活参数主要影响计算量,加载时仍需容纳 35B 总权重;不能按 3B Dense 模型估算内存。
Qwen3.5-35B-A3B
Decision rule

端侧模型不是“云模型的缩小版”

真正的企业价值来自数据不出域、弱网可用、低延迟和边际调用成本可控;代价是硬件异构、模型升级、量化质量、散热能耗、安全补丁与运维责任回到企业自己。