端侧模型正在从“能运行”进入“能工作”
过去谈本地大模型,问题往往是“我的电脑能不能把权重加载起来”。2026 年更值得问的是:模型能否在本地完成稳定的结构化输出、工具调用、知识检索和多轮任务,并在延迟、内存、功耗与维护成本之间形成可持续的业务闭环。
百灵最新开源的 Ling-3.0-tiny 是这个趋势的一个代表。其官方资料给出的规模是 7.9B 总参数、每 Token 激活约 1.4B 参数,并提供 BF16、FP8、INT4 三种版本。厂商展示的场景不再只是聊天,而是 DGX Spark 上的移动设备自动化,以及 Mac mini 上的本地阅读和写作助手。需要注意,这些速度和设备结果属于厂商指定条件下的自测,不能直接外推到其他硬件和企业任务。
截至 2026 年 8 月 30 日,ClawSphere 目录已经按官方模型卡核验 48 个模型家族、19 家厂商、150 个型号与格式。端侧模型已不再等于“参数最小的聊天模型”,而是覆盖通用语言与 Agent、视觉与多模态、语音与全模态、文档与 OCR、设备操作 Agent、安全护栏六类工作负载。
紧急加更:M5 Ultra Mac Studio 把本地模型上限推到 512GB
Apple 在 8 月 25 日发布搭载 M5 Max 与 M5 Ultra 的新款 Mac Studio:M5 Max 最高 128GB 统一内存和 614GB/s 带宽;M5 Ultra 最高 512GB 和 1.2TB/s,并支持通过 Thunderbolt 5 与 RDMA 连接多台设备。它让数千亿参数量化模型进入桌面工作站候选池,但统一内存容量不能代替 MLX/Core AI 兼容、并发吞吐和长期稳定性测试。Apple 公布的最高 4.3 倍 AI 性能与四机最高 3 倍推理均属于厂商指定条件自测。
完整的内存估算、模型候选、集群边界和采购验证清单,见《新款 Mac Studio:M5 Ultra 512GB 能否成为企业本地 AI 工作站》。8 月 25 日是发布和预购日期,正式供货从 9 月 22 日开始;在真机第三方评测出现前,不把发布数据写成独立实测结论。
2026 年 8 月全量更新:值得新增到候选池的模型
Kimi K3 NVFP4:量化把模型带到集群配方,不是单机
NVIDIA 的 Kimi-K3-NVFP4把 Moonshot 2.8T-A104B 原始检查点转换为 NVFP4 路由专家与分块 FP8 注意力,并给出 vLLM、SGLang 与 8 张 B300 的验证路径。官方权重元数据约 1.42TB,快速开始仍需首次下载约 1.6TB;A104B 不能用于估算完整权重内存。模型原生 1M 上下文,但 vLLM 的厂商验证配置为 196,608,且仍依赖专用镜像和兼容补丁。详见 Kimi K3 NVFP4 型号页和私有化部署成熟度研究。
GLM-5.3:744B-A40B 的“激活参数陷阱”与安全边界
GLM-5.3是 744B 总参数、40B 激活参数的文本 MoE 模型,提供 FP8 与 BF16 权重、1M 上下文及多套服务器运行时。A40B 只描述每 Token 的计算路径;官方 FP8 权重文件合计约 755.6GB,不能按 40B 估算显存。Z.ai 披露代码与网络安全任务能力增强,相关分数属于厂商自测;接入终端、仓库和扫描工具前必须建立沙箱、最小权限与高风险人工审批。详见 GLM-5.3 型号页和编码 Agent 安全治理研究。
LFM2.5-2.6B:把工具调用带到设备端
Liquid AI LFM2.5-2.6B提供 GGUF、ONNX、MLX 和 WebGPU 路径,官方 ONNX Q4F16 约 1.5GB、MLX 4-bit 约 1.47GB。它更适合设备端工具调用、本地 RAG 和数据提取,而不是知识密集任务或复杂 Agent 编码。厂商公布的手机与笔记本速度只能作为候选线索,企业仍需用自己的运行时、上下文和工具链复测。
8 月 20 日更新的 LFM2.5-2.6B-DSpark增加 327.7M draft 模型,以推测解码加速目标模型,并给出 SGLang 与 Apple Metal 路径。最高 3.2 倍等速度数字属于厂商指定条件自测;当前 SGLang 适配仍依赖尚未合入主线的 PR,draft 权重和状态也会增加内存,不能把“加速”直接写成“资源更少”。
Granite 4.2:3B 推理模型进入企业 Agent 候选池
IBM 8 月 25 日发布 Granite 4.2,以 3B、8B、30B Dense 权重覆盖边缘设备、工作站与服务器,并在同一模型中提供完整推理、低强度推理和非推理模式。3B BF16 权重文件元数据约 6.8GB,官方同时提供 GGUF;实际内存仍取决于量化、上下文和并发。完整的路由、运行时与采购边界见 Granite 4.2 型号页和企业 Agent 研究。
Cosmos3-Edge:Edge 指 Jetson 路径,不是手机承诺
Cosmos3-Edge是 4B 多模态世界模型,可处理文本、图像、视频和动作轨迹。NVIDIA 在 8 月 25 日更换生成器检查点、运行时默认值和基准,使用 main 的团队需要刷新快照并回归。官方给出 Jetson Thor 16GB—128GB 和 AGX Orin 64GB 的 BF16 自测,但没有普通手机芯片路径;“Edge”只能证明特定嵌入式 NVIDIA 平台候选,不能自动写成手机端模型。详见 Cosmos3-Edge 型号页。
MiniCPM-V 4.6 与 MiniCPM-o 4.5:视觉小模型和全双工助手
MiniCPM-V 4.6约 1.3B,覆盖图像、视频、OCR 和工具调用。官方量化路径给出约 2GB CPU 内存或约 3GB GPU 内存起点,适合端侧截图理解和轻量文档处理。MiniCPM-o 4.5则把视觉、语音理解、语音生成和全双工打断放入约 9.37B 模型;不同模式的 12GB、16GB、24GB、28GB 建议不可混用,完整 PyTorch、半双工和全双工是三套不同容量口径。
GLM 专用模型:视觉、手机操作、OCR 与 ASR
智谱的本地矩阵已经不只是一款通用模型:GLM-4.6V-Flash面向长上下文视觉 Agent,AutoGLM-Phone-9B通过 ADB 控制 Android,GLM-OCR用于文档、表格和版面解析,GLM-ASR-Nano-2512覆盖中文、英文和粤语转写。这里尤其要区分“设备操作模型”和“模型在手机芯片上运行”:AutoGLM 通常在电脑或本地服务器推理,再通过 ADB 执行动作。
ERNIE、InternVL 与 Seed:国产开放模型不只看通用对话
ERNIE 4.5从 0.3B 实验模型延伸到 21B-A3B 文本与 28B-A3B 多模态型号;InternVL3.5以 1B、2B、4B、8B 覆盖低资源视觉任务;Seed-OSS-36B提供原生 512K 长上下文,但 36B Dense 权重更适合本地服务器或 24GB 以上工作站,不应因为“开放权重”就归入手机模型。
Smol、Falcon 与 OpenELM:小模型研究基线仍然重要
SmolLM3-3B提供完整训练配方以及 GGUF、ONNX、MLX、MLC、ExecuTorch 等路径;SmolVLM2从 256M 到 2.2B,适合手机和浏览器视觉实验;Falcon-H1-Tiny只有 90M—100M,更适合作为嵌入式分类、提取和专用微调基线;Apple OpenELM则是 2024 年的端侧架构研究模型,不能把它误写成 Apple Intelligence 产品模型。
TII 的 Falcon Perception 0.6B补上了另一类专用工作负载:用自然语言查询做开放词汇定位和像素级实例分割。8 月 19 日的 RL revision 面向高密度场景,但增益来自厂商 PBench 自测;官方快速开始依赖 CUDA 与 trust_remote_code,它既不是通用视觉问答模型,也没有证明权重可直接在手机芯片运行。
先分清四个概念
端侧模型通常指在手机、PC、边缘盒子、车载设备或现场服务器附近运行的模型,重点是低延迟、弱网或离线可用,以及数据不必离开设备边界。
本地部署模型范围更广。一个在办公室多卡服务器运行的 70B 模型也属于本地部署,但它并不是手机意义上的端侧模型。
开放权重只表示模型参数可以下载。它不自动等于开源软件,许可可能限制商用、再分发、衍生模型或特定地区使用。同一家族也可能变化:Gemma 4 官方模型卡采用 Apache 2.0,而 Gemma 3n 仍需按对应 Gemma 条款核对;Llama 与 NVIDIA Nemotron 也有各自许可体系,企业必须按具体检查点逐项审阅。
量化模型通过降低权重精度减少内存和计算,例如 INT8、INT4、GGUF 或厂商专用格式。量化可以让大模型进入消费级硬件,但也可能改变生成质量、工具调用稳定性和运行时兼容性。
本地模型的四个设备层级
1. 手机、嵌入式与边缘设备
这个层级优先考虑 90M—4B 左右的小型模型,以及厂商明确提供的移动优化检查点。
Google 在 Gemma 3n 官方文档中把 E2B 与 E4B 定位于手机、平板和笔记本。两者支持文本、图像、视频与音频输入,但“E”表示有效参数,不等同于完整静态权重占用;Google 说明 E2B 标准执行仍会加载超过 5B 参数,只有配合 PLE 缓存、参数跳过和条件模态加载才接近 1.91B 有效内存负载。Meta 的 Llama 3.2 1B 与 3B也是明确面向移动和边缘文本任务的型号。
NVIDIA 的 Nemotron 3 Nano 4B更贴近 Jetson、GeForce RTX 和 DGX Spark 生态,适合本地角色、语音助手后端和 IoT 自动化。它的优势来自模型与 NVIDIA 软硬件栈的协同,而不是“4B”这个数字本身。
2. 普通笔记本、Mac 与 AI PC
这个层级大致覆盖 4B—14B 量化模型,但统一内存、显存带宽、CPU/GPU/NPU 支持和散热会造成很大差异。
Qwen3.5 的 0.8B、2B、4B、9B 型号为企业建立分级路由提供了连续档位。Microsoft 的 Phi-4-mini 为 3.8B 参数,覆盖通用指令、函数调用和数学推理;Phi-4-multimodal则以 5.6B 参数统一处理文本、图像和音频,但多模态运行时的内存与兼容性不能按纯文本模型估算。
Mistral 在 Ministral 3 中提供 3B、8B、14B 三个尺寸,每个尺寸又有 Base、Instruct 与 Reasoning 版本。它们名称相近,但用途不同:Base 更适合继续训练,Instruct 面向交互,Reasoning 会用更多生成 Token 换取复杂任务能力。
3. 高配笔记本与单卡工作站
24GB 级显存或更大的统一内存设备,让 20B—35B 量化模型成为可能。这里最容易出现“激活参数陷阱”。
Qwen3.5-35B-A3B每次计算只激活约 3B 参数,但部署时通常仍需容纳 35B 总权重。A3B 主要降低计算量,不会把权重内存自动变成 3B Dense 模型。Qwen3.5-27B 与更新的 Qwen3.6-27B则是 Dense 路线,更容易理解但权重计算更直接:4-bit 权重理论下限约 13.5GB,实际还必须加入 KV Cache、运行时和视觉组件。
OpenAI 的 gpt-oss-20b是另一条路线。官方给出的规模是约 21B 总参数、3.6B 激活参数,并通过原生 MXFP4 把内存要求控制在约 16GB。它有 Ollama、LM Studio、vLLM、Transformers 与 Apple Metal 的官方部署指引,但 Harmony 提示格式和硬件对 MXFP4 的支持仍需正确适配。
Gemma 4 的 26B-A4B、31B,NVIDIA Nemotron 3 Nano 30B-A3B,以及 DeepSeek-R1-Distill-Qwen-32B,也属于高配工作站或本地服务器候选。它们的比较重点已经不只是“能否加载”,而是并发、长上下文、吞吐和稳定性。
4. 企业本地服务器
企业私有化部署需要把问题从单人 Demo 提升到持续服务:多用户并发、身份权限、日志审计、模型升级、故障回退、硬件监控、补丁和容量规划都会进入总拥有成本。
IBM 的 Granite 4.0把 3B Micro、7B 总参数/1B 激活的 H-Tiny,以及 32B 总参数/9B 激活的 H-Small 分成不同企业层级。Micro 与 H-Tiny可以成为 Agent 工作流中的低延迟函数调用节点,H-Small则更接近完整的本地企业模型服务。
DeepSeek 的 R1 Distill从 1.5B 延伸到 70B,为本地推理研究提供了常用基线。但蒸馏模型不是完整 DeepSeek-R1:它们继承不同 Qwen 或 Llama 基座,尺寸、知识、许可和运行特征也不同。
为什么不能只看参数和公开榜单
第一,参数量不等于运行内存。Dense 模型可以粗略从精度估算权重,但视觉编码器、KV Cache、批次、上下文和运行时都会额外占用内存;MoE 还必须区分总参数与激活参数。
第二,能生成答案不等于能完成岗位任务。数字员工需要稳定输出 JSON、正确选择工具、填对参数、处理超时,并在高风险动作前请求审批。公开知识或数学榜单无法覆盖这些要求。
第三,单次运行速度不等于生产吞吐。首 Token 时间、稳态解码、并发、热启动、降频、功耗和长时间内存峰值都需要记录。
第四,本地部署不自动等于安全。模型权重、量化文件、运行时、容器和扩展都是供应链组件;提示注入、越权工具调用、日志泄漏和恶意模型文件仍需治理。
第五,专用模型不能按通用模型的方式验收。OCR 要测字段召回率、表格结构与印章;ASR 要测口音、噪声、串音与长录音;GUI Agent 要测动作漂移、权限和可逆性;安全分类器要按误报、漏报和业务政策校准阈值。Shieldstral 1.0 3B就是本地多模态安全分类器,而不是通用对话模型。
企业端侧模型的五步选型法
- 先定义不能出域的任务。 只有当隐私、弱网、延迟或调用规模带来明确价值时,本地部署才值得承担运维复杂度。
- 按设备建立候选池。 手机与嵌入式优先移动优化小模型;AI PC 优先 4B—14B;工作站再进入 20B—35B 量化模型。
- 固定运行条件。 记录具体设备、精度、运行时版本、上下文、并发与功耗,避免留下无法复现的“能跑”结论。
- 使用真实任务评测。 同时测任务成功率、结构化输出、工具参数正确率、端到端延迟、人工接管率与每次成功交付成本。
- 保留模型路由。 端侧模型处理隐私敏感、低风险和高频任务;复杂推理或高风险决策升级到本地高能力模型、云模型或人工审批。
对数字员工平台的意义
端侧模型让数字员工从“每次都调用外部云 API”变成分层运行:设备端可以完成分类、提取、唤醒、简单问答和隐私预处理;本地工作站处理知识检索、文档理解与常规工具调用;高能力模型只接管困难任务。
这种架构的核心不是选择一个永远最强的本地模型,而是建立可审计的模型路由:什么数据可以发送到哪里,什么任务由哪个能力档位承担,失败时如何回退,成本和质量如何持续测量。
ClawSphere 的端侧模型研究站会继续跟踪各家开放权重型号、精度版本、官方运行时、设备适配和企业实测方法。型号页只把厂商信息作为候选事实,最终选型仍以官方许可、真实硬件和企业样本为准。
官方参考
- 百灵 Ling-3.0-tiny 官方模型卡
- Liquid AI LFM2.5-2.6B 官方模型卡
- OpenBMB MiniCPM-V 官方仓库
- 智谱 Z.ai 官方模型库
- 百度 ERNIE 官方仓库
- Hugging Face SmolLM 官方仓库
- OpenGVLab InternVL 官方仓库
- TII Falcon-H1-Tiny 官方模型卡
- Apple OpenELM 官方模型库
- Apple 新款 Mac Studio M5 Max / M5 Ultra 官方发布
- 字节跳动 Seed-OSS 官方模型卡
- Qwen 官方开放模型仓库
- Google Gemma 3n 官方文档
- Mistral 3 官方发布
- Microsoft Phi-4 系列官方介绍
- Meta Llama 3.2 Edge 官方发布
- OpenAI gpt-oss 官方发布
- IBM Granite 4.0 官方文档
- NVIDIA Nemotron 3 Nano 4B 官方介绍
- DeepSeek-R1 官方仓库