2026 端侧模型大全与本地部署指南:48 个模型家族怎么选
系统比较 Qwen、Gemma、MiniCPM、LFM、GLM、ArmorOCR、InternVL、Llama、Mistral 等端侧模型的设备层级、工作负载、内存误区和企业选型方法。
跟踪大语言模型、推理模型、多模态模型及企业选型方法。
系统比较 Qwen、Gemma、MiniCPM、LFM、GLM、ArmorOCR、InternVL、Llama、Mistral 等端侧模型的设备层级、工作负载、内存误区和企业选型方法。
从芯片、软件栈、模型适配、集群、功耗、供应与迁移成本比较 NVIDIA、AMD、昇腾、寒武纪、昆仑芯、壁仞和摩尔线程。
核验 GPT、Claude、Gemini、Qwen、DeepSeek、Llama、ERNIE、混元、豆包、Kimi、MiniMax、GLM、Mistral 与 Grok 的当前主线。
用一套可执行评分卡评估基座模型,覆盖任务成功率、Agent 工具、上下文、Token 成本、部署、数据治理、生命周期和供应商切换。
从研究判断进入家族、端点、价格和实验验证,不把品牌名当成固定规格。
各条目的资料核验日期与待复核状态见模型观察站。
Seed2.1 Pro / Turbo
Tencent Hy4 preview / Hy3
Qwen3.8-Flash-Next
GLM-5.3-Flash
Claude Fable 5 / Opus 5 / Sonnet 5
ERNIE 5.0 Thinking / ERNIE 4.5 Turbo
DeepSeek V4 Flash / V4 Pro
Gemini 3.7 Flash 与 Gemini 3.x 模型家族
Llama 4 Scout / Maverick
MiniMax-M3
Mistral Medium 3.5 / Small 4 / Large 3
Kimi K3
GPT-5.6 Sol / Terra / Luna
Grok 4.6
在用户设备、企业自有服务器或受控边缘环境中运行模型推理,而不是将每次请求发送给外部托管 API。
以大量文本和代码为主要训练数据,能够理解、生成和转换自然语言,并支持推理、结构化输出与工具调用的模型。
在手机、AI PC、工作站或企业边缘环境本地处理文本、图像、视频或音频中至少两种模态的模型。
部署在手机、PC、边缘设备或现场服务器附近,能够在弱网、离线或数据不出域条件下完成推理任务的 AI 模型。
在大规模数据上训练、可以适配多种下游任务的通用模型,是大语言模型、多模态模型和企业智能体的重要能力基础。
在模型生成答案前,从企业知识库或外部数据源检索相关材料,并把证据作为上下文提供给模型的方法。
生成式模型输出看似合理、实际缺乏依据或与事实不符的内容,包括编造来源、数字、事件和因果关系。
使用更低数值精度表示模型权重或激活,以减少内存、存储和计算成本,使模型更容易在本地或端侧设备运行。
根据任务类型、质量要求、延迟、成本、数据敏感度和可用性,将请求动态分配给不同模型的机制。
参数规模、激活计算量或部署资源明显低于大型通用模型,面向低延迟、低成本、端侧运行或特定任务优化的语言模型。
llama.cpp 生态常用的模型文件格式,可封装权重、量化信息和运行元数据,便于在 CPU、GPU 与统一内存设备上进行本地推理。