百灵 / inclusionAI · 本地服务器

Ling-3.0-flash

百灵面向长程 Agent 与生产推理发布的 124B-A5.5B 混合线性 MoE 模型,提供官方量化权重及三类预训练 Base 检查点。

查看官方资料 官方源核验于 2026/08/30
参数规模124B 总参数 / 5.5B 激活参数(非嵌入 5.1B)
架构Hybrid-linear MoE · KDA / MLA / MTP
模态文本、代码
上下文256K
Local deployment verdict

部署判断

5.5B 激活参数主要影响每 Token 计算量,部署仍需容纳 124B 总权重。官方 FP4 与 INT4 示例均使用 2 张 Blackwell GPU;上下文、缓存、并发和运行时工作区还会增加实际占用。

推荐起点
本地服务器
常见运行时
SGLang(官方适配分支)、Transformers 自定义代码路径、SGLang DSpark、llama.cpp DSpark
许可
MIT

型号与精度版本

BF16
FP8
INT4
FP4
Base-30T
Base-midtrain
Base(WSM 合并)
1.36B DSpark draft

同一模型家族中的基础、指令、推理、量化或多模态检查点用途可能完全不同。下载前应核对模型卡、提示模板、分词器、量化方法和运行时版本。

适合放进哪些本地工作流

本地 Agent 服务
代码与工具调用
长文档研究
多卡私有化推理

端侧模型更适合边界清楚、输入可控、失败可回退的任务。涉及客户承诺、财务写入、生产控制或复杂多步工具调用时,应保留云端高能力模型与人工审批作为升级路径。

进入数字员工路由前怎么测

  1. 加载测试记录具体设备、精度、运行时、上下文与首 Token 时间,避免只写“能跑”。
  2. 任务测试用脱敏企业样本测任务成功率、结构化输出和工具参数正确率。
  3. 压力测试加入长上下文、并发、热启动、内存峰值、功耗和降频观察。
  4. 治理测试验证模型许可、日志、更新、漏洞响应、人工接管与云端回退。

当前研究限制

  • A5.5B 不等于只加载 5.5B 权重
  • 官方量化快速开始需要 2 张 Blackwell GPU
  • 基准、TTFT、缓存收益与 DSpark 接受长度均为厂商自测
  • 1.36B DSpark draft 会增加额外权重与运行时状态,不能把推测解码写成降低权重内存
  • Base、Base-30T 与 Base-midtrain 均未经过 post-training,面向继续预训练与研究,不应直接替换指令模型

本页是官方资料索引与企业选型分析,不构成速度、显存、质量、许可或合规承诺。社区量化与第三方运行时应作为独立供应链组件审计。