字节跳动 Seed · 本地服务器与多卡工作站

Seed-OSS-36B

字节跳动开放的 36B 长上下文模型,提供 Base、无合成数据 Base 与 Instruct,面向本地研究、推理和工具调用。

查看官方资料 官方源核验于 2026/08/20
参数规模36B
架构Dense Causal Language Model · GQA
模态文本、推理、工具调用
上下文原生 512K
Local deployment verdict

部署判断

36B BF16 不属于普通端侧模型;4-bit 权重理论下限约 18GB,实际还要为 512K 上下文、KV Cache 和运行时预留大量空间,更适合 24GB 以上工作站或本地服务器。

推荐起点
本地服务器与多卡工作站
常见运行时
Transformers、vLLM、bitsandbytes 4-bit / 8-bit
许可
Apache 2.0

型号与精度版本

Instruct
Base
Base without synthetic data
4-bit / 8-bit 推理路径

同一模型家族中的基础、指令、推理、量化或多模态检查点用途可能完全不同。下载前应核对模型卡、提示模板、分词器、量化方法和运行时版本。

适合放进哪些本地工作流

超长文档本地研究
长上下文 Agent
企业服务器推理
合成数据影响研究

端侧模型更适合边界清楚、输入可控、失败可回退的任务。涉及客户承诺、财务写入、生产控制或复杂多步工具调用时,应保留云端高能力模型与人工审批作为升级路径。

进入数字员工路由前怎么测

  1. 加载测试记录具体设备、精度、运行时、上下文与首 Token 时间,避免只写“能跑”。
  2. 任务测试用脱敏企业样本测任务成功率、结构化输出和工具参数正确率。
  3. 压力测试加入长上下文、并发、热启动、内存峰值、功耗和降频观察。
  4. 治理测试验证模型许可、日志、更新、漏洞响应、人工接管与云端回退。

当前研究限制

  • 512K 是模型能力上限,不是消费级硬件默认配置
  • 36B Dense 权重较大
  • 官方榜单与长上下文结果需独立复测

本页是官方资料索引与企业选型分析,不构成速度、显存、质量、许可或合规承诺。社区量化与第三方运行时应作为独立供应链组件审计。