阿里云 Qwen · 高配笔记本与单卡工作站

Qwen3.8-27B

Qwen3.8 的 27B Dense 开放权重型号,原生支持文本、图像与视频,并为长程 Agent 提供可调推理强度和思考保留机制。

查看官方资料 官方源核验于 2026/08/16
参数规模27.8B
架构Dense Hybrid Attention · 多模态
模态文本、图像、视频
上下文原生 256K;YaRN 可扩展至 1M
Local deployment verdict

部署判断

27.8B Dense 权重按 4-bit 粗算理论下限约 13.9GB,但官方当前提供 BF16 与 FP8 权重;视觉编码、KV Cache、上下文和运行时会继续增加占用。1M 需要 YaRN 扩展,不是开放权重的默认窗口。

推荐起点
高配笔记本与单卡工作站
常见运行时
Transformers、vLLM、SGLang、TokenSpeed
许可
Apache 2.0

型号与精度版本

BF16
FP8

同一模型家族中的基础、指令、推理、量化或多模态检查点用途可能完全不同。下载前应核对模型卡、提示模板、分词器、量化方法和运行时版本。

适合放进哪些本地工作流

本地多模态助手
代码与工具调用
长文档工作流
高配工作站私有化评测

端侧模型更适合边界清楚、输入可控、失败可回退的任务。涉及客户承诺、财务写入、生产控制或复杂多步工具调用时,应保留云端高能力模型与人工审批作为升级路径。

进入数字员工路由前怎么测

  1. 加载测试记录具体设备、精度、运行时、上下文与首 Token 时间,避免只写“能跑”。
  2. 任务测试用脱敏企业样本测任务成功率、结构化输出和工具参数正确率。
  3. 压力测试加入长上下文、并发、热启动、内存峰值、功耗和降频观察。
  4. 治理测试验证模型许可、日志、更新、漏洞响应、人工接管与云端回退。

当前研究限制

  • 1M 依赖 YaRN 且可能影响短文本表现
  • 默认思考与思考保留会增加上下文和成本
  • 模型卡榜单属于厂商自测
  • 官方 FP8 仍需较大显存并预留视觉与缓存空间

本页是官方资料索引与企业选型分析,不构成速度、显存、质量、许可或合规承诺。社区量化与第三方运行时应作为独立供应链组件审计。