模型量化
Model Quantization
使用更低数值精度表示模型权重或激活,以减少内存、存储和计算成本,使模型更容易在本地或端侧设备运行。
也称:大模型量化、INT4量化、低比特量化
常见量化精度包括 INT8、INT4、FP8、FP4 与不同 GGUF 量化方案。量化后的实际质量与速度取决于量化方法、校准数据、硬件指令和运行时实现。
企业评测不能只确认“模型能加载”,还应复测结构化输出、工具调用、长文本、关键事实和边界案例。对 MoE 模型而言,低激活参数主要降低计算量,通常不会让全部专家权重从内存中消失。