GGUF
GGUF
llama.cpp 生态常用的模型文件格式,可封装权重、量化信息和运行元数据,便于在 CPU、GPU 与统一内存设备上进行本地推理。
也称:GGUF模型、llama.cpp模型格式
GGUF 让大量开放权重模型能够通过 llama.cpp、LM Studio、Ollama 等工具在本地运行。不同 Q2、Q4、Q5、Q8 等量化档位会在文件大小、速度和质量之间形成不同取舍。
GGUF 文件可能来自模型厂商,也可能来自社区转换者。生产使用前需要核对基础模型版本、转换工具、量化方法、提示模板、文件哈希和发布者可信度。