概念
GGUF
GGUF(GPT-Generated Unified Format)是一种用于存储和分发大型语言模型的二进制文件格式,由llama.cpp项目设计并推广。它将模型权重、元数据及量化参数统一封装于单一文件中,支持多种量化精度级别,以减少模型体积和内存占用。GGUF被广泛用于本地推理场景,兼容多种推理框架和硬件平台。
时间轴 (近 90 天)
6月3日
7B参数的量化模型在16GB内存的普通电脑上即可流畅对话
待验证70%
6月1日
模型量化技术(如GGUF格式的4-bit/8-bit量化)使得原本需要数十GB显存的大模型可以在消费级GPU甚至CPU上运行
已验证80%
6月1日
模型量化技术(GGUF、GPTQ、AWQ等格式)使得70B参数的模型可以在32GB内存的消费级电脑上运行
已验证65%
6月1日
Unsloth推出了Granite 4.1 3B模型的GGUF格式量化版本集合,共21个不同的量化模型文件
待验证60%
6月1日
Hugging Face模型库中已有数万个GGUF格式的模型文件
待验证80%
6月1日
GGUF格式于2023年8月由llama.cpp社区推出,作为GGML格式的替代方案
已验证90%
6月1日
GGUF格式由llama.cpp项目创始人Georgi Gerganov设计
已验证90%
6月1日
Unsloth为Granite 4.1 3B模型发布了21种GGUF格式量化版本,文件大小从1.2GB到6.34GB不等,总计约51.3GB
待验证60%
6月1日
Unsloth支持导出为GGUF(llama.cpp格式)、safetensors等多种格式,方便部署到Ollama、vLLM等推理框架
待验证90%
6月1日
一个7B参数的模型经过4-bit量化后仅需约4GB显存即可运行
已验证80%
还有 22 条时间轴事件