[控场AI]
概念

GGUF

GGUF(GPT-Generated Unified Format)是一种用于存储和分发大型语言模型的二进制文件格式,由llama.cpp项目设计并推广。它将模型权重、元数据及量化参数统一封装于单一文件中,支持多种量化精度级别,以减少模型体积和内存占用。GGUF被广泛用于本地推理场景,兼容多种推理框架和硬件平台。

时间轴 (近 90 天)

6月3日

7B参数的量化模型在16GB内存的普通电脑上即可流畅对话

待验证70%
6月1日

模型量化技术(如GGUF格式的4-bit/8-bit量化)使得原本需要数十GB显存的大模型可以在消费级GPU甚至CPU上运行

已验证80%
6月1日

模型量化技术(GGUF、GPTQ、AWQ等格式)使得70B参数的模型可以在32GB内存的消费级电脑上运行

已验证65%
6月1日

Unsloth推出了Granite 4.1 3B模型的GGUF格式量化版本集合,共21个不同的量化模型文件

待验证60%
6月1日

Hugging Face模型库中已有数万个GGUF格式的模型文件

待验证80%
6月1日

GGUF格式于2023年8月由llama.cpp社区推出,作为GGML格式的替代方案

已验证90%
6月1日

GGUF格式由llama.cpp项目创始人Georgi Gerganov设计

已验证90%
6月1日

Unsloth为Granite 4.1 3B模型发布了21种GGUF格式量化版本,文件大小从1.2GB到6.34GB不等,总计约51.3GB

待验证60%
6月1日

Unsloth支持导出为GGUF(llama.cpp格式)、safetensors等多种格式,方便部署到Ollama、vLLM等推理框架

待验证90%
6月1日

一个7B参数的模型经过4-bit量化后仅需约4GB显存即可运行

已验证80%

还有 22 条时间轴事件

全部知识事实 (1)

来源文章