上周帮朋友在他的笔记本上装 LM Studio,搜索框里输了个模型名,结果列表直接给他整不会了:同一个模型下面挂着二十来个文件,Q4_K_M、Q4_K_S、Q5_K_M、IQ3_M、Q8_0,大小从 3GB 到 30GB 都有。下载哪个?他挑了个名字看起来最顺眼的 Q8_0,16GB 内存的机器差点没跑起来。
这篇文章就把这些文件名拆开讲清楚。看完你就知道 Q4_K_M 里每个字母代表什么,下次下载前两秒钟就能做决定。
先说 GGUF 是什么
你在 Hugging Face 上看到的 GGUF 文件,是 llama.cpp 生态专用的模型格式。llama.cpp 是一个用 C/C++ 写的大模型推理框架,不挑硬件,Mac、Windows、Linux 和各家显卡都能跑。GGUF 就是由这个项目的作者 ggerganov 设计的,它把模型权重(张量)和分词器、对话模板这类配置信息打包进同一个二进制文件,下载一个文件就能跑。
原始模型一般是 PyTorch 的 safetensors 格式,那里面只有张量,不带这些配置。想转成 GGUF,Hugging Face 官方提供了 gguf-my-repo 这个工具,网页上点一下就能转。至于跑,现在 llama.cpp 一条命令就能从 Hugging Face 直接拉模型:llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF。
你平时用的 Ollama 和 LM Studio,底层也都是围着 GGUF 转。所以看懂这套命名,基本就看懂了整个本地模型生态的"文件语言"。
Q4_K_M 逐个字母拆开
先看一个最常被推荐的文件名:Q4_K_M。
- Q4:量化到平均 4 bit。原始模型的权重一般是 16 bit 浮点数(BF16),Q 后面的数字就是压缩后的平均位宽,数字越小,文件越小,压缩越狠。
- K:K-quant 家族,一种分块量化方案,比老式的 Q4_0 处理得更细。同一位宽下,K 系列的质量普遍更好。
- M:medium,中档。K 系列在同一个位宽下还分 S(small)、M(medium)、L(large)三档,S 更小更快,L 更大更保质量。
光说抽象的没用,我用 bartowski 仓库里 Meta-Llama-3.1-8B-Instruct 的真实文件大小给你感受一下(截至我写稿时的数值):
- Q8_0:7.95GB
- Q6_K:6.14GB
- Q5_K_M:5.34GB
- Q4_K_M:4.58GB
- Q3_K_M:3.74GB
- Q2_K:2.96GB
同一个 8B 模型,从 Q8 到 Q2,体积差出 5GB。文件名每降一档,下载时间和内存占用都实打实地变少。
那些 IQ 开头的文件(IQ3_M、IQ4_XS)是 I-quant,更新的算法,同样体积下效果更好一些,主要面向 N 卡。CPU 和 Mac 上跑它反而比同档 K-quant 慢,这个后面选型会说。
压缩有多狠:两个真实例子
小模型看 ggml 官方的 Qwen3.5-0.8B-GGUF 仓库:BF16 原始权重 1.5GB,Q8_0 是 830 多 MB,Q4_0 只要 560MB。一个 0.8B 的小模型,不同版本之间能差出 3 倍。
大模型更夸张。还是上面那个 8B,f32(32 位浮点)版本接近 30GB,Q4_K_M 只要 4.6GB 左右,塞进 8GB 显存的显卡里还有富余。
代价呢?量化本质上是有损压缩。社区的经验是 Q8_0 几乎无损;Q6_K 到 Q4_K_M 这几档损失很小,属于放心用的范围;Q3 开始能感觉到模型变笨;Q2 只适合先跑通流程或者极端低配的机器。同一句话在不同量化下回答确实会有差别,正式用之前,拿你自己的提示词各试一次最稳妥。
到底该怎么选
bartowski 是 GGUF 社区最活跃的上传者之一,他每个仓库的 README 里都写了选择建议。我把它总结成三条:
- 不想研究,闭眼选 Q4_K_M 或 Q5_K_M。他的原话翻译过来就是:不想费脑子,就选 K 系列里的 M 档。
- 有独立显卡,想让模型完全塞进显存:选文件大小比显存总量小 1 到 2GB 的量化。8GB 显存就选 6GB 出头的版本。
- 追求最高质量,单靠显存装不下:把内存和显存加在一起算,同样留 1 到 2GB 余量。
还有个省事的办法:LM Studio 会根据你的机器配置推荐合适的量化;Ollama 拉模型时默认也是官方选好的版本。新手跟着默认走,基本不会错。
写在最后
下次再看到 Q4_K_M,你可以直接把它读成"4 bit 量化的 K 系列中档版本",然后该干嘛干嘛。
提醒一句:量化解决的是"跑得动"的问题,不负责"跑得好"。如果你发现本地模型回答质量明显不如网页版,先回头看看自己下的是不是压得太狠的版本,再考虑要不要回到云端 API。
相关阅读:Ollama 本地部署大模型完整教程、LM Studio 实测、本地大模型 vs 云端API怎么选。
你平时跑本地模型用的是哪个量化?评论区聊聊。