硬件入门约 8 分钟
模型量化入门:Q4/Q5/FP8 与显存质量权衡
用白话解释量化为何省显存、常见位数怎么选、对编码/推理质量的影响与回测方法。

量化是什么
把权重从 16/32 位存成更低位数,用精度换显存与带宽。 本地部署里最常见的是 GGUF 的 Q4/Q5/Q6、GPTQ/AWQ、以及训练/推理侧的 FP8。
怎么选(经验向)
| 格式 | 显存 | 质量 | 何时用 |
|---|---|---|---|
| Q3 | 最低 | 明显损伤 | 只为「塞进去」 |
| Q4_K_M | 低 | 多数场景可接受 | 默认起点 |
| Q5_K_M | 中 | 更稳 | 编码/写作敏感 |
| Q6/Q8 | 高 | 接近原版 | 显存充裕 |
| FP16/BF16 | 最高 | 基线 | 微调、严苛评测 |
| FP8 | 中高 | 视内核 | 新架构数据中心推理 |
质量会坏在哪里
- 数学、长链路 Agent、复杂重构:对量化更敏感
- 短指令、分类、摘要:通常更耐量化
- 不同模型「同 Q4」体感差很多——以你的题库回测为准
回测最小集
- 10 条你真实业务 prompt
- 固定温度与最大 token
- 对比 Q4 vs Q5 的正确率与主观分
- 记录 token/s 与显存峰值
和显卡表的关系
显存对照表 的「Q4 约需」是在假设可用量化前提下估算的。 不能量化或许可证禁止时,只能按 FP16 档位选卡。
边界
量化不改变许可证义务;商用前核对模型 License 与出处。
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。