硬件入门8 分钟

模型量化入门:Q4/Q5/FP8 与显存质量权衡

用白话解释量化为何省显存、常见位数怎么选、对编码/推理质量的影响与回测方法。

量化是什么

把权重从 16/32 位存成更低位数,用精度换显存与带宽。 本地部署里最常见的是 GGUF 的 Q4/Q5/Q6、GPTQ/AWQ、以及训练/推理侧的 FP8。

怎么选(经验向)

格式显存质量何时用
Q3最低明显损伤只为「塞进去」
Q4_K_M多数场景可接受默认起点
Q5_K_M更稳编码/写作敏感
Q6/Q8接近原版显存充裕
FP16/BF16最高基线微调、严苛评测
FP8中高视内核新架构数据中心推理

质量会坏在哪里

  • 数学、长链路 Agent、复杂重构:对量化更敏感
  • 短指令、分类、摘要:通常更耐量化
  • 不同模型「同 Q4」体感差很多——以你的题库回测为准

回测最小集

  1. 10 条你真实业务 prompt
  2. 固定温度与最大 token
  3. 对比 Q4 vs Q5 的正确率与主观分
  4. 记录 token/s 与显存峰值

和显卡表的关系

显存对照表 的「Q4 约需」是在假设可用量化前提下估算的。 不能量化或许可证禁止时,只能按 FP16 档位选卡。

边界

量化不改变许可证义务;商用前核对模型 License 与出处。

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。