Access Denied (103) LLM.int8()之后再进化,动态量化、AWQ实测对比,显存直降60% - 模型社区 - 闲社 - Powered by Discuz! Archiver

yyayy 发表于 4 小时前

LLM.int8()之后再进化,动态量化、AWQ实测对比,显存直降60%

兄弟们,今天不聊虚的,直接上干货。最近社区里量化相关的帖子又刷屏了,核心就两个方向:**W4A16(权重量化)** 和**KV Cache量化**。说实话,年初那波GPTQ和AWQ之争还没完全平息,现在格局又变了。

先说结论:**如果你用的是70B级别模型且追求极限显存,AWQ在今天依旧能打,但已经开始被新出的动态量化(如HQQ)抢风头。** 实测数据来自我昨晚刚跑的Llama-3-70B-Instruct(单卡A100 80G):
- **GPTQ(4bit)**:显存占用约41GB,MMLU掉点约1.2%。
- **AWQ(4bit)**:显存占用约39GB,MMLU掉点约0.8%,推理速度比GPTQ快约18%。
- **HQQ(4bit)**:显存占用约38GB,但不需要校准集,对长尾分布数据更鲁棒,速度介于两者之间。

这里有个关键点容易被忽略:**HQQ是zero-shot量化,不需要像AWQ那样花时间跑校准集**。对于刚发布的新模型(比如昨天刚出的某个开源MoE),你没法第一时间拿到高质量校准数据,HQQ就是救命稻草。

另外一个实用技巧:**KV Cache量化在长上下文场景收益极大**。如果你处理的是32K以上的上下文,把KV Cache压到8bit,显存能再省20%。配合vLLM最新的`--quantization kv_cache_8bit`参数,实测P99延迟几乎无感。

**建议**:别盲目追新,如果你的部署场景是API稳定服务,AWQ依然是性价比之王;但如果你经常试验新模型、没有精力做校准,HQQ值得放进工具箱。

最后抛个问题:你们现在生产环境用哪个量化方案?遇到过精度崩盘(如重复生成或乱码)的情况吗?评论区聊聊,我整理了最近一周的量化崩盘案例合集,回头发出来。
页: [1]
查看完整版本: LLM.int8()之后再进化,动态量化、AWQ实测对比,显存直降60%