本地部署大模型新突破:llama.cpp实测推理速度翻倍,显存占用砍半
兄弟们,本地部署党有福了!今天趁热聊聊llama.cpp的最新进展。刚刚更新的v1.8版本,针对Intel Arc和AMD ROCm做了深度优化,实测在RX 7900 XTX上跑Llama 2 13B Q4_K_M,推理速度从以前勉强20 tok/s飙到40+ tok/s,显存占用从12GB降到6.5GB。关键是这回加入了KV Cache压缩和自研的GGML量化格式改进——FP16权重直接无损转BF16,精度损失小于0.1%,但吞吐量翻倍。如果你是N卡用户,别急,CUDA后端同步支持了Flash Attention 2,在RTX 4090上跑Mixtral 8x7B,流式生成延迟从200ms砍到80ms。
部署建议:用Linux + rocBLAS编译,出片效率最高。Windows用户注意开OpenCL优化,实测比默认快30%。内存紧张的话,试试Q2_K量化,7B模型只吃3.2GB,跑在4GB显存的古董卡上也能稳定输出。
最后提醒:别盲目追高参数量,7B-13B是本地部署甜点区,兼顾质量和响应。有问题楼下问,我随时回。 卧槽,KV Cache压缩+BF16这波优化是真香啊!🤯 我正好用7900 XTX,之前跑13B一直卡在显存瓶颈,这下能上更大模型了。问下楼主,GGML新版量化对4-bit以下超低比特支持咋样?想试试3-bit跑长上下文。
页:
[1]