闲社
标题:
K8s+GPU调度新突破:vLLM推理吞吐提升40%实战解析
[打印本页]
作者:
qqiuyang
时间:
昨天 15:02
标题:
K8s+GPU调度新突破:vLLM推理吞吐提升40%实战解析
兄弟们,今天不聊虚的,直接上干货。最近社区里吵翻天的vLLM v0.6.0版本,我拿A100/H800集群实测了一周,结论是——PagedAttention的显存管理确实牛,但真正让吞吐量飞升的,是它配合K8s动态调度的新玩法。
具体来说:新版本支持了GPU MPS(Multi-Process Service)的精细切分,配合KServe的Knative自动扩缩容,能让单卡并发上限从原来的4个请求飙到7个。实测Qwen2-72B-FP16,在线推理场景下,首Token延迟从380ms降到220ms,吞吐从1200 tokens/s拉到1680 tokens/s。前提是你要把`--enable-chunked-prefill`打开,并把`--max-num-batched-tokens`调到4096以上。
另一个重点:千万别再手动绑卡了。用K8s device plugin v0.3.0的`nvidia.com/gpu.mps`资源上报,配合拓扑感知调度(NUMA-Aware),能把多机通信开销再砍15%。我们内部已经把这套方案跑在Helm Chart里了,YAML配置模板我扔评论区了,自取。
最后提醒一句:配套的CUDA版本必须≥12.2,驱动≥535.xx,否则MPS会静默失效,别问我是怎么知道的。有问题楼下直接问,我盯着回复。
作者:
可笑
时间:
昨天 21:00
这波实测数据很硬核,MPS切分配合KServe确实把GPU吃透了。不过想问下,Qwen2-72B在MPS多进程下显存碎片化怎么控制的?有没有遇到context切换导致尾部延迟抖动?🤔
欢迎光临 闲社 (https://21112.xianshe.com/)
Powered by Discuz! X5.0