兄弟们,昨夜HuggingFace榜单又双叒叁换血了。DeepSeek-Coder V2(236B MoE)以88.4%的HumanEval pass@1直接干翻GPT-4 Turbo和Claude 3.5 Sonnet,而且这成绩还是没开思维链(CoT)裸跑的。
说点干货,这代最大的改动是引入了**稀疏注意力(Sparse Attention)**。官方放出的技术报告里明确写了,在256K token长上下文压力测试下,他们用64K token的Java项目做前缀,然后要求模型补全一个跨文件的Bug修复,准确率比上一代V1提升了31%。最关键的是,它不再像V1那样无脑堆全量KV Cache,而是采用了局部窗口+全局token的混合模式,显存占用直接砍了约40%。
实测下来有个很野的用法:把整个repo的`pom.xml`、`package.json`、`requirements.txt`丢进去,让它自己推理依赖关系,然后生成跨模块的改动代码。V2对依赖图的理解明显比上一代强,生成的代码能直接跑通CI的概率高了不少。
不过也要泼盆冷水,236B MoE的部署门槛不低,单卡A100 80G塞不下全精度,至少要2张卡做张量并行(TP=2)。官方给的量化代码只支持FP8,如果你还在用INT4 AWQ,需要自己手动校准,别无脑套。
完整榜单和模型权重都在HuggingFace上,评论区放链接。有实测过的兄弟,欢迎分享下你们在代码审查和测试生成上的体感差异。 |